PaperScope
LIVE · 2026-09-21 05:40 UTC

vision-language-action 12 papers this week · +117% WoW

papers mentioning "vision-language-action" in title/abstract · 30d window

Latestcs.CLcs.LGcs.AIcs.CV

Mentions per Day (30d)

Latest Papers

#TitleAuthorsCatDate
1PRIME: Perception Feedback with Situational Memory Embeddings in VLA ModelsErik Deinzer, Naya Baslan, Luca Paparusso +3cs.CV2026-09-18
2GALA: Geometry-Aware Latent Action Modeling for Vision-Language-Action Model Pretraining across EmbodimentsYichen Liu, Puzhen Yuan, Xiang Zhu +2cs.RO2026-09-18
3ZYT-World: A Real-Time Controllable World Model for Closed-Loop Autonomous-Driving SimulationBoni Hu, Xiong Wei, Haoming Huang +19cs.CV2026-09-18
#4Outcome-Conditioned End-Effector Geometry Across Vision-Language-Action PoliciesXingyu Lin, Zhuang Li, Zhongrun Wu +2cs.RO2026-09-18
#5SynthDemo-RL: Breaking the Zero-Reward Barrier in VLA Adaptation with LLM-Guided Synthetic DemonstrationsHiroaki Kingetsu, Hiroaki Kurihara, Kaoru Yokoo +2cs.RO2026-09-18
#6VLA-Scope: Shift-Aware Failure Prediction for Vision-Language-Action ModelsKaiwen Zhu, Dongfang Liu, Liangkai Liucs.RO2026-09-18
#7FOCAL-VLA: Subtask-Guided Geometry Distillation and Implicit World Modeling for Vision-Language-Action ModelsZhiyuan Gao, Di Wen, Yanxiang Zhan +4cs.RO2026-09-18
#8Fewer Steps, Better Actions: Rethinking Flow-Matching Inference for VLA PoliciesZhipeng Tang, Xinda Chen, Weining Rao +5cs.RO2026-09-18
#9GeoAAC: Geometry-Based Adaptive Action Chunking from Denoising Trajectories in VLA PoliciesXin Chen, Sen Chen, Yujuan Ding +5cs.RO2026-09-17
#10HIL-UMI: Bringing Human-in-the-Loop Post-Training of Vision-Language-Action Models to Universal Manipulation InterfaceZimu Han, Yiming Zeng, Jiyao Zhang +9cs.RO2026-09-17
#11Uni-LaDiR: Latent Diffusion Unifies Multimodal ReasoningHaoqiang Kang, Yizhe Zhang, Nikki Lijing Kuang +2cs.LG2026-09-17
#12Beyond Patch Removal: Persistent Adversarial Effects in Vision-Language-Action PoliciesEnhao Wu, Fusen Guo, Yuxin Cao +3cs.CV2026-09-17
#13rMuscle: Robotic Muscle Memory for Efficient Vision-Language-Action Model InferenceKaijun Zhou, Zhiyang Li, Le Chen +1cs.RO2026-09-16
#14FIVE-VLA: Fast and EffectIVE Autonomous Driving with Recurrent Action MemoryKemal Oksuz, Alexandru Buburuzan, Yuhan Yao +1cs.CV2026-09-16
#15ActiveScale: Scaling Active Perception for Robots across Model, Data, and HardwareShuai Zhou, Kaisheng Pang, Wenxuan Song +3cs.RO2026-09-16
#16ActionPiece: Rethinking Action Tokenization for Autoregressive Vision-Language-Action ModelsShijie Lian, Bin Yu, Zhaolong Shen +5cs.RO2026-09-16
#17WetRobo: A Reproducible Robot Kit for Coding Agents in Biological LaboratoriesYuna Oikawa, Kei Endo, Takanori Uzawa +5cs.AI2026-09-16
#18${M}^2$Tok: Multi-head Multi-codebook Discrete Action Tokenization for Vision-Language-Action ModelsChunpu Xu, Zhixuan Liang, Yuhao Zhang +6cs.RO2026-09-16
#19Acting in Meters: Learning Metric Interactions for Precise Robotic ManipulationLijie Wang, Zheng Lu, Yiming Wang +12cs.RO2026-09-16
#20Reinforcement Learning for Real-Time Vision-Language-Action PoliciesPerry Dong, Kuo-Han Hung, Dorsa Sadigh +1cs.RO2026-09-16
#21Not All Layers Need Tuning: Diagnosing and Directing Adaptation in Vision-Language-Action ModelsShahram Najam Syed, Arthur Jakobsson, Prayuj Sachdev +1cs.RO2026-09-16
#22FluxVLA Engine: A One-Stop VLA Engineering Platform for Embodied IntelligenceYinhao Li, Weixin Mao, Zihan Lan +21cs.RO2026-09-15
#23Intrinsic Robot Rewarding: Reusing VLA Representations for Autonomous Evaluation and Policy ImprovementTobias Schaffer, Mohab Elkhayat, Daniela Nicklas +2cs.RO2026-09-15
#24sensVLA: Spatially-Grounded Vision-Language-Action Model for Autonomous Wheel LoaderGopi Krishna Erabati, Bjarne Johannsen, Angus Stewart +1cs.CV2026-09-15
#25TEMPO: Learning Temporal Context for Dynamic Robot ManipulationZhenyang Feng, Jimin Heo, Erik B. Sudderth +1cs.RO2026-09-15
#26GRAVA: Grounded Reasoning-to-Action Representation and Learning for Autonomous DrivingXiao Liu, Haoyu Li, Jianghao Leng +2cs.CV2026-09-14
#27IMPACT-VLA: Interaction-aware Multimodal Propagation Attribution via Counterfactual Trajectories for Vision-Language-Action PoliciesJinwoong Kim, Sangjin Parkcs.RO2026-09-14
#28When Faster VLA Deployment Changes Closed-Loop Behavior: Task Success-Latency Analysis of SmolVLA Across PyTorch and ONNX VariantsRafiqul Islamcs.RO2026-09-12
#29What Makes an Efficient VLA? Navigating Action-Head Design, Scaling, and LatencyLuoyang Sun, Guoyang Xia, Fengfa Li +9cs.RO2026-09-12
#30ReWeight: Leveraging Human Data for VLA Post-Training via Demonstration Retrieval and Sample WeightingChenwei Wang, Dianye Huang, Match W. L. Ko +2cs.RO2026-09-12
#31ActSafeGuard: Differentiable and Training-Aligned Constraint Enforcement for Flow-Matching PoliciesJianming Ma, Rongjun Jin, Xiaxi Si +3cs.RO2026-09-10
#32Your Model Already Knows Don't Teach It, Learn to Ask It: Soft Prompting for Few-Shot Adaptation of Vision-Language ModelsGautam Rajendrakumar Gare, Siyi Li, Hewei Wang +5cs.CV2026-09-10
#33IMLE-VLA: Fast Single-Step Action Generation for Vision-Language-Action PoliciesKian Hosseinkhani, Qinhe Peng, George Shramko +6cs.RO2026-09-10
#34HuRo: Robotizing Human Videos for Scalable VLA PretrainingJinho Jeong, Se June Joo, Jaehyun Kang +4cs.RO2026-09-09
#35Time-Frequency Geometric Cross-Attention for Chunked Vision-Language-Action ModelsShengye Dong, Haochen Niu, Hao Liu +3cs.AI2026-09-09
#36Modality-Decoupled Federated Learning for Privacy-Preserving Embodied Intelligence in 6GZhuodong Liu, Xiangyu Li, Chunhong Yuan +5eess.SP2026-09-09
#37TANGO: Humanoid Navigation in Cluttered Environments with a Whole-Body Vision-Language-Action ModelAnqi Li, Yuxin Chen, Zhaobo Li +4cs.RO2026-09-08
#38DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-ImaginationYankai Fu, Ning Chen, Junkai Zhao +5cs.RO2026-09-08
#39No Free Checker: A Survey of Verifiers for Robot PoliciesYang Wan, Xihang Yue, Zhirui Liu +7cs.RO2026-09-08
#40WorldAgen: Unified State-Action Prediction with Test-Time World Model TrainingChi Wan, Kangrui Wang, Yuan Si +2cs.AI2026-09-08
#41Measuring Language Transfer in Robot Policies: Adding Greek to a Cosmos3 Vision-Language-Action PolicyAyoub Kirouane, Georgios Giaples, Christos Petrocheiloscs.RO2026-09-07
#42Large Discrete Policy: Advancing Explicit Behavior Modeling with Stochastic Iterative ScoringZhenxin Li, Nadine Chang, Xinglong Sun +8cs.RO2026-09-07
#43MEMOBench: A Process Level Memory Benchmark for Robotic ManipulationHaiyang Sun, Haoxiao Wang, Junming Chen +6cs.RO2026-09-07
#44GIFT: Goal-Injected Fine-Tuning for Efficient Manipulation Policy AdaptationXiaoyuan Fang, Shuo Feng, Yuxuan Wang +3cs.CV2026-09-07
#45Learning to Use Imagination: Progress-Conditioned Future Utilization for World Action ModelsYijie Zhu, Zitong Yu, Wei Li +4cs.CV2026-09-06
#46What Matters, When? Diagnosing and Improving Conditional Visual Grounding in Visuomotor Imitation PoliciesVivek Chavan, Pengtao Xie, Yahuan Shi +3cs.RO2026-09-04
#47Towards Neuro-Symbolic Procedural Reasoning for Long-Horizon Vision-Language-Action ManipulationVivek Chavan, Yahuan Shi, Oliver Heimann +2cs.RO2026-09-04
#48RoboSPA: Can VLA Models Go Beyond Simple Scenes and Short-Horizon Tasks?Zhenxuan Fan, Bo Zhang, Yutong Lin +9cs.RO2026-09-04
#49Continuous Actions from Discrete Minds: Latent-Aligned Planning for End-to-End Autonomous DrivingRuoyu Yao, Yusen Xie, Qingzhao Liu +5cs.CV2026-09-03
#50FWBC-VLA: Force-Aware Whole-Body Compensation for Contact-Rich Loco-ManipulationYutian Zhang, Siyuan Ma, Liwen Yang +6cs.RO2026-09-03

all trends · matching is case-insensitive substring after tokenization