| 1 | SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models | Junchao Huang, Guian Fang, Shengju Qian +15 | cs.CV | 2026-09-02 |
| 2 | CivBench: A Long-Horizon Benchmark for Tool-Mediated Agents in Civilization VI | Austin Tudor David Andrews, Liam Wilkinson, Jamie Heagerty +3 | cs.AI | 2026-09-02 |
| 3 | APEx: Distillation of Agent Procedural Experience for Adaptive Deep Research Question Answering | Jie Ding, Rui Sun, Xinyuan Zhang +2 | cs.AI | 2026-09-02 |
| #4 | Recursive Value Learning for Long-Horizon Offline Goal-Conditioned RL | Hyeonseong Jeon, Youngwoon Lee | cs.LG | 2026-09-02 |
| #5 | SkillGLoW: Procedural-Family Skill Consolidation for Self-Improving Agents on Long-Horizon Task Streams | Ao Yan, Xin Zhang, Jiawei Du +1 | cs.AI | 2026-09-02 |
| #6 | CHIME: Credit-Aware Hierarchical Memory Evolution for Long-Horizon Agentic Planning | Yongshi Ye, Tian Lan, Feihu Jiang +7 | cs.AI | 2026-09-02 |
| #7 | Act More, Decide Less: Skill-Guided Adaptive Action Chunking for Long-Horizon LLM Agents | Yanting Yang, Can Jin, Jinman Zhao +6 | cs.LG | 2026-09-02 |
| #8 | Parsing the Stream: A Live Trace Model for Long-Horizon Agents and Their Observers | Egor Pakhomov, Erik Nijkamp | cs.AI | 2026-09-01 |
| #9 | EmbodiedSkills: A Unified Framework for Orchestrating, Training, and Deploying VLA Agents | Wei Wang, Wenqiao Zhang, Yutong Lin +14 | cs.RO | 2026-09-01 |
| #10 | Measuring the Behavioral Fidelity of Long-Horizon Human Activity Simulations | Yi Fei Cheng, Fan Yang, Iremsu Bas +3 | cs.AI | 2026-09-01 |
| #11 | Explore More, Drift Less: Outcome-Only Reinforcement Learning Can Suffice for Long-Horizon Interactive Agents | Liming Pu, Xiaoxia Li, Yifu Liu +2 | cs.LG | 2026-09-01 |
| #12 | REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs | Riyaaz Shaik, Chandru Venkataraman | cs.LG | 2026-09-01 |
| #13 | Accelerating Reinforcement Learning via MPC Solver-Gradient Guidance for Weights-varying MPC | Baha Zarrouki, Arslan Thobani, Jasper Hoffmann +6 | cs.RO | 2026-09-01 |
| #14 | ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning | Fanrui Zhang, Ruixue Ding, Qiang Zhang +13 | cs.AI | 2026-09-01 |
| #15 | WorldBench: Culturally Grounded Benchmark for Multilingual Agents | Leonardo Ranaldi, Sherrie Shen, Jushi Kai +1 | cs.AI | 2026-09-01 |
| #16 | Towards Generalizable Visually Grounded Exploration of Household Devices | Linhao Zheng, Zeming Liu, Wangke Chen +4 | cs.AI | 2026-09-01 |
| #17 | Polished but Unresolved: Identifying Late-Stage Pressure States in Long-Horizon Tool-Use Agents | Haoyang Chen, Yi Liu, Jianzhi Shao +3 | cs.AI | 2026-09-01 |
| #18 | ContextPipe: Database-Inspired Context Assembly for Long-Horizon Agents | Peng Xu, Zuyu Zhang, Yuze Sun +3 | cs.AI | 2026-09-01 |
| #19 | Towards a Belief-Based World Model for LLM Agents | Shubham Kumar, Harshit Kumar, Narendra Ahuja +1 | cs.AI | 2026-08-31 |
| #20 | How Fast Do Agents Rot? An Empirical Study of Long-Horizon Degradation in LLM Agents for Production Decision-Making | Shubhra Mittal | physics.soc-ph | 2026-08-31 |
| #21 | ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training | Xionghao Wu, Yijun Yang, Shiyang Zhou +17 | cs.CV | 2026-08-31 |
| #22 | SUN: Persistent Programs For Language-Grounded Control-to-Learning-to-Real Policies | Weiqi Wang, Zhi Li, Yudong Lei +7 | cs.RO | 2026-08-31 |
| #23 | Good Memory Has ECC: Evaluating the Memory of Vision-Language Models Beyond Accuracy | Shmuel Berman, Jia Deng | cs.LG | 2026-08-31 |
| #24 | Reconciling Process Supervision with Outcome-Based Credit in Agentic Policy Optimization | Jingxiao Yang, Wangjie Gan, Yingxuan Zhuang +3 | cs.AI | 2026-08-31 |
| #25 | Safin-1: Safety from Within through Memory-Native State Evolution | Ming Zhang, Kaisen Yang, Shu Yu +15 | cs.LG | 2026-08-31 |
| #26 | E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation | Wei Fan, Xinjie Shen, Xudong Guo +8 | cs.LG | 2026-08-31 |
| #27 | Liquid Gated Attention | Yiheng Jiang, Yuanbo Xu, Yongjian Yang | cs.LG | 2026-08-31 |
| #28 | HiRS-Agent: A Hierarchical Multi-Agent System for Reliable Long-Horizon Remote Sensing Task Solving | Boyang Mu, Zhiwei Wei, Mugen Peng +1 | cs.AI | 2026-08-31 |
| #29 | Season-Aware Hybrid Convolutional-Transformer for Antarctic Sea Ice Concentration Forecasting | Danyang Li, John Taylor, Thang Bui +1 | cs.LG | 2026-08-31 |
| #30 | ScienceArena: Benchmarking LLMs on Latest Scientific Olympiad Competitions | Guangxiang Zhao, Qilong Shi, Xusen Xiao +13 | cs.AI | 2026-08-31 |
| #31 | Scaffolding Foundation Models into Physical-World Agents Pushes the Frontier of Long-Horizon Navigation | Zixing Lei, Gengze Zhou, Xiong-Hui Chen +7 | cs.AI | 2026-08-31 |
| #32 | DASC: Decay-Aware State Compression for Hybrid Linear-Attention Serving | Yanqi Yu, Pingwei Sun, Jianchao Tan +4 | cs.LG | 2026-08-31 |
| #33 | Learning PDE Time-Stepping with Neural Cellular Automata | Esha Saha, Hao Wang | cs.LG | 2026-08-31 |
| #34 | CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents | Amir Saeidi, Zehua Zhang, Rishitosh Singh +6 | cs.CL | 2026-08-31 |
| #35 | Continual Test-Time Adaptation via Entropy Sensitivity-Guidance in Strict Online Setting | Chandler Timm C. Doloriel, Yunbei Zhang, Muhammad Salman Siddiqui +4 | cs.CV | 2026-08-30 |
| #36 | Matrix-Game 3.5: Enhancing Real-Time Streaming Interactive World Models with Patch Memory | Runjia Qian, Zile Wang, Jihai Zhang +14 | cs.CV | 2026-08-30 |
| #37 | When History Is Multimodal: Rethinking Context Management for Long-Horizon Agents | Jiaqi Su, Cong Pang, Jiawei Hong +4 | cs.CL | 2026-08-30 |
| #38 | Sensitivity-Constrained Neural Operators for Data-Efficient Forward and Inverse Modeling of Partial Differential Equation Systems | Abdolmehdi Behroozi, Chaopeng Shen, Daniel Kifer +1 | cs.LG | 2026-08-30 |
| #39 | FRAMEWORKERS: A Dynamic Multi-Agent Framework for AI-Generated Video Production | Zhendong Li, Lei Sun, Letian Shi +8 | cs.AI | 2026-08-30 |
| #40 | Last Step Matters: Early Uncertainty Cannot Predict Failure in Long-Horizon Agents | Zongyue Li, Chengyue Yu, Lei Zang +3 | cs.LG | 2026-08-30 |
| #41 | AgenticRag-R1: Agentic Reinforcement Learning with Stack Memory for Multi-Step Reasoning, Retrieval and Memorizing | Xinke Jiang, Yue Fang, Zhibang Yang +12 | cs.MA | 2026-08-30 |
| #42 | CineForge: Self-Improving Agents for Long-Horizon Video Generation | Junxiang Liu, Lin Wang, Haiyu Shi +10 | cs.CV | 2026-08-30 |
| #43 | Towards Agentic Cloud Engineering: Graph and Loop Engineering with a Zero-Trust Agent Harness | Sagar Srinivas Sakhinana, Venkataramana Runkana | cs.SE | 2026-08-30 |
| #44 | Hindsight Memory-PRM: Supervising Memory Management with Auditable Hindsight Credit | Haoxuan Jia, Yang Liu, Yingguang Yang +14 | cs.CL | 2026-08-30 |
| #45 | Towards a Systems Foundation for Agentic Skills: Architecture, Lifecycle, and Security | Sanket Badhe, Deep Shah, Priyanka Tiwari +1 | cs.AI | 2026-08-30 |
| #46 | FORESIGHT-9: Prospective and Process-Aware Evaluation of Adaptive Trading Agents | Xiangxin Luo, Chengtian Hong, Haohua Li +1 | cs.AI | 2026-08-29 |
| #47 | TRACER: Per-Tool Context Retention for LLM Agents via Consequence-Attributed Reinforcement Learning | Ziqi Lin, Ye Wu, Mengying Yang +4 | cs.AI | 2026-08-29 |
| #48 | APPSolver: Adaptive Patch Partitioning for Point-Wise Ship Flow Prediction on Unstructured Meshes | Wenhua Huo, Fenglei Han, Wangyuan Zhao +4 | cs.AI | 2026-08-29 |
| #49 | APIFlow-Bench: Measuring Whether Agents Survive Long, Dependent API Workflows | Zelin Wan, Arash Nourian, Xiaoxiao Li +2 | cs.AI | 2026-08-29 |
| #50 | CGFM-Nav: Cognitive Graph-Field Memory for Semantic-Guided Lifelong Multimodal Embodied Navigation | Yuxiang Xiao, Xibei Chen, Xin Zhou +3 | cs.RO | 2026-08-29 |