| 1 | DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training | Shubham Gandhi, Saurabh Goyal, Kiran Kate +1 | cs.AI | 2026-09-03 |
| 2 | CHIME: Credit-Aware Hierarchical Memory Evolution for Long-Horizon Agentic Planning | Yongshi Ye, Tian Lan, Feihu Jiang +7 | cs.AI | 2026-09-02 |
| 3 | Parsing the Stream: A Live Trace Model for Long-Horizon Agents and Their Observers | Egor Pakhomov, Erik Nijkamp | cs.AI | 2026-09-01 |
| #4 | ContextPipe: Database-Inspired Context Assembly for Long-Horizon Agents | Peng Xu, Zuyu Zhang, Yuze Sun +3 | cs.AI | 2026-09-01 |
| #5 | E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation | Wei Fan, Xinjie Shen, Xudong Guo +8 | cs.LG | 2026-08-31 |
| #6 | When History Is Multimodal: Rethinking Context Management for Long-Horizon Agents | Jiaqi Su, Cong Pang, Jiawei Hong +4 | cs.CL | 2026-08-30 |
| #7 | Last Step Matters: Early Uncertainty Cannot Predict Failure in Long-Horizon Agents | Zongyue Li, Chengyue Yu, Lei Zang +3 | cs.LG | 2026-08-30 |
| #8 | ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL | Zhuoshi Pan, Qizhi Pei, Junru Lu +4 | cs.CL | 2026-08-28 |
| #9 | PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents | Yang Xiao, Yusong Sun, Haoyi Wu +7 | cs.AI | 2026-08-27 |
| #10 | SKILL.state: Scalable Long-Horizon Agent Skills | Sanket Badhe, Priyanka Tiwari, Jonghyun Chung | cs.AI | 2026-08-26 |
| #11 | Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses | Zhaochen Yu, Yingcheng Wu, Zhenfei Yin +5 | cs.AI | 2026-08-25 |
| #12 | SRPO: Self-Reflective Policy Optimization for Long-Horizon Reasoning | Jialong Liu, Yuling Shi, Ning Yang +2 | cs.AI | 2026-08-24 |
| #13 | Agent-G$^2$: Gaussian Guidance for Agentic Reinforcement Learning | Zixuan Wang, Yanrui Miao, Zhengxi Lu +6 | cs.AI | 2026-08-24 |
| #14 | HERO: Human-profile Enhanced Retrieval Optimization Framework for Long-term Agent Memory | Yuanhua Lin, Yile Li, Zhiyuan Zhao +2 | cs.AI | 2026-08-23 |
| #15 | Read Less, Solve More: Token-Efficient Sparse Reading for AI Agents | Zedong Liu, Jiaan Wu, Xinyang Ma +5 | cs.AI | 2026-08-23 |
| #16 | ECHO: A Cognitively Inspired, Auditable Memory Plane for Long-Horizon Agents | Yu Qian, Hong Miao, Boyang Guo +5 | cs.AI | 2026-08-22 |
| #17 | Context as an Environment: Programmatic Context Management for Long-Horizon Agents | Yin Lin, Elaine Ang, Erkang Zhu +2 | cs.AI | 2026-08-21 |
| #18 | AsmEvo: Agentic Assembly-Level Optimization of AMD GPU Kernels with Functional Equivalence Verification | Ji Liu, Puyuan Yang, Rongzhang Zheng +18 | cs.CL | 2026-08-21 |
| #19 | Weighted Memory Tree: Remembering What Matters for Long-Horizon LLM Agents | Quang Dao, Purvi Kathalkar, Kenneth Eaton | cs.AI | 2026-08-21 |
| #20 | MileGPO: Milestone Inference with Local Evidence for Graph-Based Policy Optimization of Long-Horizon LLM Agents | Bo Qian, Yuting Wu, Shuang Zeng +3 | cs.LG | 2026-08-20 |
| #21 | SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents | Qingyao Li, Wenxiang Jiao, Shuai Shao +6 | cs.AI | 2026-08-19 |
| #22 | Beyond Suspicious Steps: Ontological Trust in Long-Horizon Agents | An He, Yao Wang, Haibin Zhang | cs.AI | 2026-08-18 |
| #23 | Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements | Zhi Zheng, Rongsheng Chen, Yunpeng Ba +3 | cs.LG | 2026-08-18 |
| #24 | ClawGym II: Exploring Black-Box RL on Agent Harness | Huatong Song, Fei Bai, Ming Yang +17 | cs.CL | 2026-08-17 |
| #25 | Ventor-QTest: Threat-Model-Driven Verification of Vendor-Hosted LLM APIs | Xiangfan Wu, Zonghao Ying, Huiyu Wu +4 | cs.CR | 2026-08-17 |
| #26 | Mint-Agent: Introducing Finance-Native Agentic Foundation Models | Mint-Agent Team, Kun Wang, Gavin Zhang +7 | cs.CL | 2026-08-17 |
| #27 | AstronOS: A Unified Execution Model and Runtime for Long-Horizon Agentic Systems | Zhenhang Nie, Gui Zheng, Xudong Sun +2 | cs.AI | 2026-08-17 |
| #28 | BaT: Towards Self-Evolving Medical Research Agent with Stage Rubrics | Junqi Liu, Yufan He, Yexiao He +9 | cs.AI | 2026-08-17 |
| #29 | HyMem: Hierarchical Context Management for Long-Horizon Agents via Information Isolation | XinQi Wang, Jinwei Xiao, Sijia Cui +4 | cs.AI | 2026-08-16 |
| #30 | LongRCA Bench: Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures | Yunfei Zhang, Boyu Feng, Changhua Pei +14 | cs.AI | 2026-08-15 |
| #31 | StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling | Ziheng Qin, Yaxin Lu, Zhangyang Atlas Wang +1 | cs.AI | 2026-08-15 |
| #32 | JarvisBench: Always-on Intelligence Between Humans and Agents | Chen Chen, Zhehuai Chen | cs.AI | 2026-08-14 |
| #33 | ScienceFlow: A long-horizon agent for ML research, scientific discovery and beyond | Mingming Zhao, Jiqian Dong, Kangping Xu +16 | cs.AI | 2026-08-14 |
| #34 | AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design | Yaxin Luo, Haobin Jiang, Jialv Zou +11 | cs.CV | 2026-08-13 |
| #35 | Beyond Retrieval: Query-Conditioned Reuse of Long-Horizon Agent Trajectories | Yifei Li, Heng Wang, Lingling Zhang +5 | cs.AI | 2026-08-13 |
| #36 | EgoCITE: Context-Augmented Indexing and Time-Aware Retrieval for Long-Horizon Egocentric Memory | Le Zhang, Hao Chen, Vlad Roznyatovskiy +2 | cs.CV | 2026-08-12 |
| #37 | Governed Persistent Memory: Source-Bound State Semantics and Fail-Closed Release for Long-Horizon Agents | Guodong Xu | cs.AI | 2026-08-12 |
| #38 | Deployment Decision Reliability: A Generalizability-Theory Framework for Sizing Long-Horizon Agent Evaluations | Vasundra Srinivasan | cs.AI | 2026-08-11 |
| #39 | Efficient Reinforcement Learning for Long-Horizon Tool-Use Agentic Tasks | Zelei Cheng, Amritansh Mishra, Sambit Sahu +1 | cs.LG | 2026-08-11 |
| #40 | MESA:Task-Adaptive Multi-Structure Evidence Selection for Long-Horizon Agent Memory | Beidi Zhao, Yaoqi Chen, Yuru Feng +10 | cs.AI | 2026-08-10 |
| #41 | Motif 3: Technical Report | Junghwan Lim, Joon Son Chung, Sungmin Lee +24 | cs.AI | 2026-08-10 |
| #42 | Not Worth Another Token: Marginal Value Estimation for Efficient Deep Research Agents | Harshitha Kolukuluru, Reshma Ashok, Kirat Arora +7 | cs.AI | 2026-08-09 |
| #43 | Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning | Yifu Huo, Shunjie Xing, Chenglong Wang +8 | cs.LG | 2026-08-08 |