| 1 | SENTINEL-RL: Offloading Topological Reasoning from LLM Agents in the Security Operations Center | Uday Vallabhaneni, Cassie L. Cagwin, David J. Wild | cs.CR | 2026-09-03 |
| 2 | Unlocking Lossless Speedups in LLMs via Discrete Diffusion | Subham Sekhar Sahoo, Lingjie Chen, Khiem Pham +14 | cs.LG | 2026-09-03 |
| 3 | Headroom-Drift Replay: A Primitive for Principled Replay Control in GRPO | Hyun Bin Park, Du-Seong Chang | cs.LG | 2026-09-03 |
| #4 | Value-Preserving Architectures for Agentic AI Systems | Alessandro Pesare, Tommaso Dolci, Katja Hose +1 | cs.AI | 2026-09-03 |
| #5 | Adapting to Evolving Requirements: Agentic AI for Retail Supply Chain Operations | Lei Zheng, Liping Yang, Zihao Li +3 | cs.AI | 2026-09-03 |
| #6 | DNative-Twin: Decision Graphs and Digital Twins for Reconstructable Agentic Decisions | Junjie Pang, Zhenzhen Xie, Haoke Han +3 | cs.AI | 2026-09-03 |
| #7 | A computable representation of the physical laboratory enables verifiable workflows | Xiaobo Li, Luyao Ge, Xiaohui Li +8 | cs.AI | 2026-09-03 |
| #8 | Making Every Tool Call Count: Necessary Tool-Evidence Path Rewards for Agentic Vision-Language Models | Xingming Long, Yu Liu, Zhiwei Yang +7 | cs.AI | 2026-09-03 |
| #9 | VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement | Wenzhuo Xu, Yuchen Zhu, Chongjian Ge +8 | cs.CV | 2026-09-02 |
| #10 | SLIDEFORGE: An LLM Agent for Controllable Editing of Slides as Structured Artifacts | Haozhen Zheng, Fulin Wang, Tianhu Xiong +6 | cs.CV | 2026-09-02 |
| #11 | Large Language Models (LLMs) for Telecom Root Cause Analysis (RCA): A Structured Reasoning Framework for Evidence-Grounded Diagnosis | Hao Zhou, Mandar Kulkarni, Hao Chen +3 | cs.AI | 2026-09-02 |
| #12 | SafeEvolve: Harness-Policy Co-Evolution from Agent Experience for Safety Alignment | Qinghua Mao, Wanying Qu, Dadi Guo +8 | cs.AI | 2026-09-02 |
| #13 | EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction | Yuling Shi, Zhensu Sun, Junsen Dong +3 | cs.CL | 2026-09-02 |
| #14 | CORAL: An LLM-Native Harness for Production Recommender Systems | Muhammad Rafay Azhar, Yuhang Zhou, Gilbert Jiang +7 | cs.CL | 2026-09-02 |
| #15 | Loom: Weaving Diagnostic Strands into Free-Text Consensus via Embedding-Space Reweighting | Ron Begleiter, Katya Egert Berg, Gilad Saban +1 | cs.AI | 2026-09-02 |
| #16 | Coverage, Not Targeting: A Structural Regime in Multi-Turn Agent Credit Assignment | Chenyu Zhou, Qiliang Jiang, Shuning Wu +1 | cs.LG | 2026-09-02 |
| #17 | PGPO: Potential-Guided Policy Optimization for Multi-Turn Agentic Tasks | Yuyao Zheng, Haipeng Sun, Junwei Bao +4 | cs.AI | 2026-09-02 |
| #18 | When Optimization Becomes Manipulation: Defending Generative Search against Malicious Generative Engine Optimization | Haozhang Li, Yangguang Shao, Xinjie Lin +3 | cs.CR | 2026-09-02 |
| #19 | Git4Data: Database-Native Version Control for AI Agents | Hongshen Gou, Zuyu Zhang, Yuze Sun +4 | cs.DB | 2026-09-02 |
| #20 | MASkills: Continual Skills Optimization for Multi-Agent LLM Systems | Huaiyuan Yao, Xiaoou Liu, Charles Fleming +2 | cs.AI | 2026-09-02 |
| #21 | CHIME: Credit-Aware Hierarchical Memory Evolution for Long-Horizon Agentic Planning | Yongshi Ye, Tian Lan, Feihu Jiang +7 | cs.AI | 2026-09-02 |
| #22 | Belief-Calibrated Optimization: An Explicit World Model for Agentic Optimization | Yuhan Chen, Zhihua Tian, Mahavir Dabas +7 | cs.AI | 2026-09-01 |
| #23 | Zeta-Lite: A Concurrent, Branchable In-Browser SQL Database for Agentic Memory | Gene Zhang | cs.DB | 2026-09-01 |
| #24 | EdiTikZ: Scientific Figure Editing from Revision Trajectories | Christian Greisinger, Zhixue Zhao, Steffen Eger | cs.AI | 2026-09-01 |
| #25 | InSight: A Benchmark for Agentic Claim Verification in Interactive Visualizations | Maeve Hutchinson, Syed Mahbubul Huq, Mohammad Albinhassan +3 | cs.CL | 2026-09-01 |
| #26 | Bandits in Prod: Hyperparameter Optimization at Inference Time | Louis Abraham, Tuan-Anh Nguyen, Nicolas Devatine | cs.LG | 2026-09-01 |
| #27 | Agentic Multimodal Models for Environmental Hyperspectral Unmixing | Michał Cholewa, Luca Ciampi, Nicola Messina +2 | cs.CV | 2026-09-01 |
| #28 | Making Prospective Memory SLM-Shaped: Typed Intention Stores for Small-Model Agents | Jinqing Zhao, Chengcan Wu | cs.AI | 2026-09-01 |
| #29 | What Does an Agentic Software Engineering Benchmark Measure? Profiling Task Demands and Agent Behaviour Beyond What Category Labels Reveal | Radin Shayanfar, Keheliya Gallaba, Ahmed E. Hassan | cs.SE | 2026-09-01 |
| #30 | Explore More, Drift Less: Outcome-Only Reinforcement Learning Can Suffice for Long-Horizon Interactive Agents | Liming Pu, Xiaoxia Li, Yifu Liu +2 | cs.LG | 2026-09-01 |
| #31 | ClinTraceBench: Source-Verifiable Longitudinal Clinical Reasoning over EHR-Derived Dialogues | Huimin Wang, Zhengyi Zhao, Yutian Zhao | cs.CL | 2026-09-01 |
| #32 | ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning | Fanrui Zhang, Ruixue Ding, Qiang Zhang +13 | cs.AI | 2026-09-01 |
| #33 | WorldBench: Culturally Grounded Benchmark for Multilingual Agents | Leonardo Ranaldi, Sherrie Shen, Jushi Kai +1 | cs.AI | 2026-09-01 |
| #34 | AgentFactory: Towards Automated Agentic System Design and Optimization | Enci Zhang, Haofeng Wang, Yuesheng Zhu +2 | cs.AI | 2026-09-01 |
| #35 | FractalNet-Based Heterogeneous Federated Learning for Orbital Edge Intelligence in Satellite Mega-Constellations: A Wildfire Case Study | Sai Puppala, Koushik Sinha | cs.AI | 2026-09-01 |
| #36 | Beyond the Clock: Measuring the Value of Adaptive Revision | Ayushi Chadha | cs.AI | 2026-09-01 |
| #37 | Agentic programs: an emerging form of scientific software in computational materials science | Yunsung Lim, Haekwan Jeon, Jaesun Kim +2 | cond-mat.mtrl-sci | 2026-09-01 |
| #38 | ContextPipe: Database-Inspired Context Assembly for Long-Horizon Agents | Peng Xu, Zuyu Zhang, Yuze Sun +3 | cs.AI | 2026-09-01 |
| #39 | Agentic Empirical Asset Pricing: Methodological Foundations | Yingjian Pan, Xiaowei Ding, Kay Giesecke | cs.AI | 2026-09-01 |
| #40 | SciTrue: Reliable Scientific Claim Validation with Frontier and Open Language Models at the NTCIR SciClaimEval Task | Qiming Bao, Neşet Özkan Tan, Siyuan Wang +1 | cs.AI | 2026-09-01 |
| #41 | DramaChain Bench: An End-to-End Benchmark for Short-Drama Generation | Haoyuan Shi, Mingtao Chen, Shuo Jiang +12 | cs.AI | 2026-09-01 |
| #42 | Are We There Yet? Assessing Computer-Use Agents for Blind Users' Accessible Interaction with Desktop Applications | Satwik Ram Kodandaram, Monalika Padma Reddy, Xiaojun Bi +3 | cs.HC | 2026-09-01 |
| #43 | Context Inference Attacks Without Jailbreaks | Prince Jha, Samuele Poppi, Nils Lukas | cs.CR | 2026-08-31 |
| #44 | RestoreBench: Can AI Agents Restore Power Flow Convergence? | Riccardo Mansutti, Andrea Pomarico, Robert Jakob +3 | cs.AI | 2026-08-31 |
| #45 | FoldingAgent: Inferring Parametric Origami Procedures from Demonstration Videos | Maya Moriya, Sigal Raab, Yael Vinker +1 | cs.CV | 2026-08-31 |
| #46 | How Fast Do Agents Rot? An Empirical Study of Long-Horizon Degradation in LLM Agents for Production Decision-Making | Shubhra Mittal | physics.soc-ph | 2026-08-31 |
| #47 | Deploying and Evaluating a Smart-Agriculture Agentic Engine for Full-Season Soybean Farm Operations | Ao Qu, Panagiotis Michelakis, Linyuan Han +8 | cs.AI | 2026-08-31 |
| #48 | Token-Efficient Data Reasoning Agents via Adaptive Structuring of Unstructured Data | Milad Rezaei Hajidehi, Qitong Wang, Stratos Idreos | cs.AI | 2026-08-31 |
| #49 | Reconciling Process Supervision with Outcome-Based Credit in Agentic Policy Optimization | Jingxiao Yang, Wangjie Gan, Yingxuan Zhuang +3 | cs.AI | 2026-08-31 |
| #50 | Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence | Zhiqin Yang, Jingwen Fu, Yuhan Liu +16 | cs.AI | 2026-08-31 |