| 1 | Harness Learning Enables Generalizable Test-Time Adaptation | Alvin Zhang, Xuecheng Liu, Zixuan Wang +6 | cs.CL | 2026-09-28 |
| 2 | GPUPhysBench: Benchmarking Coding Agents for Correct and Efficient GPU Physics Simulation | Yuchen Sun, Jinjin He, Sinan Wang +1 | cs.DC | 2026-09-28 |
| 3 | Can LLMs Value the Right Evidence? Evidence-Value Misalignment in Dynamic Medical Diagnosis | Kehua Feng, Yunsheng Lu, Yitong Qiao +5 | cs.CL | 2026-09-28 |
| #4 | SEABench: Benchmarking Endogenous Misalignment In Self-Evolving Agents | Saswat Das, Parvati Viswanathan, Daniel Donnelly +3 | cs.CR | 2026-09-28 |
| #5 | The Compiler May Read It, the Agent May Not: Keeping Part of a Research Code Away from a Coding Agent | Shobhan Roy | cs.CR | 2026-09-28 |
| #6 | RareDx: Controlled Knowledge Integration and Graph-Grounded Policy Optimization for Rare-Disease Diagnosis | Bo Zhang, Yuchen Wang, Dongbai Li +6 | cs.AI | 2026-09-28 |
| #7 | AutoRef: Harness Optimization for Agentic Multi-Reference Image Generation | Yuta Oshima, Ku Onoda, Yusuke Iwasawa +3 | cs.CV | 2026-09-28 |
| #8 | SRHarness: A Harness for Agentic Symbolic Regression | Zihan Yu, Shixuan Zhou, Hao Huang +2 | cs.AI | 2026-09-28 |
| #9 | Planarian: Managing Agent State with Statepoints | Jinnan Guo, Hao Mark Chen, Kapil Vaswani +2 | cs.OS | 2026-09-28 |
| #10 | Collaborative Principle Evolution via Evidence Transfer for Scientific Discovery | Yingming Pu, Hongyu Chen, Tao Lin | cs.LG | 2026-09-28 |
| #11 | EvoIn: Bridging Evolution and Internalization for Agent Fine-Tuning | Shihan Dou, Shaofan Liu, Zhonghang Lu +8 | cs.AI | 2026-09-28 |
| #12 | Towards Reliable AI Data Scientists: Data Agents with Workflow Harnesses | Huachi Zhou, Yujing Zhang, Jiahe Du +7 | cs.AI | 2026-09-28 |
| #13 | From Migration to Calibration: Preserving Agent Capabilities across Models, Jurisdictions, and Scale | Yaxiao Liu, Pengbo Liu, Yiwen Liu +2 | cs.AI | 2026-09-28 |
| #14 | Timeline-Bench: Evaluating Agents on Realistic Video-Editing Tasks, from Raw Footage to Final Cut | Gunin Gupta, Nirmit Arora, Pavan Kalyan Tankala | cs.CV | 2026-09-28 |
| #15 | WebPageBench: Event-Level Verification and Controlled UI-Variant Generation for Web Agents | Anton Emelyanov, Maria Tikhonova, Zaven Martirosian +2 | cs.AI | 2026-09-28 |
| #16 | AX is the New AEO | Ido Finder, Assaf Elovic, Gad Shalev | cs.AI | 2026-09-28 |
| #17 | Audit the Scaffold, Not the Checkpoint: A Stationarity Dichotomy for Recursive Self-Improvement in Agentic Coding | Sebastian Bobadilla-Suarez, Bob Suh, Ryan Fortin | cs.LG | 2026-09-28 |
| #18 | CoSec: Benchmarking Agent Security in Communities | Hao Chen, Wenhui Dong, Ye Chen +12 | cs.CR | 2026-09-28 |
| #19 | A General Harness for Protein Foundation Model Fitness Prediction | Yang Tan, Qijia Tian, Gangyu Sun +5 | cs.AI | 2026-09-28 |
| #20 | Beyond Skill Evolution: Self-Evolving Context Management Policies for Long-Horizon Agent Harnesses | Weiyuan Li, Jinghan Xu, Aili Chen +4 | cs.AI | 2026-09-28 |
| #21 | SEmoEdit: Probing and Harnessing the Editability of Pre-trained Speech Flows | Tianxin Xie, Pengfei Zhang, Kai Jiang +2 | cs.SD | 2026-09-28 |
| #22 | GenMem: Generative Symbolic Memory for Self-Evolving Harness | Xinke Jiang, Tao Feng, Weixuan Xu +7 | cs.LG | 2026-09-28 |
| #23 | M3OS: A Monte Carlo Graph Search-Orchestrated Multi-Agent LLM System for Evidence-Traced Molecular Optimization | Junjie Wang, Yaowei Jin, Ruohui Tang +7 | cs.LG | 2026-09-28 |
| #24 | AgentHop: A Diagnostic Benchmark for Agentic Multi-Hop Scientific Question Answering | Chanhee Park, Jeongho Yoon, Sungbin Han +2 | cs.CL | 2026-09-28 |
| #25 | Marathoner: Ultra-Long-Horizon Autonomous Intelligence | Zhang Ruiyang, Ou Jinpeng, Xie Yifan +4 | cs.CV | 2026-09-28 |
| #26 | When Harness Beats Scale, and When Reading Beats Both | Ivan Bondarenko, Nikolay O. Nikitin | cs.CL | 2026-09-28 |
| #27 | MaLiang-Harness: A Programmable Path to Image and Video Generation | Haoyu Zhao, Zihao Zhang, Xudong Wang +4 | cs.CV | 2026-09-28 |
| #28 | SAGE: Symbolic Action-Gating and Editing for LLM Task Planners | Trung Minh Bui, JongSul Moon, YoungOuk Kim +3 | cs.RO | 2026-09-28 |
| #29 | Certified Multi-Source Integrity for Structured Agent Actions | Anmol Pandey, Aditya Jain, Liang Chen +2 | cs.CR | 2026-09-28 |
| #30 | GlyphBench: A Playground for Language-Model Reinforcement Learning | Roger Creus Castanyer, Marc-Alexandre Côté, Matthew James Sargent +3 | cs.AI | 2026-09-28 |
| #31 | PainterBench: A Figural Divergent-Thinking Benchmark for Tool-Using Language Models | Shane K. A. Dalumura Hettige, Jonas Oppenlaender | cs.AI | 2026-09-28 |
| #32 | Towards Certificate-Driven Software Porting: A Self-Improving Agentic Harness for Scientific Program Optimization | Piyush Jha, Aishik Ghosh, Vijay Ganesh | cs.AI | 2026-09-28 |
| #33 | Opera: A Verbal Critic Framework for Long-horizon Coding Agents | Kai Mei, Zhiyuan Hu, Yutong Dai +7 | cs.CL | 2026-09-27 |
| #34 | Vestrum: Improving Agent Harnesses by Adapting Their Verification, Structure and Memory | Jayant Parashar, Eugene F. Douglass, William C. Bastian +1 | cs.AI | 2026-09-27 |
| #35 | CodeActionBench: Evaluating Agentic Code-as-Policy for Embodied Manipulation | Yiheng Lyu, Xueying Jiang, Wenhao Li +2 | cs.RO | 2026-09-27 |
| #36 | SecProbe: Adaptive Evaluation of Coding Agents on Cybersecurity Vulnerabilities | Xiaonan Luo, Yue Huang, Kehan Guo +9 | cs.CR | 2026-09-27 |
| #37 | AgentBoundary: Counterfactual Evaluation of Safety in Tool-Using LLM Agents | Tianzhuo Yang, Zirui Mi, Yantao Huang +4 | cs.AI | 2026-09-27 |
| #38 | You Only Edit Once: Incentivizing In-Context Capability of LLMs via Local Demonstration Refinement | Jiarong Wen, Qi Wang, Yun Qu +8 | cs.LG | 2026-09-27 |
| #39 | What Happens During Autonomous Deep Research After the User Steps Away? | Yimin Liu, Yijia Zhang, Yanmin Li +4 | cs.AI | 2026-09-27 |
| #40 | Raven: The Harness of Harnesses for Composable Agentic Intelligence | EverMind AI | cs.AI | 2026-09-27 |
| #41 | MetaBench-Harness: Unlocking End-to-End Optimization of Benchmark Harnesses | Xuanjun Chen, Hua-Hsuan Chen, Wei-Chung Lu +3 | cs.AI | 2026-09-27 |
| #42 | Recursive Harness Distillation across Agents for Robot Manipulation | Seungyeon Kim, Junhoo Lee, Minkyu Kim +2 | cs.RO | 2026-09-27 |
| #43 | Long-Horizon Analog Design Bench: Benchmarking Agents on Hours-Long Analog and Mixed-Signal Circuit Design Tasks | Analog Design Bench Team | cs.AI | 2026-09-27 |
| #44 | LiteEvo: Automated, Cost-Efficient Harness Evolution for Generalization to Unseen Tasks | Euntae Choi, Sumin Song, Sungjoo Yoo | cs.AI | 2026-09-27 |
| #45 | Compositional Safety Failures in Harness Evolution: Identification and Runtime Monitoring | Zhixiang Zhang, Zesen Liu, Wai Ip Lai +2 | cs.AI | 2026-09-27 |
| #46 | CARVE: Breaking Data Barriers in Chip Placement by Harnessing Reusable Expertise | Jiefu Zhang, Haixiang Sun, Yang Xu +2 | cs.LG | 2026-09-27 |
| #47 | Agent Safety From Within: Detecting Harmful Trajectories from LLM Internal States | Difan Jiao, Ashton Anderson | cs.AI | 2026-09-27 |
| #48 | Trust and Task Completion in the World of Consumer AI Agents | Jeroen Olieslagers, Eduardo Pujol, Gal Zahavi +2 | cs.AI | 2026-09-26 |
| #49 | TCMQA: A 38K-Question Traditional Chinese Medicine Benchmark with a Licensed-Practitioner Reference | Tzu-Heng Huang, Jet Lin, Eric Lin | cs.CL | 2026-09-26 |
| #50 | Beyond Token Savings: A Systematic Study of Context Compression in LLM Agents | Ritul Satish, Prasoon Sinha, Akiho Kawada +1 | cs.LG | 2026-09-26 |