PaperScope
LIVE · 2026-09-29 05:40 UTC

harness 22 papers this week · +77% WoW

papers mentioning "harness" in title/abstract · 30d window

Latestcs.CLcs.LGcs.AIcs.CV

Mentions per Day (30d)

Latest Papers

#TitleAuthorsCatDate
1Harness Learning Enables Generalizable Test-Time AdaptationAlvin Zhang, Xuecheng Liu, Zixuan Wang +6cs.CL2026-09-28
2GPUPhysBench: Benchmarking Coding Agents for Correct and Efficient GPU Physics SimulationYuchen Sun, Jinjin He, Sinan Wang +1cs.DC2026-09-28
3Can LLMs Value the Right Evidence? Evidence-Value Misalignment in Dynamic Medical DiagnosisKehua Feng, Yunsheng Lu, Yitong Qiao +5cs.CL2026-09-28
#4SEABench: Benchmarking Endogenous Misalignment In Self-Evolving AgentsSaswat Das, Parvati Viswanathan, Daniel Donnelly +3cs.CR2026-09-28
#5The Compiler May Read It, the Agent May Not: Keeping Part of a Research Code Away from a Coding AgentShobhan Roycs.CR2026-09-28
#6RareDx: Controlled Knowledge Integration and Graph-Grounded Policy Optimization for Rare-Disease DiagnosisBo Zhang, Yuchen Wang, Dongbai Li +6cs.AI2026-09-28
#7AutoRef: Harness Optimization for Agentic Multi-Reference Image GenerationYuta Oshima, Ku Onoda, Yusuke Iwasawa +3cs.CV2026-09-28
#8SRHarness: A Harness for Agentic Symbolic RegressionZihan Yu, Shixuan Zhou, Hao Huang +2cs.AI2026-09-28
#9Planarian: Managing Agent State with StatepointsJinnan Guo, Hao Mark Chen, Kapil Vaswani +2cs.OS2026-09-28
#10Collaborative Principle Evolution via Evidence Transfer for Scientific DiscoveryYingming Pu, Hongyu Chen, Tao Lincs.LG2026-09-28
#11EvoIn: Bridging Evolution and Internalization for Agent Fine-TuningShihan Dou, Shaofan Liu, Zhonghang Lu +8cs.AI2026-09-28
#12Towards Reliable AI Data Scientists: Data Agents with Workflow HarnessesHuachi Zhou, Yujing Zhang, Jiahe Du +7cs.AI2026-09-28
#13From Migration to Calibration: Preserving Agent Capabilities across Models, Jurisdictions, and ScaleYaxiao Liu, Pengbo Liu, Yiwen Liu +2cs.AI2026-09-28
#14Timeline-Bench: Evaluating Agents on Realistic Video-Editing Tasks, from Raw Footage to Final CutGunin Gupta, Nirmit Arora, Pavan Kalyan Tankalacs.CV2026-09-28
#15WebPageBench: Event-Level Verification and Controlled UI-Variant Generation for Web AgentsAnton Emelyanov, Maria Tikhonova, Zaven Martirosian +2cs.AI2026-09-28
#16AX is the New AEOIdo Finder, Assaf Elovic, Gad Shalevcs.AI2026-09-28
#17Audit the Scaffold, Not the Checkpoint: A Stationarity Dichotomy for Recursive Self-Improvement in Agentic CodingSebastian Bobadilla-Suarez, Bob Suh, Ryan Fortincs.LG2026-09-28
#18CoSec: Benchmarking Agent Security in CommunitiesHao Chen, Wenhui Dong, Ye Chen +12cs.CR2026-09-28
#19A General Harness for Protein Foundation Model Fitness PredictionYang Tan, Qijia Tian, Gangyu Sun +5cs.AI2026-09-28
#20Beyond Skill Evolution: Self-Evolving Context Management Policies for Long-Horizon Agent HarnessesWeiyuan Li, Jinghan Xu, Aili Chen +4cs.AI2026-09-28
#21SEmoEdit: Probing and Harnessing the Editability of Pre-trained Speech FlowsTianxin Xie, Pengfei Zhang, Kai Jiang +2cs.SD2026-09-28
#22GenMem: Generative Symbolic Memory for Self-Evolving HarnessXinke Jiang, Tao Feng, Weixuan Xu +7cs.LG2026-09-28
#23M3OS: A Monte Carlo Graph Search-Orchestrated Multi-Agent LLM System for Evidence-Traced Molecular OptimizationJunjie Wang, Yaowei Jin, Ruohui Tang +7cs.LG2026-09-28
#24AgentHop: A Diagnostic Benchmark for Agentic Multi-Hop Scientific Question AnsweringChanhee Park, Jeongho Yoon, Sungbin Han +2cs.CL2026-09-28
#25Marathoner: Ultra-Long-Horizon Autonomous IntelligenceZhang Ruiyang, Ou Jinpeng, Xie Yifan +4cs.CV2026-09-28
#26When Harness Beats Scale, and When Reading Beats BothIvan Bondarenko, Nikolay O. Nikitincs.CL2026-09-28
#27MaLiang-Harness: A Programmable Path to Image and Video GenerationHaoyu Zhao, Zihao Zhang, Xudong Wang +4cs.CV2026-09-28
#28SAGE: Symbolic Action-Gating and Editing for LLM Task PlannersTrung Minh Bui, JongSul Moon, YoungOuk Kim +3cs.RO2026-09-28
#29Certified Multi-Source Integrity for Structured Agent ActionsAnmol Pandey, Aditya Jain, Liang Chen +2cs.CR2026-09-28
#30GlyphBench: A Playground for Language-Model Reinforcement LearningRoger Creus Castanyer, Marc-Alexandre Côté, Matthew James Sargent +3cs.AI2026-09-28
#31PainterBench: A Figural Divergent-Thinking Benchmark for Tool-Using Language ModelsShane K. A. Dalumura Hettige, Jonas Oppenlaendercs.AI2026-09-28
#32Towards Certificate-Driven Software Porting: A Self-Improving Agentic Harness for Scientific Program OptimizationPiyush Jha, Aishik Ghosh, Vijay Ganeshcs.AI2026-09-28
#33Opera: A Verbal Critic Framework for Long-horizon Coding AgentsKai Mei, Zhiyuan Hu, Yutong Dai +7cs.CL2026-09-27
#34Vestrum: Improving Agent Harnesses by Adapting Their Verification, Structure and MemoryJayant Parashar, Eugene F. Douglass, William C. Bastian +1cs.AI2026-09-27
#35CodeActionBench: Evaluating Agentic Code-as-Policy for Embodied ManipulationYiheng Lyu, Xueying Jiang, Wenhao Li +2cs.RO2026-09-27
#36SecProbe: Adaptive Evaluation of Coding Agents on Cybersecurity VulnerabilitiesXiaonan Luo, Yue Huang, Kehan Guo +9cs.CR2026-09-27
#37AgentBoundary: Counterfactual Evaluation of Safety in Tool-Using LLM AgentsTianzhuo Yang, Zirui Mi, Yantao Huang +4cs.AI2026-09-27
#38You Only Edit Once: Incentivizing In-Context Capability of LLMs via Local Demonstration RefinementJiarong Wen, Qi Wang, Yun Qu +8cs.LG2026-09-27
#39What Happens During Autonomous Deep Research After the User Steps Away?Yimin Liu, Yijia Zhang, Yanmin Li +4cs.AI2026-09-27
#40Raven: The Harness of Harnesses for Composable Agentic IntelligenceEverMind AIcs.AI2026-09-27
#41MetaBench-Harness: Unlocking End-to-End Optimization of Benchmark HarnessesXuanjun Chen, Hua-Hsuan Chen, Wei-Chung Lu +3cs.AI2026-09-27
#42Recursive Harness Distillation across Agents for Robot ManipulationSeungyeon Kim, Junhoo Lee, Minkyu Kim +2cs.RO2026-09-27
#43Long-Horizon Analog Design Bench: Benchmarking Agents on Hours-Long Analog and Mixed-Signal Circuit Design TasksAnalog Design Bench Teamcs.AI2026-09-27
#44LiteEvo: Automated, Cost-Efficient Harness Evolution for Generalization to Unseen TasksEuntae Choi, Sumin Song, Sungjoo Yoocs.AI2026-09-27
#45Compositional Safety Failures in Harness Evolution: Identification and Runtime MonitoringZhixiang Zhang, Zesen Liu, Wai Ip Lai +2cs.AI2026-09-27
#46CARVE: Breaking Data Barriers in Chip Placement by Harnessing Reusable ExpertiseJiefu Zhang, Haixiang Sun, Yang Xu +2cs.LG2026-09-27
#47Agent Safety From Within: Detecting Harmful Trajectories from LLM Internal StatesDifan Jiao, Ashton Andersoncs.AI2026-09-27
#48Trust and Task Completion in the World of Consumer AI AgentsJeroen Olieslagers, Eduardo Pujol, Gal Zahavi +2cs.AI2026-09-26
#49TCMQA: A 38K-Question Traditional Chinese Medicine Benchmark with a Licensed-Practitioner ReferenceTzu-Heng Huang, Jet Lin, Eric Lincs.CL2026-09-26
#50Beyond Token Savings: A Systematic Study of Context Compression in LLM AgentsRitul Satish, Prasoon Sinha, Akiho Kawada +1cs.LG2026-09-26

all trends · matching is case-insensitive substring after tokenization