| 1 | Pretraining Latent Information Feedback Transformers with Teacher Supervision | Dor Tirosh, Ido Amos, Mor Geva | cs.CL | 2026-09-29 |
| 2 | Learning Meta-Skills for Agent Harness Design in Test-Time AI4AI | Cheng Qian, Kunlun Zhu, Beibin Li +2 | cs.AI | 2026-09-29 |
| 3 | AdviSD: Learning to Advise Frontier LLMs via Targeted Multi-Turn Self-Distillation | Rishabh Agrawal, Hejie Cui, Shasha Li +2 | cs.AI | 2026-09-29 |
| #4 | Stochastic World Models for Verifying Vision-Based Neural Feedback Systems | I. Samuel Akinwande, Mykel J. Kochenderfer, Clark Barrett | cs.AI | 2026-09-29 |
| #5 | RS-OPSD: Reliable Privileged On-Policy-Self-Distillation for Ultra-High-Resolution Remote Sensing VQA | Chengjie Jiang, Yunqi Zhou, Jiafeng Yan +3 | cs.CV | 2026-09-29 |
| #6 | EVO-WAM: Evolving World Action Models through Video-Action Verification | Shiyang Zhou, Xionghao Wu, Wenbo Li +11 | cs.CV | 2026-09-29 |
| #7 | Retrieval-Augmented Skill Optimization via Cross-Harness Adaptation | Jaewon Chu, Ji Soo Lee, Jihwan Park +8 | cs.AI | 2026-09-29 |
| #8 | TabFM-Auto: Self-Evolving Pipelines for Tabular Foundation Models | Deqing Fu, Huangyuan Su, Rajat Sen +4 | cs.LG | 2026-09-29 |
| #9 | PhysWAM: Physically Consistent World Action Model for Autonomous Driving | Dhruv Parikh, Fengcheng Yu, Quankai Gao +11 | cs.RO | 2026-09-29 |
| #10 | Learning When to Update: A Near-Optimal Timing Bandit Approach | Qiulin Lin, Junyan Su, Liyuan Wang +1 | cs.LG | 2026-09-29 |
| #11 | You Cannot Pick a Provider From the Price List: Market-Aware Routing for Open-Weight LLM Inference | Liang He, Jingbo Wen, Yixiong Chen +4 | cs.AI | 2026-09-29 |
| #12 | Mixture of Self-Improving Branches For Agent Harness Optimization | Haoyu Dong, Yuhang Zhou, Zihao Lin +6 | cs.AI | 2026-09-29 |
| #13 | ReCaVSR: One-Step Streaming Diffusion Video Super-Resolution with Recycled Latents and Learned Cache Routing | Xijun Wang, Xin Li, Suhang Yao +3 | cs.CV | 2026-09-29 |
| #14 | Explore, Execute, Evolve: A Skill Acquisition and Reuse Loop for Embodied Agents | Sicheng Xie, Yitong Chen, Haidong Cao +3 | cs.RO | 2026-09-29 |
| #15 | Feedback-Calibrated Protein Optimization with Batch-Aligned Tail Arbitration | Zefeng Lin, Xianyong Fang, Tianfan Fu +1 | cs.LG | 2026-09-29 |
| #16 | Challenges and Solutions for Bandits in the Wild: Warm-Started Mixture Bandits for Cross-Cohort Slate Recommendation | Serafima Lebedeva, Sumantrak Mukherjee, Ali Arshad Sadal +8 | cs.LG | 2026-09-29 |
| #17 | Learning from Shared-Control Overrides: Context-Driven Acceleration Profile Prediction for Personalized Overtaking | Ruizheng Xu, Lounis Adouane, Javier Ibañez-Guzmán +1 | cs.AI | 2026-09-29 |
| #18 | KUPAS MASTER: Distilling the Tacit Expertise of Master Practitioners into Agent-Ready Experience Corpora | Changmian Wang, Yuchao Ma, Xuchao Lu +13 | cs.AI | 2026-09-29 |
| #19 | EnterpriseBench: Benchmarking LLM Agents on Enterprise-Level Strategic Reasoning and Decision-Making | Min Yang, Yichen Pan, Jinghua Piao +3 | cs.AI | 2026-09-29 |
| #20 | RLTL;DR: Self-improvement by Internalizing Self-generated Feedback | Michael Kirchhof, Eleonora Gualdoni, Andrew Szot +6 | cs.LG | 2026-09-29 |
| #21 | AS$^2$D: Accelerating On-Demand Audio Understanding on Mobile Devices | Yunzhe Li, Kyoungjun Park, Hongzi Zhu +1 | cs.SD | 2026-09-29 |
| #22 | Credit-Guided Policy Improvement for Test-time Adaptive Vision-Language Navigation | Yang Li, Sijia Zhang, Yihan Li +4 | cs.RO | 2026-09-29 |
| #23 | Evaluating the Evaluators: Diagnosing Large Multimodal Models for AI-Generated Image Assessment | Yu Zhao, Jiarui Wang, Huiyu Duan +5 | cs.CV | 2026-09-29 |
| #24 | Decompose Radicals, Then Reward: Fine-Grained Inspection for Accurate Chinese Text Rendering | Yazhen Xie, Xingsong Ye, Zhineng Chen | cs.CV | 2026-09-29 |
| #25 | How Can Recommendation Feedback Evolve Agent Memory? | Shanwen Mao, Mingming Li, Hao Zhang +4 | cs.AI | 2026-09-29 |
| #26 | Graph-Conditioned On-Policy Agent Distillation from Off-the-Shelf Teachers | Xiaohan Yi, Wen Luo, Yani Huang +4 | cs.LG | 2026-09-29 |
| #27 | From Dissonance to Orchestration: Teacher Intervention in On-Policy Distillation | Yuhao Wang, Ruiyang Ren, Yinan Zhang +3 | cs.CL | 2026-09-29 |
| #28 | Routing Should Pay for Itself: Sparse Supervision for Economical LLM Routing | Guannan Lai, Gelin Bian, Hao-Xuan Ma +5 | cs.AI | 2026-09-29 |
| #29 | Rethinking Soft Tokens for Parallel Decoding in Diffusion Language Models | Kodai Kawamura, Kenji Kawaguchi, Anji Liu | cs.LG | 2026-09-29 |
| #30 | Beyond Prompt Count: How Data Shapes Transfer in On-Policy Distillation | Jiaxuan Wang, Jiafei Lyu, Yuchen Cai +8 | cs.AI | 2026-09-29 |
| #31 | Teaching LLMs to Generate Challenging MILP Instances via Solver Feedback | Jitin Singla, Parikshit Pareek, Pratik Jawanpuria +1 | cs.AI | 2026-09-29 |
| #32 | Solving Without Stopping: On-Policy Distillation at Small Scale | Hongyang Li, Yiming Zhu, Xiao Li +3 | cs.AI | 2026-09-29 |
| #33 | OptiCom : A Unified Framework for State-Conditioned Composition in LLM-Driven Optimization | Chenxing Wei, Sichen Liu, Lizhao Liu +6 | cs.AI | 2026-09-29 |
| #34 | Breaking the Illusion of Review Reliability under Static Evaluation: SCOPE Fuzzing for LLM-based Scientific Reviewers | Zhuo Chen, Hao Zeng, Jiawei Liu +6 | cs.AI | 2026-09-29 |
| #35 | FACT: Fidelity-Aware Construction of Articulated Twins | Kuixiang Shao, Chuansen Nie, Yinuo Bai +2 | cs.RO | 2026-09-29 |
| #36 | Watch-Think-Interact: Bootstrapping Long-Horizon Multi-Turn Streaming Video Reasoning with Reinforcement Learning | Ziheng Huang, Yicheng Bao, Xueheng Li +8 | cs.AI | 2026-09-29 |
| #37 | AnyAct: Universal Action for Self-Evolving Agents | Lingrui Xu, Yangqin Jiang, Jiachang Zhang +2 | cs.AI | 2026-09-29 |
| #38 | JudgeCast: Time Series Forecasting with Experience-Informed Covariate Judgements | Donguk Kwon, Wooseok Jeong, Dongha Lee | cs.LG | 2026-09-29 |
| #39 | Momentum-Coupled Rubric Adaptation for Detailed Image Captioning | Zhenwen Ji, Lei Jin, Shanyong Wang +6 | cs.CL | 2026-09-29 |
| #40 | RNA Design via Conditioned Flow Matching and Finite-Policy Reinforcement Learning | Zefeng Lin, Xianyong Fang, Tianfan Fu +1 | q-bio.BM | 2026-09-29 |
| #41 | Where the Model Changes Its Mind: Hindsight-Divergence Localization for Efficient Reinforcement Learning with Verifiable Rewards | Fanchao Chen, Hengyu Fu, Shivaram Venkataraman +1 | cs.LG | 2026-09-29 |
| #42 | Calibrate the Decisions That Change the Future: On-Policy Post-Training Quantization for Multimodal Large Language Models | Wenxiao Fan, Jingling Fu, Lichen Ma +6 | cs.AI | 2026-09-29 |
| #43 | UpliftMem: Learning Set-Level Uplift for Agent Memory Retrieval | Mengkun Liang, Haoran Qiang, Guannan Liu +1 | cs.AI | 2026-09-29 |
| #44 | SIPO: Unifying Reinforcement Learning with On-Policy Self-Distillation | Zhenrui Yue, Huimin Zeng, Yueqi Wang +8 | cs.AI | 2026-09-29 |
| #45 | From Neurons to Conversation: Speech Brain-Computer Interfaces | Moein Khajehnejad, Forough Habibollahi, Tommaso Boccato +4 | cs.HC | 2026-09-29 |
| #46 | MARCO: Multi-Round Agentic Reinforcement for Conditional Molecular Optimization | Shicheng Fang, Yuxin Wang, Zhuo Yang +6 | cs.LG | 2026-09-29 |
| #47 | Gödel Forest: Balancing Search Depth and Breadth for Data-Centric Recursive Self-Improvement | Ziqi Zhao, Fanqing Meng, Haocheng Lu +4 | cs.CL | 2026-09-29 |
| #48 | Inducing Process Supervision from Outcome-Only Reinforcement Learning | Shengda Fan, Xin Cong, Zhong Zhang +2 | cs.LG | 2026-09-29 |
| #49 | Communication-Efficient Agnostic Federated Learning via Faster Convergence and Compression | Haomin Bai, Junyan Sun, Sifan Yang +2 | cs.LG | 2026-09-29 |
| #50 | MemEvo: Automatic Discovery of Streaming Video Memory Mechanisms | Guohong Liu, Jialei Ye, Shanhui Zhao +2 | cs.AI | 2026-09-29 |