| 1 | Rethinking On-Policy Distillation of Large Language Models II: One Training Example | Zixuan Fu, Bingxiang He, Yuxin Zuo +10 | cs.AI | 2026-09-03 |
| 2 | Sequential Beats Joint: On the Interplay between On-Policy Distillation and RLVR | Boyan Li, Bingsen Chen, Chenghao Yang +3 | cs.CL | 2026-09-03 |
| 3 | Verify Before You Distill: Prompt-Level Teacher Gating for On-Policy Distillation | Zhiwei Zhang, Zechen Sun, Fei Zhao +6 | cs.LG | 2026-09-02 |
| #4 | Cliff: Learning Process Rewards from the First Mistake | Peixuan Han, Runhui Wang, Ketan Ramaneti +3 | cs.LG | 2026-09-02 |
| #5 | Learn from Whoever Is Right: Answer-Verified Multi-Teacher Distillation for Multi-Domain LLMs | Xixiang He, Xingming Li, Baiqi Wu +4 | cs.LG | 2026-09-02 |
| #6 | CA-OPD: Confidence-Aware On-Policy Distillation for Structured Visual Prediction | Menghao Li, Linjie Mu, Yin Wang +4 | cs.CV | 2026-09-02 |
| #7 | On-Policy Distillation Meets Off-Policy GRPO: Training Compact Instruction-Following Rerankers | Vignesh Prabhakar, Jialing Pan, Anil Babu Ankisettipalli | cs.LG | 2026-09-01 |
| #8 | Instella-MoE Technical Report | Jiang Liu, Sudhanshu Ranjan, Prakamya Mishra +10 | cs.CL | 2026-09-01 |
| #9 | Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement | Yi Ding, Ruqi Zhang | cs.LG | 2026-08-31 |
| #10 | Influence-Directed Distillation: Solving the Diversity Bottleneck in Sampled-Token On-Policy Distillation | Run Yang, Runpeng Dai, Jie Sun +5 | cs.CL | 2026-08-30 |
| #11 | When Teacher Guidance Misleads: Reward-Aligned On-Policy Distillation | Siyuan Gan, Yuhan Li, Xiran Wang +5 | cs.AI | 2026-08-28 |
| #12 | SpikeOPD: Stable On-Policy Distillation for Autoregressive Spiking Language Models | Enqiao Lu, Xingrui Yu, Yiwei Fu +7 | cs.AI | 2026-08-28 |
| #13 | Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigms | Siye Wu, Kai Yang, Yuchen Cai +8 | cs.CL | 2026-08-27 |
| #14 | Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher | Shiyi Zhang, Mushui Liu, Yunze Tong +8 | cs.CV | 2026-08-27 |
| #15 | Preserving General Capabilities during Domain Specialization with Uncertainty-Calibrated MOPD | Ziyuan Liu, Jiao Ou, Jian Liang +2 | cs.CL | 2026-08-27 |
| #16 | PailitaoGR: Latent Think-with-Images for Generative Image Retrieval | Xiaomeng Fan, Yueran Liu, Shengyu Zhou +6 | cs.CV | 2026-08-27 |
| #17 | SPEAR: Distilling Domain-Adaptive Reasoning Skeletons via Sequential Symbolic Alignment in Reinforcement Learning | Zhuochun Li, Yuelyu Ji, Yiming Zeng +1 | cs.CL | 2026-08-27 |
| #18 | One Symptom, Three Levers: A Critical Review of On-Policy Self-Distillation | Justin Robert, Raheel Qader | cs.LG | 2026-08-26 |
| #19 | A Token-Level Analysis of Sampled-Token Reverse-KL On-Policy Distillation | Bing Shao, Jiazheng Zhang, Long Ma +11 | cs.LG | 2026-08-26 |
| #20 | D$^3$-MOPD: Adaptive Dynamic Domain ScheDuling for Efficient Multi-Teacher Distillation | Zechen Sun, Zhiwei Zhang, Fei Zhao +7 | cs.LG | 2026-08-25 |
| #21 | On-policy Distillation with Verifiable Reward | Wenze Lin, Jiale Zhao, Xitai Jiang +5 | cs.LG | 2026-08-25 |
| #22 | OPDSearch+: On-Policy Distillation with RL Refinement for Search-Augmented Reasoning | Qinglin Ye, Zhiyuan Gu, Jingjie Xia +6 | cs.AI | 2026-08-25 |
| #23 | TailSieve: Partial-Rollout-Guided Tail Routing for LLM Rollouts | Tianqi Xu, Lu Lv, Haoyang Huang +15 | cs.AI | 2026-08-24 |
| #24 | WAM-OPD: On-Policy Distillation for World Action Models | Liuhaichen Yang, Zhuang Jiang, Chenchao Sheng +1 | cs.AI | 2026-08-23 |
| #25 | Hints, Critics, and Teachers: Prior Injection for Sparse-Reward RL in Vision-Language Math Reasoning | Qiqian Fu | cs.AI | 2026-08-22 |
| #26 | SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation | Yibo Peng, Long Lian, David Wagner +1 | cs.CR | 2026-08-21 |
| #27 | Anchoring Instruction Outside Mask: Exact Reference Caching for Efficient In-Context Diffusion Transformers | Yangshuai Liu, Zheming Li, Jiaao Li +4 | cs.CV | 2026-08-21 |
| #28 | STAR-OPD: Structured Aspect-Cascade-Aware On-Policy Reward Distillation for ABSA Quadruple Extraction | Tong Sun, Mingyang Ma, Jiayang Yu | cs.CL | 2026-08-21 |
| #29 | Exploring the Performance Frontier of Compact Unified Image Generation Models | Taihang Hu, Zhao Wang, Zuan Gao +20 | cs.CV | 2026-08-20 |
| #30 | Beyond Imitation: Filtering On-Policy Distillation by Reasoning Progress | Chen Yang, Haiyuan Wan, Rengrong Xiong +2 | cs.AI | 2026-08-19 |
| #31 | Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Context Reasoning | Zhu Zhang, Jixun Wang, Xiaoang Xu +6 | cs.LG | 2026-08-19 |
| #32 | Open-MOPD: Diagnosing and Fixing Capability Imbalance in Multi-Teacher On-Policy Distillation | Huan-ang Gao, Haohan Chi, Yong Yan +7 | cs.LG | 2026-08-19 |
| #33 | Accelerating Visual On-Policy Distillation with Batched Speculative Jacobi Rollouts | Bingqi Shan, Zhehao Yu, Kenhong Lin +1 | cs.LG | 2026-08-18 |
| #34 | Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models | Zhaoyi Li, Deyang Kong, Yuan Wei +13 | cs.CL | 2026-08-17 |
| #35 | Mint-Agent: Introducing Finance-Native Agentic Foundation Models | Mint-Agent Team, Kun Wang, Gavin Zhang +7 | cs.CL | 2026-08-17 |
| #36 | Step-Level On-Policy Distillation: Interpolating Between On-Policy Distillation and Supervised Fine-Tuning | Changhui Sun, Lanbo Liu, Hang Lei +11 | cs.CL | 2026-08-17 |
| #37 | StreamOPD: A Post-Training Recipe with Spatio-Temporal Cue Gating for Streaming Video Understanding | Keming Wu, Baoyi Wang, Kaichen Zhang +7 | cs.CV | 2026-08-17 |
| #38 | Deep Thought Alignment: Trajectory-Level Latent Distillation for Video Reasoning | Ao Shen, Yongheng Zhang, Yinghui Li +3 | cs.CV | 2026-08-17 |
| #39 | Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report | TaoLive AIGC LLM Team, Yuhan Sun, Wenhao Lin +7 | cs.CL | 2026-08-16 |
| #40 | Self-Specialized Teachers for Domain Post-Training | Yifei Li, Rongman Xu, Lingling Zhang +5 | cs.AI | 2026-08-16 |
| #41 | SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning | Haonan He, Haodi Lei, Yun Luo +13 | cs.CL | 2026-08-14 |
| #42 | Self-Supervised Visual On-Policy Distillation | Yijiang Li, Yijun Liang, Yunjie Tian +6 | cs.CV | 2026-08-14 |
| #43 | From Passive Delegates to Strategic Negotiators: Reinforcing Social Reasoning in Small Language Models with SocialRL | Wenyue Hua, Zachary Huang, Tyler Payne +3 | cs.AI | 2026-08-13 |
| #44 | Intern-S2-Preview: Scientific Agentic Foundation Model | Lei Bai, Jiaqi Cao, Chiyu Chen +122 | cs.LG | 2026-08-13 |
| #45 | CROP: Task Relevance via Counterfactuals for Selective On-Policy Distillation | Enhan Li, Junhao He, Hongyang Du | cs.CL | 2026-08-13 |
| #46 | HPSD: Hybrid-Policy Self-Distillation for Text-Image-to-Video Diffusion Models | Jiazi Bu, Pengyang Ling, Yujie Zhou +10 | cs.CV | 2026-08-13 |
| #47 | Teach the Magnitude, Not the Direction: Verifier-Bounded Credit Assignment for Multi-Turn Multi-step LLM Agents | Zechuan Wang, Siyuan Lu, Hongxuan Zhang +3 | cs.AI | 2026-08-13 |
| #48 | Tail-Aware Top-$k$ On-Policy Distillation | Huipeng Huang, Hongxin Wei | cs.LG | 2026-08-12 |
| #49 | AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses | Cheng Qian, Wenting Zhao, Liangwei Yang +6 | cs.LG | 2026-08-12 |
| #50 | Towards Understanding On-Policy Distillation through the Lens of Test-Time Scaling | Xinmu Ge, Zizhuo Zhang, Yu Huang +9 | cs.LG | 2026-08-12 |