| 1 | LIFT: Layout-In-Future Video Generation under Large Viewpoint Change via On-Policy Self-Distillation | Shengxiang Ji, Boyang Wang, Haiyang Xu +9 | cs.CV | 2026-09-29 |
| 2 | AdviSD: Learning to Advise Frontier LLMs via Targeted Multi-Turn Self-Distillation | Rishabh Agrawal, Hejie Cui, Shasha Li +2 | cs.AI | 2026-09-29 |
| 3 | RS-OPSD: Reliable Privileged On-Policy-Self-Distillation for Ultra-High-Resolution Remote Sensing VQA | Chengjie Jiang, Yunqi Zhou, Jiafeng Yan +3 | cs.CV | 2026-09-29 |
| #4 | Overcoming Scaling Limits in On-Policy Self-Distillation for LLM Reasoning | Md. Ismail Hossain, Humaira Kousar, Isidora Chara Tourni | cs.LG | 2026-09-29 |
| #5 | Can Vision-Language Models Stay Helpful When Facing Implicit Risks? Intent-Privilege OPSD for Efficient Safety-Helpfulness Alignment | Haotian Deng, Wenbin Xing, Gang Xu +5 | cs.CL | 2026-09-29 |
| #6 | Improved Distributional Diffusion Models | Tommaso Martorella, Alexandre Galashov, Felix Krause +4 | cs.CV | 2026-09-29 |
| #7 | Train Ahead, Distill Back: Bootstrapping On-Policy Self-Distillation for Large Language Models | Zheng Zhang, Xinyue Tan, Lufei Li +3 | cs.AI | 2026-09-29 |
| #8 | Spatial-OPSD: Self-Improving Spatial Reasoning via Label-Free Self-Distillation | Zhenyu Liu, Zhangquan Chen, Keyi Chen +4 | cs.CV | 2026-09-29 |
| #9 | Learning from Think-Mode Advantage via On-Policy Distillation | Wanqi Ren, Jianxiang Wang, Danxuan Liu +2 | cs.CL | 2026-09-29 |
| #10 | Beam Search as Test-Time Self-Distillation via Counterfactual Contexts | Su Ee Tan, Xiaotong Ji, Rasul Tutunov +2 | cs.LG | 2026-09-29 |
| #11 | EGSD: Event-Grounded Self-Distillation for Streaming Video Understanding | Yuwei Miao, Xuesheng Zhang, Wenhao Zou +5 | cs.CV | 2026-09-29 |
| #12 | SIPO: Unifying Reinforcement Learning with On-Policy Self-Distillation | Zhenrui Yue, Huimin Zeng, Yueqi Wang +8 | cs.AI | 2026-09-29 |
| #13 | Know Thyself, Teach Thyself: Internal Information Flow for Selective Self-Distillation | Rui Wang, Ruijie Wang, Bo Chen +2 | cs.LG | 2026-09-29 |
| #14 | PR-OPD: Privileged Representation On-policy Self-Distillation for Agentic Reinforcement Learning | Muyang Li, Jie Yang, Zhengyu Fang +5 | cs.LG | 2026-09-29 |
| #15 | PE-OPSD: Internalizing Prompt Enhancement into Flow-matching Models via On-Policy Self-Distillation | Mingfeng Lin, Chengfei Cai, Lin Xu +3 | cs.LG | 2026-09-29 |
| #16 | Distill Locally, Schedule Globally: Flow Maps for Few-Step Text-to-Speech | Yentl Collin, Evan Dufraisse, Amr Mohamed +3 | cs.SD | 2026-09-28 |
| #17 | On-Policy Self-Distillation for Multi-Turn Image Editing | Liangbing Zhao, Le Zhuo, Mohamed Elhoseiny | cs.CV | 2026-09-28 |
| #18 | PIVOT: Pivot-Aware On Policy Self Distillation for Multi-Turn VLM Agents | Jiazhou Zhou, Hu Zhou, Yucheng Chen +3 | cs.CV | 2026-09-28 |
| #19 | Rubric-Aware On-Policy Self-Distillation for LLM Personalization | Yilun Qiu, Xiaoyan Zhao, Chengbing Wang +6 | cs.CL | 2026-09-28 |
| #20 | Revisit to Segment: Working Memory Distillation for Reasoning Segmentation | Cilin Yan, Yilun Qiu, Wanyang Zhang +4 | cs.CV | 2026-09-28 |
| #21 | Can We Trust the Teacher? Decoupled Credit Direction-Magnitude for Self-Distillation | Yugu Li, Zehong Cao, Peizhen Li +3 | cs.AI | 2026-09-28 |
| #22 | UniOPSD: Unifying Outcome and Hindsight Feedback for Agentic Reinforcement Learning | Zenghuang Fu, Zhaoyang Li, Qiuyuan Ai +8 | cs.AI | 2026-09-28 |
| #23 | Evidence-Aligned Multimodal On-Policy Self-Distillation for Fine-Grained Visual Understanding | Nanxing Hu, Qiwei Yan, Jinchao Zhang +1 | cs.CV | 2026-09-28 |
| #24 | EOPSA: Efficient On-Policy Self-Distilled Safety Alignment | Qirui Liu, Yichen Sun, Yan Wang +5 | cs.AI | 2026-09-28 |
| #25 | OSPD: On-Policy Self-Distillation for Persona-Consistent Dialogue | Rui Xu, Yikai Zhang, Aili Chen +3 | cs.AI | 2026-09-28 |
| #26 | One Rollout Is All You Get: Fully Test-Time Adaptation for GUI Agents | Ziqiang Wang, Li Gu, Zhixiang Chi +6 | cs.LG | 2026-09-28 |
| #27 | K-OPSD: Verifiable On-Policy Self-Distillation for Post-Training Vision-Language Models on AEC Drawings | Yunfei Bai, Enrico Chionna, Akash Amol +2 | cs.AI | 2026-09-28 |
| #28 | SCOPD: Sparse-Context On-Policy Self-Distillation for Efficient Vision-Language Models | Ahmadreza Jeddi, Enming Zhang, Jasper Gerigk +12 | cs.CV | 2026-09-28 |
| #29 | Fisher-Informed Recalibration for Feedback-Based On-Policy Self-Distillation of LLMs | Seohyun Lee, Dong-Jun Han, Seyyedali Hosseinalipour +1 | cs.LG | 2026-09-27 |
| #30 | GroupMask: Layer-Adaptive Group-wise Sparsity for Semi-Structured LLM Pruning | Zhengao Li, Shuoqiu Li, Xiaofang Zhang +7 | cs.LG | 2026-09-27 |
| #31 | Faster Block-Diffusion Serving with Distribution-Free Risk Guarantees | Jungseob Lee, Dongyub Jude Lee, Chanjun Park +2 | cs.CL | 2026-09-27 |
| #32 | Grounding Memory Summarization in Utility Intent | Zhenyu Lei, Mingjia Shi, Xingbo Fu +3 | cs.CL | 2026-09-27 |
| #33 | TTRSD: Test-Time Reinforcement Learning with Self-Distillation for Vision-Language Models | Shuning Wang, Zhiheng Wu, Xun Zhou +8 | cs.CV | 2026-09-27 |
| #34 | Beyond Timestamps: Decision-Aligned On-Policy Distillation for Long-Horizon Agents | Mingju Chen, Can Lv, Jinrong Liu +3 | cs.LG | 2026-09-27 |
| #35 | Calibration, Not Answer Selection: Distilling Internal Confidence in Reasoning Models | Yadong Xi, Rongsheng Zhang, Tangjie Lv +2 | cs.CL | 2026-09-27 |
| #36 | Teach Yourself Where to Look: On-Policy Attention Self-Distillation for Reasoning | Safaeid Hossain Arib, Rabeya Akter, Ismam Nur Swapnil +3 | cs.LG | 2026-09-27 |
| #37 | SeOPD: Self-Evolving LLMs via Online Policy Distillation from Self-Generated Chain-of-Thought | Xiaoshu Chen, Xiangyu Wong, Sihang Zhou +2 | cs.AI | 2026-09-27 |
| #38 | X-Tree: Tokenizing Reusable Experience for Efficient Agent Generalization | Sitao Cheng, Xunjian Yin, Zhiyuan Sun +4 | cs.AI | 2026-09-26 |
| #39 | IGSD: Environment-Verified Hindsight Self-Distillation for Search Agents | Angqing Jiang, Gaoming Zhang, Chaoqun Zhang +5 | cs.AI | 2026-09-26 |
| #40 | MM-OPD: Towards One More Bottleneck Between Perception and Reasoning | Jintao Tong, Yujing Lou, Zhanming Shen +6 | cs.CV | 2026-09-26 |
| #41 | Learning from a Thoughtful Teacher: Adaptive On-Policy Self-Distillation for Mathematical Reasoning | Jiacheng Du, Weiwei Xie, Tianyi Du +3 | cs.AI | 2026-09-26 |
| #42 | Learning an Anchored Prompt Space for Continual Adaptation of Large Language Models | Rongguang Ye, Zhan Zhuang, Yichen Wu +2 | cs.CL | 2026-09-26 |
| #43 | Fewer Tokens, More Self-Teaching: On-Policy Self-Distillation for Extreme Visual Token Reduction | Junxian Li, Ruixuan Yang, Tianao Zhang +3 | cs.CV | 2026-09-26 |
| #44 | User Model Extraction via Belief Self-Distillation | Ali Holmov, Yiran Huang, Kirill Bykov +1 | cs.LG | 2026-09-25 |
| #45 | TISD: On-Policy Self-Distillation with Trajectory Intervention | Taeckyung Lee, Rinat Amankos, Jeonghye Kim +3 | cs.AI | 2026-09-25 |
| #46 | Recursive Self-Improvement via On-Policy Distillation for Reasoning | Shangjian Yin, Zehao Zhao, Kavosh Asadi +7 | cs.CL | 2026-09-25 |
| #47 | From Self-Distillation to Self-Practice: Privileged Information for Multi-Turn Agents | Xingyu Su, Abhishek Kumar, Qing Ping +5 | cs.AI | 2026-09-24 |
| #48 | Learn How to Act from Your Own Interactions: On-Policy Self-Distillation for GUI Agents | Yan Zhang, Daiqing Wu, Huawen Shen +7 | cs.AI | 2026-09-23 |
| #49 | BAS-OPD: Budget-Aware Selective On-Policy Self-Distillation for Fine-Grained Multimodal Perception | Zihan Chen, Hengguang Zhou, Yuan Kang +5 | cs.CV | 2026-09-22 |
| #50 | What Should a Self-Teacher See? Privileged Context Design for On-Policy Self-Distillation | Kanghui Tian, Siyuan Liu, Tianxiang Jiang +8 | cs.LG | 2026-09-22 |