PaperScope
LIVE · 2026-09-30 05:40 UTC

feedback 26 papers this week · +238% WoW

papers mentioning "feedback" in title/abstract · 30d window

Latestcs.CLcs.LGcs.AIcs.CV

Mentions per Day (30d)

Latest Papers

#TitleAuthorsCatDate
1Pretraining Latent Information Feedback Transformers with Teacher SupervisionDor Tirosh, Ido Amos, Mor Gevacs.CL2026-09-29
2Learning Meta-Skills for Agent Harness Design in Test-Time AI4AICheng Qian, Kunlun Zhu, Beibin Li +2cs.AI2026-09-29
3AdviSD: Learning to Advise Frontier LLMs via Targeted Multi-Turn Self-DistillationRishabh Agrawal, Hejie Cui, Shasha Li +2cs.AI2026-09-29
#4Stochastic World Models for Verifying Vision-Based Neural Feedback SystemsI. Samuel Akinwande, Mykel J. Kochenderfer, Clark Barrettcs.AI2026-09-29
#5RS-OPSD: Reliable Privileged On-Policy-Self-Distillation for Ultra-High-Resolution Remote Sensing VQAChengjie Jiang, Yunqi Zhou, Jiafeng Yan +3cs.CV2026-09-29
#6EVO-WAM: Evolving World Action Models through Video-Action VerificationShiyang Zhou, Xionghao Wu, Wenbo Li +11cs.CV2026-09-29
#7Retrieval-Augmented Skill Optimization via Cross-Harness AdaptationJaewon Chu, Ji Soo Lee, Jihwan Park +8cs.AI2026-09-29
#8TabFM-Auto: Self-Evolving Pipelines for Tabular Foundation ModelsDeqing Fu, Huangyuan Su, Rajat Sen +4cs.LG2026-09-29
#9PhysWAM: Physically Consistent World Action Model for Autonomous DrivingDhruv Parikh, Fengcheng Yu, Quankai Gao +11cs.RO2026-09-29
#10Learning When to Update: A Near-Optimal Timing Bandit ApproachQiulin Lin, Junyan Su, Liyuan Wang +1cs.LG2026-09-29
#11You Cannot Pick a Provider From the Price List: Market-Aware Routing for Open-Weight LLM InferenceLiang He, Jingbo Wen, Yixiong Chen +4cs.AI2026-09-29
#12Mixture of Self-Improving Branches For Agent Harness OptimizationHaoyu Dong, Yuhang Zhou, Zihao Lin +6cs.AI2026-09-29
#13ReCaVSR: One-Step Streaming Diffusion Video Super-Resolution with Recycled Latents and Learned Cache RoutingXijun Wang, Xin Li, Suhang Yao +3cs.CV2026-09-29
#14Explore, Execute, Evolve: A Skill Acquisition and Reuse Loop for Embodied AgentsSicheng Xie, Yitong Chen, Haidong Cao +3cs.RO2026-09-29
#15Feedback-Calibrated Protein Optimization with Batch-Aligned Tail ArbitrationZefeng Lin, Xianyong Fang, Tianfan Fu +1cs.LG2026-09-29
#16Challenges and Solutions for Bandits in the Wild: Warm-Started Mixture Bandits for Cross-Cohort Slate RecommendationSerafima Lebedeva, Sumantrak Mukherjee, Ali Arshad Sadal +8cs.LG2026-09-29
#17Learning from Shared-Control Overrides: Context-Driven Acceleration Profile Prediction for Personalized OvertakingRuizheng Xu, Lounis Adouane, Javier Ibañez-Guzmán +1cs.AI2026-09-29
#18KUPAS MASTER: Distilling the Tacit Expertise of Master Practitioners into Agent-Ready Experience CorporaChangmian Wang, Yuchao Ma, Xuchao Lu +13cs.AI2026-09-29
#19EnterpriseBench: Benchmarking LLM Agents on Enterprise-Level Strategic Reasoning and Decision-MakingMin Yang, Yichen Pan, Jinghua Piao +3cs.AI2026-09-29
#20RLTL;DR: Self-improvement by Internalizing Self-generated FeedbackMichael Kirchhof, Eleonora Gualdoni, Andrew Szot +6cs.LG2026-09-29
#21AS$^2$D: Accelerating On-Demand Audio Understanding on Mobile DevicesYunzhe Li, Kyoungjun Park, Hongzi Zhu +1cs.SD2026-09-29
#22Credit-Guided Policy Improvement for Test-time Adaptive Vision-Language NavigationYang Li, Sijia Zhang, Yihan Li +4cs.RO2026-09-29
#23Evaluating the Evaluators: Diagnosing Large Multimodal Models for AI-Generated Image AssessmentYu Zhao, Jiarui Wang, Huiyu Duan +5cs.CV2026-09-29
#24Decompose Radicals, Then Reward: Fine-Grained Inspection for Accurate Chinese Text RenderingYazhen Xie, Xingsong Ye, Zhineng Chencs.CV2026-09-29
#25How Can Recommendation Feedback Evolve Agent Memory?Shanwen Mao, Mingming Li, Hao Zhang +4cs.AI2026-09-29
#26Graph-Conditioned On-Policy Agent Distillation from Off-the-Shelf TeachersXiaohan Yi, Wen Luo, Yani Huang +4cs.LG2026-09-29
#27From Dissonance to Orchestration: Teacher Intervention in On-Policy DistillationYuhao Wang, Ruiyang Ren, Yinan Zhang +3cs.CL2026-09-29
#28Routing Should Pay for Itself: Sparse Supervision for Economical LLM RoutingGuannan Lai, Gelin Bian, Hao-Xuan Ma +5cs.AI2026-09-29
#29Rethinking Soft Tokens for Parallel Decoding in Diffusion Language ModelsKodai Kawamura, Kenji Kawaguchi, Anji Liucs.LG2026-09-29
#30Beyond Prompt Count: How Data Shapes Transfer in On-Policy DistillationJiaxuan Wang, Jiafei Lyu, Yuchen Cai +8cs.AI2026-09-29
#31Teaching LLMs to Generate Challenging MILP Instances via Solver FeedbackJitin Singla, Parikshit Pareek, Pratik Jawanpuria +1cs.AI2026-09-29
#32Solving Without Stopping: On-Policy Distillation at Small ScaleHongyang Li, Yiming Zhu, Xiao Li +3cs.AI2026-09-29
#33OptiCom : A Unified Framework for State-Conditioned Composition in LLM-Driven OptimizationChenxing Wei, Sichen Liu, Lizhao Liu +6cs.AI2026-09-29
#34Breaking the Illusion of Review Reliability under Static Evaluation: SCOPE Fuzzing for LLM-based Scientific ReviewersZhuo Chen, Hao Zeng, Jiawei Liu +6cs.AI2026-09-29
#35FACT: Fidelity-Aware Construction of Articulated TwinsKuixiang Shao, Chuansen Nie, Yinuo Bai +2cs.RO2026-09-29
#36Watch-Think-Interact: Bootstrapping Long-Horizon Multi-Turn Streaming Video Reasoning with Reinforcement LearningZiheng Huang, Yicheng Bao, Xueheng Li +8cs.AI2026-09-29
#37AnyAct: Universal Action for Self-Evolving AgentsLingrui Xu, Yangqin Jiang, Jiachang Zhang +2cs.AI2026-09-29
#38JudgeCast: Time Series Forecasting with Experience-Informed Covariate JudgementsDonguk Kwon, Wooseok Jeong, Dongha Leecs.LG2026-09-29
#39Momentum-Coupled Rubric Adaptation for Detailed Image CaptioningZhenwen Ji, Lei Jin, Shanyong Wang +6cs.CL2026-09-29
#40RNA Design via Conditioned Flow Matching and Finite-Policy Reinforcement LearningZefeng Lin, Xianyong Fang, Tianfan Fu +1q-bio.BM2026-09-29
#41Where the Model Changes Its Mind: Hindsight-Divergence Localization for Efficient Reinforcement Learning with Verifiable RewardsFanchao Chen, Hengyu Fu, Shivaram Venkataraman +1cs.LG2026-09-29
#42Calibrate the Decisions That Change the Future: On-Policy Post-Training Quantization for Multimodal Large Language ModelsWenxiao Fan, Jingling Fu, Lichen Ma +6cs.AI2026-09-29
#43UpliftMem: Learning Set-Level Uplift for Agent Memory RetrievalMengkun Liang, Haoran Qiang, Guannan Liu +1cs.AI2026-09-29
#44SIPO: Unifying Reinforcement Learning with On-Policy Self-DistillationZhenrui Yue, Huimin Zeng, Yueqi Wang +8cs.AI2026-09-29
#45From Neurons to Conversation: Speech Brain-Computer InterfacesMoein Khajehnejad, Forough Habibollahi, Tommaso Boccato +4cs.HC2026-09-29
#46MARCO: Multi-Round Agentic Reinforcement for Conditional Molecular OptimizationShicheng Fang, Yuxin Wang, Zhuo Yang +6cs.LG2026-09-29
#47Gödel Forest: Balancing Search Depth and Breadth for Data-Centric Recursive Self-ImprovementZiqi Zhao, Fanqing Meng, Haocheng Lu +4cs.CL2026-09-29
#48Inducing Process Supervision from Outcome-Only Reinforcement LearningShengda Fan, Xin Cong, Zhong Zhang +2cs.LG2026-09-29
#49Communication-Efficient Agnostic Federated Learning via Faster Convergence and CompressionHaomin Bai, Junyan Sun, Sifan Yang +2cs.LG2026-09-29
#50MemEvo: Automatic Discovery of Streaming Video Memory MechanismsGuohong Liu, Jialei Ye, Shanhui Zhao +2cs.AI2026-09-29

all trends · matching is case-insensitive substring after tokenization