PaperScope
LIVE · 2026-09-09 05:40 UTC

policy 19 papers this week · +25% WoW

papers mentioning "policy" in title/abstract · 30d window

Latestcs.CLcs.LGcs.AIcs.CV

Mentions per Day (30d)

Latest Papers

#TitleAuthorsCatDate
1SyncWorld: Visual Calibration Enables World Models as Zero-Shot SimulatorsYuncong Yang, Zhengtao Han, Furkan Ozyurt +6cs.CV2026-09-08
2Entropy-Regularized Rank-Masked Policy Optimization for Test-Time Reinforcement Learning in Code GenerationJiacheng Xu, Feng Chen, Xiuneng Xu +1cs.LG2026-09-08
3Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation FailsZhou Yu, Bin Bi, Shiva Kumar Pentyala +8cs.AI2026-09-08
#4DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-ImaginationYankai Fu, Ning Chen, Junkai Zhao +5cs.RO2026-09-08
#5ThinkPrior: Zero-Rollout Difficulty Priors for Cold-Start Prompt Selection in RLVRTommy Sha, Skylar Zhai, Siqi Zhaocs.LG2026-09-08
#6Experience Funnel: A State-Policy Alternating Loop for Self-Evolving AgentsWenbo Gao, Zhaomou Song, Zhiyuan Ji +7cs.CL2026-09-08
#7SeGDeP: Semantic- and Geometric-Aware Decoupled Prompts for Reasoning SegmentationLinnan Zhao, Xu Liu, Lingling Li +3cs.CV2026-09-08
#8API Benchmark Scores Do Not Reliably Transfer to Chatbot InterfacesJennifer Wang, Joachim Baumann, Daniel E. Ho +1cs.AI2026-09-08
#9Eliciting Weak-to-Strong Generalization with On-Policy Reverse DistillationYoungrok Park, Sangmin Bae, Hojung Jung +6cs.LG2026-09-08
#10X2Streaming-ASR: wait when uncertain, emit when ready for streaming ASRZhiwei Lin, Kaiqi Fu, Rime Wen +5cs.SD2026-09-08
#11Difficulty-Adaptive Tree-Structured Policy Optimization for Expanding Reasoning Coverage in RLVRYoungjun Yu, Sanghwan Jang, Hwanjo Yucs.LG2026-09-08
#12SUN: Reaching for Novelty in Reinforcement LearningWenyan Yang, Arsenii Mustafin, Dominik Baumann +2cs.LG2026-09-08
#13CASD: Chunk-Aligned Semantic Distillation for Multi-StageRobot ManipulationTinghe Ding, Jiahao Li, He Wangcs.RO2026-09-08
#14AURORA: Active Uncertainty-Driven Re-Orientation for In-Hand ReconstructionFeiyu Zhao, Yuetong Li, Chenxi Xiaocs.RO2026-09-08
#15Detecting Authorship in Political Texts with Inductive StylometryGennadii Iakovlev, Levente Littvaycs.CL2026-09-08
#16SRPO: Setwise Relative Policy Optimization for Multi-Agent LLMsShengtian Yang, Ziyu Xiong, Yu Li +3cs.AI2026-09-08
#17Environments as Scaffold: Enriching Feedback to Bootstrap Self-Evolving Agents in Long-Horizon TasksHongbang Yuan, Zhuoran Jin, Yixin Caocs.LG2026-09-08
#18Miles v0.1: Production-Level Post-TrainingRadixArk, :, Tom Chen +11cs.LG2026-09-08
#19TV-Regulated OPD: Direction Matters in On-Policy DistillationHan Xiao, Yifan Niu, Dongyi Liu +2cs.LG2026-09-08
#20Distillation as Probability Transport: Routed On-Policy DistillationTianle Xia, Lingxiang Hu, Yiding Sun +6cs.LG2026-09-08
#21Non-Coherent Over-the-Air Federated Learning: Protocol, Convergence, and Device SchedulingHaifeng Wen, Nicolò Michelusi, Osvaldo Simeone +2cs.IT2026-09-08
#22Human-Centric Image Captioning with Subject-Centered Spatial UnderstandingBozhou Li, Jiahang Zhang, Yue Ding +11cs.CV2026-09-08
#23What Eviction Destroys: A Restore-Counterfactual Audit of Forgetting in Agent MemoryChen Shencs.CL2026-09-08
#24Revoked but Still Authoritative: An Empirical Study of Revocation Enforcement in Agent-Memory SystemsYi Ting Shen, Kentaroh Toyoda, Alex Leungcs.AI2026-09-08
#25Routing Dense Layouts with History-Aware Offline Reinforcement Learning using LSTMAfsara Khan, Austin Rovinskics.AR2026-09-08
#26NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing HarnessNeoHorse Team, Guoliang Cao, Guohao Dai +34cs.CL2026-09-08
#27Snugi-AI-v2 @ eRisk 2026 Task 2: Early Depression Detection via a Learned Stopping Policy with Sustained Confidence GateYuwen Chiucs.CL2026-09-08
#28When Metrics Reward the Worst Translations: Internalizing Cultural Reasoning for Social Media Translation EvaluationYiwen Qiu, Linjuan Wu, Dingming Li +7cs.CL2026-09-08
#29Observe Before You Alert: Adaptive Driver Alerting with Vision-Language ModelsYuhang Wang, Lingyao Li, Hao Zhoucs.CV2026-09-08
#30DISEIL: Demonstration Distillation for Sample-Efficient Imitation LearningSuyog Khanal, Arun Kumar A, Santu Ranacs.RO2026-09-08
#31Inference-Time Nash AlignmentHadi Hosseini, Debmalya Mandal, Duohan Zhangcs.AI2026-09-08
#32Automated Design of Inventory Policy with Large Language Models: An Exploratory StudyFenghua Yang, Preet Baxi, Yi Zhang +4cs.AI2026-09-08
#33Risk-Conditioned Fine-Tuning of Large Language ModelsZixuan Liu, Fangzheng Wu, Brian Summa +1cs.LG2026-09-08
#34Mini-Batch Risk-Averse Deep Q-Learning: A Robot Navigation Case StudyAayush Patel, Andrzej Ruszczyńskics.AI2026-09-07
#35HyCO: A Hybrid Neural Solver for Combinatorial OptimizationYuheng Li, Di Yang, Haipeng Chen +1cs.LG2026-09-07
#36Streaming Hierarchical Inference with Tabular Foundation ModelsVitor Crista, Afonso Lourenço, Diogo Martinho +1cs.LG2026-09-07
#37Climate-ModernBERT: Revisiting Corpus Composition for Domain-Adaptive Continued PretrainingYongan Yu, Shantam Raj, Jingwei Ni +3cs.CL2026-09-07
#38The Emerging AI Paper-Review Arms Race: Adversarial Co-Evolution in Scholarly PublishingChenguang Wang, Ming Li, Adebayo Braimah +6cs.AI2026-09-07
#39Emergent Charging Coordination in Electric Delivery FleetsJavier Vales-Alonso, Juan J. Alcarazcs.LG2026-09-07
#40Your Agent Says Yes: Interpreting Adversarial Market Behavior Beyond Individual TransactionsZelin Li, Yiyun Su, Matt White +3cs.CE2026-09-07
#41Norms at a Price: Why RL-Based Alignment Can Promise Conditional Compliance at BestKevin Baum, Rūta Binkytė, Felix Jahncs.AI2026-09-07
#42Decentralized Safe Multi-Agent Reinforcement Learning via Predictive ShieldingYacine El Yamani, Hanna Krasowski, Elena Vanneauxeess.SY2026-09-07
#43From Simulated Citizens to Simulated Deliberation: Challenges in Representation and InteractionChaemin Jang, Junsik Min, Jaewoo Choi +9cs.AI2026-09-07
#44Zero-Shot Sim-to-Real Contact-Rich Assembly via Proprioception-Anchored Cross-Modal PretrainingYuhan Wang, Yurou Chen, Hongye Jiang +1cs.RO2026-09-07
#45Where Should Language Sit in a Multimodal Model? Lessons from What Language Does to Human Perception and CognitionPeng Xiecs.CL2026-09-07
#46Measuring Language Transfer in Robot Policies: Adding Greek to a Cosmos3 Vision-Language-Action PolicyAyoub Kirouane, Georgios Giaples, Christos Petrocheiloscs.RO2026-09-07
#47Temporal-Causal Inference for Reinforcement Learning via Automata LearningJan Corazza, Daniil Kaminskyi, Simon Lutz +4cs.LG2026-09-07
#48Masking Radar Cognition under Adversarial Surveillance: A Distributional Privacy FrameworkSreedevi K, Nandhini K, Anup Aprem +1eess.SP2026-09-07
#49SkillAlign: Aligning Skill Interfaces for LLM-based AgentsShuo Ren, Xiaomian Kang, Jiajun Zhangcs.AI2026-09-07
#50An Auditable Symbolic-RAG-Generative AI Architecture for Goal-Oriented Conversation OrchestrationRamon Gonzalez, Antonio Diazcs.AI2026-09-07

all trends · matching is case-insensitive substring after tokenization