| 1 | When LLM Decompilers Recompile More and Preserve Less | Chang Liu, Edward Raff, Kristopher Micinski | cs.CR | 2026-09-04 |
| 2 | The History Is the Detector: Executing CVE Patch History, End-to-End | Qiushi Wu, Kevin Eykholt, Youngja Park +4 | cs.CR | 2026-09-04 |
| 3 | Beyond Aggregate Scores: Behavioral Correctness Assumptions for Assessing Reference-Based Automatic Evaluation Methods | Maria Mahbub, Ashley Rice, Michael R. Munroe +2 | cs.AI | 2026-09-04 |
| #4 | First Things First: Teaching LLM-Based Agents to Prioritize Must-Haves before Nice-to-Haves | Tianjie Ju, Xinyue Xu, Wanxuan Sun +4 | cs.CV | 2026-09-04 |
| #5 | TruthInsightBench: An Evidence-Grounded Benchmark for Automated Evaluation of Open-Ended Scientific Discovery Agents | Zhibo Yang, Chen Zhang, Yuewei Zhang +1 | cs.AI | 2026-09-04 |
| #6 | Beyond Co-purchase Relation: Evolution of Complementary Recommendations at Allegro | Aleksandra Osowska-Kurczab, Klaudia Nazarko, Eliška Kosturová +2 | cs.IR | 2026-09-04 |
| #7 | Moral Competence Before Moral Content: Why LLM Agents Lack the Prerequisites for Coherent Alignment | Arno Libert, Derck W. E. Prinzhorn, Daan R. Henselmans | cs.AI | 2026-09-04 |
| #8 | How a Chatbot's Response Style Shapes a Classroom: A Multi-Agent Simulation of Students Consulting AI | Rin Tamai, Yuya Dan | cs.HC | 2026-09-04 |
| #9 | Better Understanding, Better Fixes? A Study of Hallucination in LLM-based Automated Program Repair | Xuemeng Cai, Jiakun Liu, Linhan Yang +2 | cs.SE | 2026-09-04 |
| #10 | CoLMIN: LLM-based Multi-Decision Path Negotiation for Cooperative Autonomous Driving | Zhe Huang, Zhaoxin Fan, Shuo Wang +3 | cs.RO | 2026-09-04 |
| #11 | DCFA: Dual-view Causal-inspired Attribution for Failure Reasoning in LLM-based Multi-agent Systems | Zehao Wang, Lanjun Wang, Shilong Jin +2 | cs.AI | 2026-09-04 |
| #12 | Controlling and Assessing Appropriate Persona Use in LLM-based Dialogue Generation | Jongkyung Shin, Inkyu Lee, Chiehyeon Lim | cs.CL | 2026-09-04 |
| #13 | Continual Graph Memory for Adaptive Recommendation under Intent Drift | Hao Nguyen Ngoc, Tung Nguyen, Nguyen Thi Hanh +2 | cs.AI | 2026-09-04 |
| #14 | CORE: Improving Compositional Reasoning in MLLM Embedding via Reranker Distillation | Tingyu Song, Mingxin Li, Yanzhao Zhang +5 | cs.CV | 2026-09-03 |
| #15 | LLM4CKD: Large Language Models for Early Stage Chronic Kidney Disease Screening | Muhammad Ashad Kabir, Sirajam Munira | cs.AI | 2026-09-03 |
| #16 | Value-Preserving Architectures for Agentic AI Systems | Alessandro Pesare, Tommaso Dolci, Katja Hose +1 | cs.AI | 2026-09-03 |
| #17 | GPS-Bench: A Governance Policy Benchmark for Automating Policy Analysis | Linh Le, Melanie Bui, My Chiffon Nguyen +2 | cs.AI | 2026-09-03 |
| #18 | Accountable AI with Grounded, Faithful, Consistent, Actionable Rationales: A Case Study in Clinical Trial Matching with VERDICT | Zikai Zhou, Yufei Jin, Yilin Xu +3 | cs.CL | 2026-09-03 |
| #19 | What Else Needs Fixing? Exploring Cost-Effective Test-Time Compute for Revision Propagation in Artifacts Generated Through Conversation | Daisuke Kikuta | cs.CL | 2026-09-03 |
| #20 | SWIM: Student Writing Simulation via Proficiency-Conditioned Generation | Heejin Do, Jakub Kontak, Mrinmaya Sachan | cs.CL | 2026-09-02 |
| #21 | Large Language Models (LLMs) for Telecom Root Cause Analysis (RCA): A Structured Reasoning Framework for Evidence-Grounded Diagnosis | Hao Zhou, Mandar Kulkarni, Hao Chen +3 | cs.AI | 2026-09-02 |
| #22 | SafeEvolve: Harness-Policy Co-Evolution from Agent Experience for Safety Alignment | Qinghua Mao, Wanying Qu, Dadi Guo +8 | cs.AI | 2026-09-02 |
| #23 | CodePoisonRAG: Knowledge Poisoning Attacks on Retrieval-Augmented Code Generation | Varun Gadey, Ziad Marey, Alexandra Dmitrienko | cs.CR | 2026-09-02 |
| #24 | HyperStyler: Low-resource Authorship Style Transfer via Context-aware Style Navigation and Hypernetworks | Jongkyung Shin, Minguk Jeon, Chanwoo Park +1 | cs.CL | 2026-09-02 |
| #25 | Automated Vulnerability Injection in Smart Contracts Using Large Language Models | Luca Migliaccio, Roberto Natella, Naghmeh Ivaki +2 | cs.SE | 2026-09-02 |
| #26 | When Persona Attributes Improve Population Alignment in Large Language Models | Leon Fröhling, Jens Rupprecht, Markus Strohmaier +1 | cs.CL | 2026-09-02 |
| #27 | PragAlign: Feedback-Guided Pragmatic Alignment for Controlled Synthetic Dialogue Generation | Smitha Muthya Sudheendra, Jaideep Srivastava | cs.CL | 2026-09-02 |
| #28 | Improving Health Literacy through Lay Summarization of Radiological Reports: An Evaluation of BioNER and Retrieval-Augmented Generation | Egecan Çelik Evgin, İlknur Karadeniz, Olcay Taner Yıldız | cs.CL | 2026-09-02 |
| #29 | YesTrack: Referring Multi-Object Tracking via MLLM-based Yes/No Verification | Quansheng Hu, Qin Sun, Qiansen Dai +4 | cs.CV | 2026-09-02 |
| #30 | Privacy-Preserving Topology-Guided Safety for LLM-Based Multi-Agent Systems via Federated Graph Learning | Jinxi Yu, Eric Hanchen Jiang, Levina Li +6 | cs.CR | 2026-09-02 |
| #31 | RideSkill: A Hierarchical Algorithm for Generalized Ride Sharing with LLM-Driven Automatic Evolution | Zijian Zhao, Sen Li, Xialiang Tong +1 | cs.MA | 2026-09-02 |
| #32 | Evidence-Guided Detection, Localization and Explanation for Text-Centric Image Forensics | Peifeng Liu, Bin Li, Qingsong Zhang +3 | cs.CV | 2026-09-02 |
| #33 | MASkills: Continual Skills Optimization for Multi-Agent LLM Systems | Huaiyuan Yao, Xiaoou Liu, Charles Fleming +2 | cs.AI | 2026-09-02 |
| #34 | Compositional Spectral Prompts for LLM-based Online Time Series Forecasting | Seungyoon Choi, Hyunchul Kim, Jae-Gil Lee +1 | cs.LG | 2026-09-02 |
| #35 | Beyond Outcome Gaps: Process-Aware Fairness Diagnosis for LLM-based Multi-Agent Decision Systems | Yiran Zhao, Lu Zhou, Liming Fang +4 | cs.AI | 2026-09-02 |
| #36 | HyGRAIL: Cost-Aware and Evidence-Grounded Scientific Hypothesis Discovery over Knowledge Graphs | Yihang Sun, Zhihan Zhu, Zhiyuan Jiang +3 | cs.CL | 2026-09-02 |
| #37 | A Tri-Agent Framework for Evaluating and Aligning Question Clarification Capabilities of Large Language Models | Yikai Zhao, Saurabh Pandey, Pradeep Kumar Misra | cs.CL | 2026-09-02 |
| #38 | Beyond Scores: Understanding LLM-as-a-Judge Mechanisms in Summarization Evaluation | Himil Vasava, Ming Jiang | cs.CL | 2026-09-01 |
| #39 | StudentSim: Training LLM-based Student Simulators | Ke Yang, Chenglong Wang, Michel Galley +4 | cs.CL | 2026-09-01 |
| #40 | Can LLMs Design Video Coding Tools? A Case Study on Planar Mode | Yingwen Zhang, Meng Wang, Liqiang He +1 | cs.MM | 2026-09-01 |
| #41 | Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement | Haoyang Yan, Min-le Su, Hangfan Zhang +6 | cs.AI | 2026-09-01 |
| #42 | RadMatch: Auditable Radiology Report Evaluation via Finding-Level Matching | Charles Corbière, Léo Machado, Aubin Charley +3 | cs.CV | 2026-09-01 |
| #43 | LEAP: Likelihood Elicitation and Aggregation for LLM-based Probabilistic Forecasting | Yufei Chen, Yiran Zhao, Xiaogang Xu +3 | cs.AI | 2026-09-01 |
| #44 | Bandits in Prod: Hyperparameter Optimization at Inference Time | Louis Abraham, Tuan-Anh Nguyen, Nicolas Devatine | cs.LG | 2026-09-01 |
| #45 | Measuring the Behavioral Fidelity of Long-Horizon Human Activity Simulations | Yi Fei Cheng, Fan Yang, Iremsu Bas +3 | cs.AI | 2026-09-01 |
| #46 | CaRL-EM: Cost-Aware Reinforcement Learning for Entity Matching with LLMs | Chaohui Guo, Michel Klein, Zhisheng Huang | cs.CL | 2026-09-01 |
| #47 | Web Price Extraction: State of the Art and an Adaptive Browserless Implementation | Evgeniia Kositsyna, Jorge Lloret-Gazo | cs.IR | 2026-09-01 |
| #48 | Inspicio: Open-Vocabulary, LLM-Based Sense Retrieval for Historical Languages | Michele Ciletti | cs.CL | 2026-09-01 |
| #49 | A Dataset for Modeling Iterative Problem-Solving | Fagun Patel, Sang T. Truong, Duc Q. Nguyen +4 | cs.CL | 2026-09-01 |
| #50 | VerNav: Verifier-First Low-Latency Vision-and-Language Navigation | Zhixin Wang, Chengzheyi Yao, Leyuan Liu +2 | cs.RO | 2026-09-01 |