| 1 | The Implications of Linguistic Illegibility for LLM Security | James Mickens | cs.LG | 2026-09-02 |
| 2 | Generating Medical Image Counterfactuals using Causal Explanations | David A. Kelly, Tom Yaacov, Nathan Blake +2 | cs.CV | 2026-09-02 |
| 3 | Seeing Beyond the Lesion: Disease Recognition from Reactive CNS Tissue | Jan Schnorrenberg, Jan Ernsting, Enrico Küllenberg +3 | eess.IV | 2026-09-02 |
| #4 | CAPTURE: Disentangling Preference Drift from Memory Poisoning in Personalized LLM Agents | S M Asif Hossain, Ruksat Khan Shayoni, Md Kishor Morol | cs.LG | 2026-09-02 |
| #5 | Signal or Noise? Auditing Rotation-Induced Saliency Drift in Medical and Aerial Imaging | Khawaja Murad ul Hassan, Mehran Ebrahimi | cs.CV | 2026-09-02 |
| #6 | SoK: Where Do Flow Labels Come From? Auditing Label Provenance in Encrypted Traffic Benchmarks | Sizhe Huang, Shujie Yang | cs.NI | 2026-09-02 |
| #7 | Disease Burden over Skin Tone: Decomposing the Dermatology-AI Generalization Gap | Nirajan Kunwor, Sanjaya Poudel, Quoc-Huy Trinh +2 | cs.CV | 2026-09-02 |
| #8 | The Ceiling Is in the Channel: Auditing Learner Gaps and Measurement Frontiers in Clinical Prediction | Sayeed Shafayet Chowdhury, Nusrat Jahan, Snehasis Mukhopadhyay +2 | cs.AI | 2026-09-01 |
| #9 | Measuring consistency via ensemble margin and local prediction variability: Auditing decision systems in the presence of predictive multiplicity | Sinjini Banerjee, Tim Marrinan, Anand D. Sarwate | stat.ML | 2026-09-01 |
| #10 | Who Judges the Judges? A Chinese Safety QA Benchmark for Evaluating LLM Responses and Safety Judges | Rui Yang, Shuang Huang, Junhua Liu +7 | cs.CR | 2026-09-01 |
| #11 | Context-Grounding Gains Are Mediated by Pre-existing Machinery: Auditing GRPO, SFT, and DPO | Prakhar Gupta, Vaibhav Gupta | cs.CL | 2026-09-01 |
| #12 | Self-Reports Are Not Verification: Environment-Grounded Auditing of LLM Operators in Evolutionary Search | Enrong Pan, Ryan Zhou, Ting Hu | cs.AI | 2026-09-01 |
| #13 | NeuroPriv: Adversarial Representation Learning for Privacy in Wearable EEG Systems | Sarmistha Sarna Gomasta, Bhawana Chhaglani, Prashant Shenoy | cs.CR | 2026-08-31 |
| #14 | Do LLMs Know Your Neighborhood? Auditing LLM Priors for Neighborhood-Level Mobility Prediction and Structural Alignment | Saad Mohammad Abrar, Eesha Kurella, Arnav Dadarya +3 | cs.LG | 2026-08-31 |
| #15 | Sources of Truth: A Multi-Platform, Multilingual Audit of Citations in AI Mental Health Information Queries | Phuong Anh Nguyen, Jill Noorily, Matthew Flathers +7 | cs.CY | 2026-08-31 |
| #16 | Authority Bias in Conversational Search Engines for Academic Paper Recommendation | Uthman Jinadu, Parsa Ghazvinian, Anjila Budathoki +3 | cs.AI | 2026-08-31 |
| #17 | Beyond Blind Compliance: Benchmarking Task Verification in OCR Reasoning | Yue Zhou, Yuan Wu, Yi Chang | cs.CV | 2026-08-31 |
| #18 | Auditing Anonymous AI Models: A Four-Stage Protocol for Black-Box Identity Verification | Yisen Xi | cs.SE | 2026-08-31 |
| #19 | BLOOM-WILT: Logit Tilting for Behaviour Elicitation in Automated LLM Auditing | Adrians Skapars, Edoardo Manino | cs.AI | 2026-08-31 |
| #20 | Faithfulness Is Not Free: Auditing Offline KV-Cache Quantization in Retrieval-Augmented Generation | Atta Ul Asad, Ahsan Bilal, Muhammad Ali +2 | cs.CL | 2026-08-31 |
| #21 | Auditing MCQA Benchmarks through Probability Landscapes | Minsoo Song, Chanjun Park | cs.CL | 2026-08-31 |
| #22 | On the Recoverability of Private Information Unlearning in Large Language Models | Shicheng Hu, Runzhi Tian, Ziqiao Wang +1 | cs.LG | 2026-08-30 |
| #23 | Auditing Harness Tampering in Self-Improving Agents | Xing Wang, Xiaoyi Zhang, Jie Shao | cs.CL | 2026-08-30 |
| #24 | AgentProv: Auditing Agentic LLM API Providers via Tool-use Policy Probes | Xun Wang, Bihe Zhao, Michael Backes +2 | cs.CR | 2026-08-30 |
| #25 | Not Safe for All: Auditing the Dialect Penalty in Text-to-Image Safety Pipelines | Minkyu Kim, Juhwan Choi, YoungBin Kim | cs.AI | 2026-08-30 |
| #26 | A Causal Model for Locating and Unlocking Sandbagging in Model Organisms | Hong Kiat Tan, Linh Le, David Williams-King | cs.LG | 2026-08-29 |
| #27 | Bayesian-Optimized Superpixel-GrabCut for Traceable Optic Disc Segmentation | Shraddha Changune, Vivek Noel Soren, Gautam Das +1 | cs.CV | 2026-08-29 |
| #28 | Auditing and Mitigating Privacy Leakage in Cloud-Edge Collaborative Decoding | Kejia Zhang, Tianyuan Zou, Zixuan GU +1 | cs.CR | 2026-08-29 |
| #29 | Revisiting the Provable-Auditable Privacy Gap of DP-SGD | Saloni Modi, Srivi Balaji, Yusong Zhu +2 | cs.LG | 2026-08-28 |
| #30 | VERA-8B: Evidence-Grounded Audit Risk Reasoning from SEC Filings | Menghan Liu, Elynn Chen | cs.AI | 2026-08-28 |
| #31 | Auditing Generative Audio Calls for Known-Task Audio-LLM Evaluation | Mengzhe Geng | cs.SD | 2026-08-28 |
| #32 | Memorization Is Not Extraction: Tight Differential-Privacy Bounds and Audit Blind Spots | Xujun Che, Depeng Xu, Shuhan Yuan | cs.CR | 2026-08-27 |
| #33 | Making Clinical Language Models Auditable: Concept-Guided Fine-Tuning for Robust Prediction | Jin Mu, Guanhua Chen | cs.CL | 2026-08-27 |
| #34 | Counterfactual Bias Testing for Application Tracking System | Sai Yashwant, Shruti Bansal, Anurag Dubey +4 | cs.AI | 2026-08-27 |
| #35 | Quantization-Triggered Backdoors in Language Models: Cross-Quantizer Transferability and the Validation--Deployment Gap | Jacopo Dardini, Claudio Stanzione, Giordano Colò +1 | cs.LG | 2026-08-27 |
| #36 | Beyond Execution: Auditing Experimental Fidelity in LLM-Driven Scientific Research | Lezhi Yu, Xiaogang Xu, Yuhua Zhou +2 | cs.SE | 2026-08-27 |
| #37 | SNF-Bench: Separating Static Drift from Natural Flow in Long-Horizon Fixed-Camera Video Generation | Matiur Rahman Minar, Seunghun Oh, Ganghyeon Jeong +1 | cs.CV | 2026-08-27 |
| #38 | Diff Mining: Logit Differences Reveal Finetuning Objectives | Greg Kocher, Robert West, Clément Dumas +1 | cs.LG | 2026-08-26 |
| #39 | Knowledge-Verified Emergent Deception in LLM Agents Under Conflicting Incentives | Zheyuan Liu, Weiliang Zhao, Xiangchi Yuan +3 | cs.CL | 2026-08-26 |
| #40 | How Do LLM Agents Actually Get the Flag? Trace-Level Provenance for Agentic Offensive Security Evaluation | Kimberly Milner, Minghao Shao, Nanda Rani +8 | cs.CR | 2026-08-26 |
| #41 | 6.5% of the Neuro-Symbolic Literature Can Be Reproduced from Its Published Artifacts, a Six-Stage Audit Framework and First Instantiation | Brandon Colelough, Vladimir Martirosyan, Ishan Tamrakar +6 | cs.AI | 2026-08-26 |
| #42 | ICON Decomposition: Auditing Deep Neural Networks with Multivariate Variance-based Concept-level Explanations | Roshan Prakash Rane, Marco Simnacher, Manuel Pfeuffer +7 | cs.LG | 2026-08-26 |
| #43 | FRAME: separating sampling variation from representational cause in medical imaging fairness | Mahshad Lotfinia, Daniel Truhn, Andreas Maier +1 | cs.CV | 2026-08-26 |
| #44 | MMJailBench: A Factorized Benchmark for Disentangling Multimodal Jailbreak Vulnerabilities | Tianshi Wang, Jingsong Wang, Yafei Huang +3 | cs.CR | 2026-08-26 |
| #45 | Training Alignment Auditors via Reinforcement Learning | Paul Rosu, Rowan Wang | cs.AI | 2026-08-26 |
| #46 | CareGraph: An Auditable Hybrid AI Framework for Evidence-Grounded Personalized Longitudinal Health Intelligence | Pratik Ghawate, Tanvi Patil | cs.AI | 2026-08-25 |
| #47 | A Geometric Theory of Robust Fairness Audits | Binita Maity | cs.LG | 2026-08-25 |
| #48 | Right Diagnoses, Decorative Reasoning:A Perturbation Audit of Medical Chain-of-Thought | Mengzhu Xu, Jifan Gao, Xia Jiang +2 | cs.AI | 2026-08-25 |
| #49 | The Invisible Editorial Layer: Formalizing Undisclosed Inference-Time Steering, Probability Placement, and the Attribution Problem in Deployed Language Models | Augusto Camargo | cs.AI | 2026-08-25 |
| #50 | A Judge Should Know What Changed:Construct Validity for LLM-as-a-Judge Evaluation | Jianlin Chen, Wenhui Chen, Ziyao Lin +1 | cs.AI | 2026-08-25 |