PaperScope
LIVE · 2026-09-03 05:40 UTC

safety 20 papers this week · -5% WoW

papers mentioning "safety" in title/abstract · 30d window

Latestcs.CLcs.LGcs.AIcs.CV

Mentions per Day (30d)

Latest Papers

#TitleAuthorsCatDate
1Towards Trustworthy Autonomous Robots: An Explainable AI-Based Decision FrameworkCagri Temelcs.RO2026-09-02
2SafeEvolve: Harness-Policy Co-Evolution from Agent Experience for Safety AlignmentQinghua Mao, Wanying Qu, Dadi Guo +8cs.AI2026-09-02
3CodePoisonRAG: Knowledge Poisoning Attacks on Retrieval-Augmented Code GenerationVarun Gadey, Ziad Marey, Alexandra Dmitrienkocs.CR2026-09-02
#4From Reweighting to Rewriting: Unlocking the Intervention Effects of Influential Samples in Training Data AttributionYuzhang Luo, Chenpeng Wang, Jianhui Chen +1cs.CL2026-09-02
#5SPADE: SPaT Attack Detection from the Connected Vehicle's PerspectiveJames Di Novo, Hany Ragab, Sylvain P. Leblanccs.CR2026-09-02
#6Before the Script, Set the Stage: How Worldview Simulation Amplifies Psychologically Grounded Persuasion in Multi-Turn JailbreakingSiyu Chen, Haoran Wang, Xiaojian Li +3cs.CL2026-09-02
#7Counter-GEO-Bench: Evaluating Defenses Against Information-Distorting Generative Engine OptimizationBing Zheng, Zongyao Zhao, Wenming Yangcs.IR2026-09-02
#8Improving Evaluation Realism with Inference-Time Compute and Deployment ScaffoldsAxel Ahlqvist, Richard Guan, Juan-Pablo Rivera +6cs.AI2026-09-02
#9SEAL: Reinforcing Global Safety in Mixture-of-Experts through Shared Expert ALignmentQingyu Meng, Yiwei Zha, Jiahuan Pei +3cs.LG2026-09-02
#10SCX Router: Streaming Zero-Shot Model Selection with a Decoder-KV Classifier and a Real-World Task OntologyIhor Stepanov, Aleksandr Smechov, Mykhailo Shtopko +2cs.AI2026-09-02
#11If It Moves, Radar Knows: A Physics-Aware Radar Transformer for Class-Agnostic Moving-Object DetectionYinghao Sun, Shuguang Li, Jinliang Shao +1cs.CV2026-09-02
#12CoMerge: Conflict-Driven Preference Optimization for Multi-Task Model MergingMingjie Zheng, Zihao Chen, Wenqing Chen +4cs.AI2026-09-02
#13CrashDiffuser: VLM-Guided Collision Intent Reasoning for Fine-Grained Safety-Critical Traffic Scenario GenerationShucheng Zhang, Yuang Zhang, Bingzhang Wang +3cs.RO2026-09-02
#14ASCII Attack: Recontextualising Harmful Requests as Artistic Critique in Large Language ModelsDa Cheng Gu, Yifei Dong, Xinghao Yang +2cs.AI2026-09-02
#15FUSE: An Evaluating Framework for Dangerous Capabilities of LLMsZhengyi Jin, Ru Zhang, Xiao Chen +5cs.AI2026-09-02
#16Selective Knowledge Edit Reversal via Gated Singular Vector ShrinkageWeifeng Jiang, Ruirui Chen, Qianren Mao +3cs.CL2026-09-02
#17Transfer Safety Awareness for Cross-Modal Safety Drift in Multimodal Large Language ModelsTianqi Xiao, Shiyao Cui, Minghao Zhang +2cs.MM2026-09-02
#18Grounded, Compute-Efficient LLM Policy Agents for Energy-Poverty Equity in Physically-Constrained Peer-to-Peer Energy MarketsKunal Jadhav, Siddhesh Morecs.CL2026-09-01
#19The Memory Trust Gap: Capability-Dependent Failures in Persistent-Memory AgentsJundong Hu, Shekar Ramachandrancs.AI2026-09-01
#20Agent Memory Is a Surface for Endogenous Authorization LaunderingTommaso Cerruti, Mika Okamoto, Ansel Kaplan Erolcs.CR2026-09-01
#21SDARE-Bench: Evaluating Large Language Models on Conversational Stigma Detection and Response in Dyadic and Group DialogueStephanie Fong, Yiwen Jiang, Zimu Wang +12cs.CL2026-09-01
#22Public-Sharing Labels and Verbatim Field Egress in an MCP-to-A2A Agent Configuration: A Controlled Multi-Model StudyArpan Kumar Mahapatracs.CR2026-09-01
#23GlossoGen: Emergent Language in Complex Multi-Agent LLM InteractionsElias Stengel-Eskin, Newton Sander, Carlos Bonetti +4cs.CL2026-09-01
#24Defense-as-Skill: Evolving Runtime Guard Skill for Skill-Augmented AgentsXiaofang Yang, Ziqi Miao, Dianbo Sui +2cs.CR2026-09-01
#25RadMatch: Auditable Radiology Report Evaluation via Finding-Level MatchingCharles Corbière, Léo Machado, Aubin Charley +3cs.CV2026-09-01
#26When Safety Routing Breaks: Understanding Alignment Fragility under Benign Fine-TuningYitong Guo, Xiaoyi Chen, Siyuan Zhang +2cs.CR2026-09-01
#27Provably Safe Sim-to-Real TransferTingting Ni, Maryam Kamgarpourcs.LG2026-09-01
#28The Constitutional Coverage Trilemma in AI GovernanceNatalija Mitic, Soona Sedahmed A. O., Mamadou Selly Ly +1cs.LG2026-09-01
#29Who Judges the Judges? A Chinese Safety QA Benchmark for Evaluating LLM Responses and Safety JudgesRui Yang, Shuang Huang, Junhua Liu +7cs.CR2026-09-01
#30Jailbreaking Text-to-Image Models Through Cracks: Navigating Heterogeneous Safety Filters via Multi-Agent DebateKaiyan Wen, Shijie Zhang, Lu Yu +1cs.AI2026-09-01
#31HiveTraceGuard-Pro: A Compact Generative Guardrail for Prompt Injection, Jailbreaks, and Adversarial ObfuscationNikita Oblakov, Sabrina Sadiekh, Evgeniy Kokuykincs.CR2026-09-01
#32Spawn Freely, Act Sparingly: Progressive Risk Vesting for Recursive LLM-Agent TreesMolly Wangcs.AI2026-09-01
#33In-Context Neurofeedback: Can LLMs Control Their Internal Representations through Privileged Access?Koshiro Aoki, Ryota Takatsuki, Gouki Minegishi +2cs.AI2026-09-01
#34A Unified Mechanistic Analysis of Knowledge- and Safety-Based RefusalsYuri Son, Seunghee Kim, Hyuhng Joon Kim +1cs.CL2026-09-01
#35Patterning in Practice: Debiasing Reward Models with SusceptibilitiesGeorge Wang, Elizabeth Donoway, Daniel Murfetcs.LG2026-09-01
#36Triple-Bottom-Line Sustainability of Language Models for Edge AI: A Comparison Between SLMs and Quantized LLMsJainil Dharmil Shahcs.AI2026-09-01
#37Trust Your Guide Only When Certain: Uncertainty-Aware Sparse Alignment at Inference TimeZeen Zhu, Zhuo Li, Weiyang Guo +4cs.CL2026-09-01
#38Socrates went Nuclear: Comparing Interaction Strategies for AI systems in a Learning Context using Brain SensingAlexandre Clin Deffarges, Nataliya Kosmyna, Pattie Maescs.AI2026-09-01
#39Validity-Aware Jailbreak Evaluation for Large Language ModelsQilong Wu, Sahil Wadhwa, Pranab Mohanty +2cs.AI2026-08-31
#40Beyond Token Positions: Safety Alignment Across Denoising Steps in Diffusion Language ModelsGuoli Wang, Haonan Shi, Tu Ouyang +1cs.CL2026-08-31
#41EvoFlint: An Evolutionary Atlas of Multi-Turn LLM VulnerabilitiesFeitong Qiao, Liren Peng, Shiming Ren +7cs.CL2026-08-31
#42Capability-Gated Language Models: Security Composes, Utility Does NotPatrikas Vanagas, Augustas Mačijauskas, Laurynas Lopatacs.CR2026-08-31
#43Adapting Without Gradients: Affine Statistics Transport and What Its Certificate Can Tell YouSalim Khazem, Ibrahim Mohamed Serouiscs.LG2026-08-31
#44The Answer Is Not the ArgumentWill Yeadon, Sergio Juárez, Paul Mackay +5cs.AI2026-08-31
#45Distributed Implicit Harm: A Compositional Safety Blind Spot in MLLM-Based Video ModerationRuotong Wang, Zihao Zhu, Siwei Lyu +2cs.CV2026-08-31
#46Beyond Textual Chain-of-Thought: A Survey on Action-Grounded Reasoning in Autonomous DrivingZhengxu Tang, Xiaozhou Zhang, Guofeng Cui +10cs.CV2026-08-31
#47BLOOM-WILT: Logit Tilting for Behaviour Elicitation in Automated LLM AuditingAdrians Skapars, Edoardo Maninocs.AI2026-08-31
#48Generative artificial intelligence for reliable mechanistic reasoning for corrosionBharath M N, R K Singh Raman, Alankar Alankarcs.LG2026-08-31
#49TRIPPULSE: Multi-Agent Travel Planning with Review-Grounded ReasoningPriyanshu Karmakar, Borru Vijay Sai, Shubhojit Mallick +3cs.CL2026-08-31
#50Safety Screening for Voltage Control in Active Distribution Grids via Distributionally Robust Conformal ScreeningSarra Bouchkati, Petros Ellinas, Adriana Geisler +4eess.SY2026-08-31

all trends · matching is case-insensitive substring after tokenization