PaperScope
LIVE · 2026-09-09 05:40 UTC

steering 12 papers this week · -19% WoW

papers mentioning "steering" in title/abstract · 30d window

Latestcs.CLcs.LGcs.AIcs.CV

Mentions per Day (30d)

Latest Papers

#TitleAuthorsCatDate
1SAEScientist-Bench: Can AI Agents Conduct Autonomous SAE Interpretability Research?Yuqiao Tan, Shizhu He, Jun Zhao +1cs.AI2026-09-08
2Training-Free Task Vectors for LLM Behavioral ControlGabriel J. Perin, Lucas Boscaini, André Araujo +1cs.LG2026-09-08
3Same Values, Different Languages? From Multilingual Probing to Steering LLMs Toward Chinese Social ValuesYuemei Xu, Kexin Xu, Jian Zhou +3cs.CL2026-09-08
#4SignRefine: Adapting Foundational Video Models for Sign Language GenerationAnton Pelykh, Edward Fish, Ozge Mercanoglu Sincan +1cs.CV2026-09-08
#5Compositional Multilingual and Behavioral Attribute SteeringHyun Gu Kang, Daniil Gurgurov, Tanja Baeumel +2cs.CL2026-09-08
#6Key Path Identification for Resolving Knowledge Conflicts via SAE-based SteeringWenbo Zhang, Zhongxiang Sun, Zhiguang Han +1cs.AI2026-09-08
#7PocketVE: Stable and Property-Guided Structure-Based Drug Design with Variance-Exploding DiffusionPeining Zhang, Jinbo Biq-bio.BM2026-09-08
#8LLM Layers Immediately Correct Each OtherArjun Patrawala, Jiahai Feng, Erik Jones +1cs.CL2026-09-07
#9From Echo Chambers to Epistemic Monoculture: Large Language Models Present Temporally Contingent Partisan Alignments as KnowledgeWend K. Tamcs.CL2026-09-07
#10The Illusion of Debiasing: Persona Steering Redistributes Rather Than Reduces Bias in LLMsZiyue Feng, Hongbo Fang, James A. Evanscs.CL2026-09-07
#11TrojanWorld: Backdooring World-Model Agents via Imagination SteeringWenkai Huang, Siyuan Liang, Gaolei Li +4cs.LG2026-09-07
#12Disentangling Steering VectorsTakeru Hiramatsu, Kyohei Atarashi, Koh Takeuchi +1cs.LG2026-09-07
#13Steering Interference Reflects the Model's Defaults, Not the Behavior DirectionsSrikanth Malla, Chiho Choi, Joon Hee Choics.LG2026-09-07
#14AutoLexSteer: Automatic Contrast Construction for Lexical Activation SteeringShuhe Wang, Lachlan Cowley, Eduard Hovy +1cs.CL2026-09-06
#15LATS: Levy Adaptive Tree Sampling for Feedback-Driven Diverse Target DiscoveryBinglin Ji, Anindya Sarkar, Hengchang Lu +3cs.LG2026-09-06
#16Steering Under Compression: Dose-Response, Capability Cost, and Failure Asymmetry in Quantized LLMsSaurav Bhandari, Benjamin Wadecs.LG2026-09-06
#17Cross-Lingual Representation Alignment by Token-Level Optimal Transport in a Language-Agnostic SpaceTaisei Yamamoto, Ryoma Kumon, Danushka Bollegala +1cs.CL2026-09-06
#18AutoKD: Autonomous Knowledge DiscoveryQinwen Ge, Bo Ni, Haowei Fu +3cs.AI2026-09-06
#19Can Activation Steering Capture Multidimensional Authorship Style?Hieu Tran, Calvin Bao, Marine Carpuatcs.CL2026-09-04
#20Locating and Steering Refusal Beyond AttentionPreethi Carmel Bosco, Gopalakrishnan Srinivasancs.LG2026-09-04
#21A Low-Cost, Open Platform for End-to-End Autonomous Driving on a Miniature Ackermann VehicleGustavo Claudio Karl Couto, Eric Aislan Antonelo, Gabriel George Zipperercs.LG2026-09-03
#22Beyond Shallow Alignment: How Post-Training Methods Determine Refusal Circuits And Steering RobustnessHoang Cuong Nguyen, Mark Dras, Usman Naseemcs.CL2026-09-03
#23Large Language Models in Resolving Contextual Knowledge ConflictsXinye Yang, Zhenyang Liu, Ruisi Li +1cs.CL2026-09-02
#24ObserverBench: Testing Mechanistic Estimates for Intervention and ControlVijay Erramillics.LG2026-09-02
#25Percolation Dynamics in Optimization : Variance Cascades and Discrete Scale InvarianceSai Niranjan Ramachandran, Suvrit Sracs.LG2026-09-02
#26Task-Level Natural Language Priors as Learning Signals for Low-Resource LLM TrainingJian Gao, Xiao Zhang, Xun Zhu +2cs.AI2026-09-02
#27IDEEA: training-free Input-Dependent stEEring via Activation cluster matchingZheng Wang, Muchen Li, Renjie Liao +1cs.CL2026-09-02
#28GAPS: Dimension-Level Gates for Conditional Activation SteeringMoghis Fereidouni, Muhammad Umair Haider, Hassan Sajjad +1cs.CL2026-09-01
#29What, Where, and How: Probing Spatiotemporal Representations in Video Foundation ModelsSharon S. Musa, Fereshteh Forghani, Harrish Thasarathan +3cs.CV2026-09-01
#30Defense-as-Skill: Evolving Runtime Guard Skill for Skill-Augmented AgentsXiaofang Yang, Ziqi Miao, Dianbo Sui +2cs.CR2026-09-01
#31StateSwap: Probing Support-Elimination Hidden States in Multiple-Choice QuestionsChao Gao, Haijiang Liu, Qiyuan Li +3cs.CL2026-09-01
#32Lagged Coupling: Internal Representations Become Readable Before They Become CausalXining Xuncs.CL2026-09-01
#33SFAD: Speculative Factuality-Aware DecodingGuanqiao Chen, Di Wang, Lijie Hucs.CL2026-09-01
#34How Do Language Models Choose Between Context and Memory?Benjamin Shih, John Winnicki, Arianna Caocs.LG2026-09-01
#35Physically Plausible Video Generation via Visual-Semantic Chain-of-Events ConditioningZixuan Wang, Yixin Hu, Wen Li +4cs.CV2026-09-01
#36Investigating Assistant Bias in LLM User Simulators Using a Role VectorDaeheon Jeong, Yoonjoo Lee, Eugene Choi +2cs.CL2026-09-01
#37Topological SteeringBenoît Guérand, Tan Minh Nguyencs.LG2026-09-01
#38Potential-Guided Particle Steering for Negation-Constrained Dexterous GraspingGeonho Kim, SooGon Kim, Jongmin Leecs.RO2026-09-01
#39Same Semantics, Different Outcome: On the Modality Robustness of Multimodal LLMs under Knowledge ConflictJungyeon Lee, Yejin Yoon, Taeuk Kimcs.CL2026-09-01
#40Latent Mechanisms of Language Control in Multilingual Language ModelsRyo Mitsuhashi, Sabri Boughorbel, Majd Hawaslycs.CL2026-08-31
#41Uncovering and Mitigating Aggregation-Induced Reward Hacking in Multi-Reward Reinforcement LearningYu Yuan, Yaoyou Fan, Lili Zhao +5cs.CL2026-08-31
#42Elite-Weighted Supervised Fine-tuning for Goal-Directed Molecular OptimizationShiyun Wa, Yifei Wang, Anna G. Green +2cs.LG2026-08-31
#43Asymmetries in Spontaneous and Instructed DeceptionJosiah Luikhamcs.AI2026-08-31
#44Language-Informed Flow Matching for Trend-Guided Structure-Based 3D Molecular GenerationTianyu Gao, Zhikai Su, Jiashu Li +5cs.LG2026-08-31
#45Controlling Refusal Behavior of LLMs via Stiefel-Constrained Rotation SteeringKirill Bunin, Dmitry Bylinkin, Vladimir Aletov +3cs.LG2026-08-31
#46Enhancing Low-Resource Language Reasoning via High-Resource Language Feature TransferMinju Song, Hyeon Hwang, Junhyun Lee +1cs.CL2026-08-31
#47Will the User Ever Know? Covert Indirect Prompt Injection Attacks on Tool-Using LLM AgentsYunseok Lee, Yunji Kim, Woojin Leecs.AI2026-08-31
#48Beyond Token-Level Guidance: Inference-Time Alignment of Specialized LLMs via Cross-Family Representation SteeringJin Gan, Xin Li, Jun Luocs.CL2026-08-31
#49ALTSTEER: Selective Safety Steering for Moving Beyond Hard Refusals to Constructive AlternativesHoejoon Kwon, Byeonggeuk Lim, Kahyeon Kim +1cs.CL2026-08-31
#50Interpreting and Steering for Safe and Correct Code GenerationHao Yan, Ziyu Yaocs.AI2026-08-30

all trends · matching is case-insensitive substring after tokenization