| 1 | UE5M3 FP4 Block Scaling for Stable Language Model Pretraining | Robert Hu, Carlo Luschi, Paul Balanca | cs.LG | 2026-09-02 |
| 2 | Momentum in large-batch training: Polyak enlarges the critical batch size, Nesterov improves data efficiency | Jia-Nan Wang, Zixun Huang, Kairui Li +1 | stat.ML | 2026-09-02 |
| 3 | Percolation Dynamics in Optimization : Variance Cascades and Discrete Scale Invariance | Sai Niranjan Ramachandran, Suvrit Sra | cs.LG | 2026-09-02 |
| #4 | Towards Zero-Shot Transfer Across Embodiments For Driving VLAs | Caio Azevedo, Stefano Sabatini, Sascha Hornauer +1 | cs.CV | 2026-09-02 |
| #5 | SEAL: Reinforcing Global Safety in Mixture-of-Experts through Shared Expert ALignment | Qingyu Meng, Yiwei Zha, Jiahuan Pei +3 | cs.LG | 2026-09-02 |
| #6 | RideSkill: A Hierarchical Algorithm for Generalized Ride Sharing with LLM-Driven Automatic Evolution | Zijian Zhao, Sen Li, Xialiang Tong +1 | cs.MA | 2026-09-02 |
| #7 | Recursive Value Learning for Long-Horizon Offline Goal-Conditioned RL | Hyeonseong Jeon, Youngwoon Lee | cs.LG | 2026-09-02 |
| #8 | FUSE: An Evaluating Framework for Dangerous Capabilities of LLMs | Zhengyi Jin, Ru Zhang, Xiao Chen +5 | cs.AI | 2026-09-02 |
| #9 | World-Coherent Decoding: Self-Verifying Test-Time Planning for World Action Models | Chuhan Zhang, Seiji Ito, Kenta Hoshino +2 | cs.CV | 2026-09-02 |
| #10 | A Power Law in Logarithm's Clothing: On the Scalability of Graph-Based Vector Search | Sajad Faghfoor Maghrebi, Navid Eslami, Niv Dayan | cs.DB | 2026-09-02 |
| #11 | Modeling What Changes: Sparse, Residual World Models for Object-Centric Manipulation | Param Thakkar, Parsika Paresh Shah, Manisha Sushant Gote | cs.RO | 2026-09-02 |
| #12 | OR-Transformer: Scaling Real-Time Decision-Making to 1,000 Items | Shuze Daniel Liu, David Simchi-Levi, Claire Chen +2 | cs.LG | 2026-09-01 |
| #13 | RAFT-DVC: Resolution-Aware Machine Learning-Based Digital Volume Correlation | Zixiang Tong, Lehu Bu, Jin Yang | cs.CV | 2026-09-01 |
| #14 | Generative Diffusion Surrogates with Analytical Variance Schedule | Patrick Reichherzer, Gianluca Gregori, David N. Hosking +1 | cs.LG | 2026-09-01 |
| #15 | Scaling Near-Optimal SFT-RL Annotation Budget Allocation from Small to Large LLMs | Jingtan Wang, Arun Verma, Xiaoqiang Lin +4 | cs.CL | 2026-09-01 |
| #16 | Gradient-Update Mismatch: Rethinking Conflict-Free Training of Physics-Informed Neural Networks | Jing Xiao, Xinhai Chen, Qinglin Wang +5 | cs.LG | 2026-09-01 |
| #17 | BS: Take the Hint - Interactive Multitracer PET/CT Lesion Segmentation with a Scribble-Conditioned ResEnc U-Net | Marven Sherif, Amgad Elmasry, Youssef Ghazal +1 | cs.CV | 2026-09-01 |
| #18 | TempCloze: Can Video-LLMs Identify the Missing Middle? | Wenqi Pei, Henry Hengyuan Zhao, Yilai Liu +4 | cs.CV | 2026-09-01 |
| #19 | Efficiently Estimating Optimal Hyperparameter Scaling Laws through Power-Law Entropy Search | Zhiliang Chen, Sebastian Ament, David Eriksson +3 | cs.LG | 2026-09-01 |
| #20 | MegaStyle++: Scaling Image Style Space through Hierarchical Style Definition | Junyao Gao, Sibo Liu, Jiaxing Li +4 | cs.CV | 2026-09-01 |
| #21 | SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers | Shaowen Wang, Ge Zhang, Kairong Luo +6 | cs.LG | 2026-09-01 |
| #22 | Some Emotions Run Deeper: Layer-wise Probing and Causal Intervention in Large Language Models | Tian Fang, Gaël Guibon, Davide Buscaldi | cs.CL | 2026-09-01 |
| #23 | From Base Rollouts to RL Reasoning: A Budgeted Search Perspective | Wenhe Sun, Cunxiang Wang, Zijun Yao +1 | cs.CL | 2026-09-01 |
| #24 | From Language to Behavior: Scaling Sequence Transformers for Industrial Recommendation Ranking with Rec-Native Designs | Jie Chen, Xiangqian Yu, Yanchao Lian +9 | cs.IR | 2026-09-01 |
| #25 | Physics-Driven Independent Pair Generation for Iterative Self-Supervised Low-Dose CT Denoising | Xianlei Han, Shaoyu Wang, Jiancheng Fang +2 | cs.CV | 2026-09-01 |
| #26 | A Survey on Self-Improving Test-Time Intelligence: Feedback-Driven Adapting, Learning, and Scaling at Inference | Shuaicheng Niu, Guohao Chen, Yaofo Chen +14 | cs.LG | 2026-09-01 |
| #27 | Accelerating Reinforcement Learning via MPC Solver-Gradient Guidance for Weights-varying MPC | Baha Zarrouki, Arslan Thobani, Jasper Hoffmann +6 | cs.RO | 2026-09-01 |
| #28 | From Truncation to Commitment: Persistent Context in Uniform Discrete Diffusion | Satoshi Hayakawa | cs.LG | 2026-09-01 |
| #29 | Mind the Rift: Cross-Scale Coupling Mismatch for AI-Generated Video Detection | Siyu Li, Jin Yang, Weiheng Liang | cs.CV | 2026-09-01 |
| #30 | Teaching Vision-Language Models to Use the Scale They Are Given: Label-Free Equivariance Training for Metric Physical Reasoning | Kaizhen Tan, Yang Feng, Heqing Du +3 | cs.CV | 2026-09-01 |
| #31 | ViTAL-X: Video-Text Alignment with Cross-Modal Temporal Edits | Sethuraman T, Savya Khosla, Onkar Kishor Susladkar +6 | cs.CV | 2026-09-01 |
| #32 | HBQ: Hierarchical Scaling Block Quantization with Hardware-Efficiency-Aware Design for Accurate LLM Inference | Chun-Ting Chen, Dongmin Han, Hangyeol Mun +6 | cs.LG | 2026-08-31 |
| #33 | DynaNDE: Dynamic Near-Data Expert Scheduling for Batched MoE Inference | Xiaoyang Lu, Belthangady Akash Vi Narayana Pai, Xian-He Sun | cs.AR | 2026-08-31 |
| #34 | Exact Global MCMC with Denoising Diffusion | Mitch Hill | stat.ML | 2026-08-31 |
| #35 | ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training | Xionghao Wu, Yijun Yang, Shiyang Zhou +17 | cs.CV | 2026-08-31 |
| #36 | Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence | Zhiqin Yang, Jingwen Fu, Yuhan Liu +16 | cs.AI | 2026-08-31 |
| #37 | Improving Information Extraction with Learned Queries | Omar Sharif, Soroush Vosoughi, Nikhil Singh | cs.CL | 2026-08-31 |
| #38 | Faster Than Flash: Exploiting Attention Sparsity for Efficient Long-Context Decoding | Zhigeng Liu, Zhiyuan Ning, Ruixiao Li +5 | cs.LG | 2026-08-31 |
| #39 | TrainSDC: Characterizing and Mitigating Silent Data Corruption in Large Language Model Training | Zhipeng Xia, Haotian Xu, Siyu Yun +4 | cs.LG | 2026-08-31 |
| #40 | Liquid Gated Attention | Yiheng Jiang, Yuanbo Xu, Yongjian Yang | cs.LG | 2026-08-31 |
| #41 | MedAgent-R1: Faithfulness-Aware Reinforcement Learning for Evidence-Grounded Medical Reasoning | Jiangwang Chen, Chenghao Zhang, Hengxing Cai | cs.AI | 2026-08-31 |
| #42 | TuringLLM: Efficiently Scaling Foundation Models Toward Physical AI | Yuheng Zhang, Yizhao Wang, Da Zhu +19 | cs.AI | 2026-08-31 |
| #43 | Designing an Auditable LLM-Supported Workflow for Qualitative Thematic Analysis | Nadia Jul Jeldtoft, Tariq Yousef | cs.AI | 2026-08-31 |
| #44 | From Feature Interaction to Feature Transport - A Unified Block for Scalable Recommendation Models | Zichen Luo, Jiachen Guo, Keming Gu +1 | cs.IR | 2026-08-31 |
| #45 | From Final Artifacts to Trajectories: Retrospective Process Supervision for Evidence-Grounded Long-Form Generation | Junjie Huang, Jiarui Qin, Di Yin +4 | cs.CL | 2026-08-31 |
| #46 | From Metaheuristics to Exact Methods: A CP-SAT Approach for Multi-Objective Healthcare Workforce Scheduling | Vipul Patel, Anirudh Deodhar, Dagnachew Birru | cs.AI | 2026-08-31 |
| #47 | Real-Time Scene-Adaptive Tone Mapping for High-Dynamic Range Object Detection | Gongzhe Li, Linwei Qiu, Peibei Cao +3 | cs.CV | 2026-08-31 |
| #48 | When LLM Meets Tree Search: A Systematic View of Inference as Search in Large Language Models | Jiaqi Wei, Xiang Zhang, Yuejin Yang +10 | cs.CL | 2026-08-31 |
| #49 | RSLM: Training-Free Vector Quantization for Approximate Nearest Neighbor Search | Rastislav Lenhardt, Teodora Dobos, Thomas Vecchiato +2 | cs.LG | 2026-08-31 |
| #50 | MCSeg: Pre-training and Fine-tuning Volumetric Pyramid Transformer for Multi-modal Cardiac Image Segmentation | Zhiyu Ye, Hairong Zheng, Tong Zhang | cs.CV | 2026-08-31 |