PaperScope
LIVE · 2026-09-29 05:40 UTC

cache 23 papers this week · +100% WoW

papers mentioning "cache" in title/abstract · 30d window

Latestcs.CLcs.LGcs.AIcs.CV

Mentions per Day (30d)

Latest Papers

#TitleAuthorsCatDate
1KV-streams for Efficient Compaction in Agentic Reinforcement LearningEmiliano Penaloza, Dane Malenfant, Dheeraj Vattikonda +15cs.LG2026-09-28
2SANTA++: Sampling Attention through Representative KeysKyle Lee, Christian Z. Pratt, Ruoyu Fang +4cs.LG2026-09-28
3Cartridges++: KV Cache Compression without Off-Context DerailmentSonia Laguna, Joao Monteiro, Marco Cuturi +2cs.LG2026-09-28
#4Language Models Act on Hidden ValenceCameron Berg, Caspar Kaisercs.CL2026-09-28
#5WavePP: High-Throughput Pipeline Parallel LLM Prefill under Prefix ReuseAaryam Sharmacs.DC2026-09-28
#6CacheRepair: Learning to Repair Cross-Chunk Context in RAG for KV Cache FusionGenglin Wang, Wangsong Yin, Yeerzhati Abudunuer +3cs.LG2026-09-28
#7TempoKV: Timely Staging of LLM KV Caches for Memory-Semantic FlashJay H. Park, Hyungjun Kim, Dong Kimcs.DC2026-09-28
#8Dual-Stream Simultaneous Translation via 2D Grid AttentionYu Pu, Wei-Qiang Zhangcs.AI2026-09-28
#9ColNanoVDR: Document-Free Query Distillation for Multi-Vector Visual Document Retrieval via Optimal TransportZhuchenyang Liu, Ziyi Wang, Yao Zhang +1cs.IR2026-09-28
#10D$^2$-VLA: Dual-Memory Dual-Frequency Vision-Language-Action Model For Long Dynamic ManipulationZijian Ye, Chengqi Wei, Wei Huang +9cs.CV2026-09-28
#11Dynamic Flow, Static Graph: KV Cache Reuse for Efficient LLM Serving on Mobile NPUsZhengxiang Huang, Shengheng Chen, Chaoyue Niu +6cs.OS2026-09-28
#12OmniTide: Co-Designing Algorithms and Systems for Efficient On-Device Omni-LLM StreamingZongshang Shen, Wangsong Yin, Daliang Xu +2cs.AI2026-09-28
#13WorldAttention: An Efficient Attention Architecture for Interactive Video World ModelsZeyu Zhang, Jinyuan Mao, Dakai An +6cs.CV2026-09-28
#14PulseInfer: I/O-Centric Sparse KV Cache Offloading for Efficient Long-Context LLM DecodingQiuyang Zhang, Kai Zhou, Kai Lu +6cs.LG2026-09-28
#15DPS: Dual-Mode Precision LLM Serving with Semi-Unified MemoryXuan Truong Nguyen, Tien Son Pham, Tuan Duc Chu +2cs.DC2026-09-28
#16Spexis: Speculative Lookahead Scheduling for LLM InferenceHyungyu Jung, Jaehyeok Yu, Hoonseo Choi +3cs.LG2026-09-28
#17Text-Vision Synergistic Token Caching: A Training-Free Framework for Efficient Vision-Language-Action InferenceQianer Li, Chengjie Zhang, Jingwen Chen +3cs.CV2026-09-28
#18SlimWise: Decoupling Expert Pruning Across Prefill and Decode for Efficient MoE ServingGunho Park, Kyoungho Jeun, Juntaek Oh +3cs.LG2026-09-28
#19MaskCoFT: Masked Co-Adaptive Fine-Tuning for Memory-Efficient MoE InferenceJunfeng Wu, Zehao Fan, Hadjer Benmeziane +3cs.LG2026-09-28
#20KVCMAS: Efficient KV cache Correction for Shared Context in Multi-Agent SystemsHyesung Jeon, Hyeongju Ha, Seoyoung Lee +2cs.LG2026-09-28
#21PReCache: Efficient KV Cache Sharing for Multi-LoRA Agents via Low-Rank Precomputation and Neutral ReconstructionHyesung Jeon, Hyeongju Ha, Jae-Joon Kimcs.LG2026-09-28
#22Thinking Outside the Box: Retention and Transmission of Information in Sliding-Window KV InferenceTimothy DeLise, Seth Cromelincs.AI2026-09-28
#233D Point Tracking with State Space ModelsMasahiro Ogawa, Qi An, Atsushi Yamashitacs.CV2026-09-27
#24Where Activation Sparsity and KV-Cache Sparsity Cross in LLM DecodingJungseob Lee, Seungyoon Lee, Seongtae Hong +2cs.LG2026-09-27
#25JET: Justification Evaluation in TransformerShenghao Dingcs.LG2026-09-27
#26Identical Runs, Different Results: Benchmarking AI Coding Agents on Open-Weight ModelsEduardo Ariño de la Rubia, Szilard Pafkacs.SE2026-09-27
#27EfficientAgent: What Makes KV Cache Offloading Work for Concurrent Agents?Kunming Shao, Jierun Chen, Jiangnan Yu +7cs.DC2026-09-27
#28Positions Are Not Facts: The Mismatch Between KV Caches and MemoryChanghai Zhou, Yuhua Zhou, Shiyang Zhang +5cs.CL2026-09-27
#29PQ-HSA: Reusing Product-Quantized Scores for Hybrid Sparse-Approximate AttentionKunming Shao, Jierun Chen, Yanli Wang +4cs.LG2026-09-27
#30Does Execution Require Target KV Fidelity? A Mixed-Fidelity KV Runtime for LLM ServingJiantong Jiang, Yue Yang, Peiyu Yang +1cs.LG2026-09-27
#31RelaxKV: Recomputation Guided by the Query with Sparse Context Attention for Efficient KV Cache ReuseRuoling Qi, Yirui Liu, Xuaner Wu +5cs.AI2026-09-27
#32Just Let Linear States Forget the Distant Past: Prefix Caching via Suffix Replay for Hybrid LLMsYirui Liu, Ruoling Qi, Xuaner Wu +6cs.AI2026-09-27
#33GSM: Efficient Language Modeling with Shared Global StateYunao Zheng, Bin Wen, Xiaojie Wang +12cs.CL2026-09-27
#34Resolving State-Representation Mismatch: State-Space Visual Reasoning for Open-Loop VLA PlanningJunhao Xiao, Haoxiang Zhao, Menghao Fang +8cs.CV2026-09-27
#35FoldAttention: Declared-Reference Softmax for Fast Decode and Deterministic BackwardSriman Achantacs.LG2026-09-27
#36OLED-MoE: Accelerating MoE-Based dLLM Inference via Inter-Iteration Locality-Aware Expert OffloadingJingyuan Xiao, Jiayue Wang, Yitao Hu +7cs.DC2026-09-27
#37When to Evict, Not What to Keep: Draft-Guided Eviction for Training-Free KV-Cache CompressionHaeyong Kang, Chang D. Yoocs.LG2026-09-27
#38When Does Backpropagating Through Policy Memory Matter? Physical Credit, Optimizer Updates, and ObservabilityXingjian Li, Yi Han, Jianhua Z. Huangcs.LG2026-09-27
#39FloodDiffusion 2: Efficient and Path Controllable Streaming Motion GenerationYiyi Cai, Yuhan Wu, Kunhang Li +6cs.CV2026-09-27
#40On Device Agentic Operation Caches -- Classifier-Centric NL-to-Action GenerationMoghis Fereidouni, Anthony Arnold, Sumit Gulwani +2cs.AI2026-09-27
#41How Linear Attention RemembersKichang Lee, JaeYeon Park, Songkuk Kim +1cs.LG2026-09-27
#42SketchSSM: Write to the Full State, Read from a Compact SketchOmin Kwon, JoongWon Shin, Minseo Kim +3cs.LG2026-09-27
#43Refreshing Less, Selecting Better: Reusing Stale Gradient Features for Efficient Influence-Based Data SelectionJianchang Su, Yifan Zhang, Wei Zhangcs.LG2026-09-26
#44UniCache: Task- and Type-Aware KV Cache Compression for Unified Multimodal ModelsWanqi Yang, Yuexiao Ma, Mei Xie +2cs.LG2026-09-26
#45Change the Product, Keep the Parameters: Associative Algebra Layers for TransformersIlya Koziev, Ivan Oseledetscs.LG2026-09-26
#46Distance-KV: Exploiting Relative Distance for Efficient Long-Context InferenceXianpeng Shang, Canbin Huang, Jiang Li +4cs.LG2026-09-26
#47KV-Lingo: Learning KV-Cache Translators with DistillationValérie Castin, Keitaro Sakamoto, Anastasiia Filippova +3cs.CL2026-09-26
#48In-Flight KV Cache with Clean Anchors for Faster Autoregressive Video DiffusionYikai Wang, Xiao Han, Mengmeng Xu +9cs.CV2026-09-26
#49UnStep: Training-Free Acceleration of Causal Video Diffusion with Fewer Steps Than DistillationYoussef Mansour, Enis Simsar, Fadime Sener +4cs.CV2026-09-26
#50Carnator: Fast Text-to-Video Generation with Generation-Native Compatibility-Guided Cross-Request ReuseXingkun Yin, Xuebin Tang, Mingkun Xu +1cs.AI2026-09-26

all trends · matching is case-insensitive substring after tokenization