PaperScope
LIVE · 2026-09-15 05:40 UTC

Pull: Lazy Materialization of Working Memory for Stateful LLM Conversations

Jiangang Chen

Latestcs.CLcs.LGcs.AIcs.CV
arXiv ID
2609.14773 v1
Category
Submitted
2026-09-13

Abstract

As LLM conversations grow to hundreds of turns, full-context injection incurs $O(N^2)$ cumulative token costs, while lossy summarization or hard truncation irreversibly discards historical state. We propose Pull, a session router that maintains an addressable metadata directory via a local, deterministic Purifier (zero LLM calls, millisecond-level latency). At query time, the LLM lazily materializes only the turns it needs; unmaterialized turns remain accessible but collapsed. Unlike irreversible compression, Pull's materialization is reversible; subsequent queries can expand any collapsed turn. On LoCoEval (128 conversations, 12,780 turns), Pull reduces per-query context tokens (Phase 2) by 75.1 percent on single-hop tasks with equivalent quality ($Δ= -0.002$, n.s.) and by 72.0 percent on multi-hop tasks with no quality loss ($Δ= +0.017$). A controlled routing benchmark (7,831 queries x 10 methods) shows that entity lifecycle tracking is empirically a prerequisite for distance-independent routing. On BEAM 1M (14 conversations, 263 questions), Pull improves F1 by +55.2 percent over a truncation baseline.

Comment: 12 pages, 3 figures. An earlier version was publicly released on Zenodo (DOI: 10.5281/zenodo.21984705). Code and reproduction scripts: https://github.com/wulun811/kongmen-pull

arXiv abs page · PDF · same-day batch