Prefix locality
Prefix Locality前缀局部性是指在 LLM 推理服务中不同请求或同一用户的连续请求的 Prompt 开头部分前缀 Token 序列高度重合的现象。它是现代大模型推理引擎如 SGLang、vLLM 等实现Automatic Prefix Caching自动前缀缓存和极低 TTFT首字延迟的理论基础。常见的 Prefix Locality 场景System Prompt系统提示词如“你是一个精通 C 和 compiler 的 AI 助手…”所有并发请求头部都带有这一段固定的系统设定。多轮对话Multi-turn Chat第NNN轮对话的输入天然包含了前N−1N-1N−1轮的全部历史对话内容作为前缀。RAG / 长文档问答多个用户针对同一篇长 PDF 或知识库文档提出不同的问题长文档本身构成了公共前缀。Agent / Few-shot 模板智能体调用的固定思考范式ReAct 模板或少样本示例Few-shot Examples。系统工程如何利用 Prefix Locality由于 LLM 的 Attention 机制具有自回归特性相同的前缀 Token 序列算出来的 KV Cache 是完全一致的。推理引擎利用这一点做缓存优化Radix Tree / 树状管理如 SGLang RadixAttention推理引擎在内存/显存管理器里维持一棵基数树Radix Tree将已计算过的 KV Cache 按 Token 序列节点缓存起来。命中与零开销复用Prefix Cache Hit当新请求进来时调度器先在树上做前缀匹配。若命中长度为LLL的前缀系统直接跳过这LLL个 Token 的 Prefill 计算直接拉取现成的 KV Cache。缓存淘汰策略LRU / LFU当 KV Capacity 紧张时调度器会优先释放最久未被复用的前缀分支 Block保留热点前缀。带来的核心收益降低 TTFT首字延迟长 Prompt 的 Prefill 耗时大幅缩减首字响应速度提升数倍至数十倍。节省算力Save Compute FLOPs避免了对重复前缀做昂贵的 GEMM 矩阵乘法计算。提高系统总吞吐Throughput将省下来的算力与显存空间分配给更多的 Decode 或新请求。