提示词剖析

将“提示词工程”重新定义为一门基础设施学科

提示词结构会系统地生成状态对象,继而影响存储架构以及 LLM 推理和 RAG 的服务质量要求。

本白皮书提供了一种映射框架,将提示层与状态对象(KV 缓存块、检索载荷和工具工件)、I/O 模式、主要 SLO 以及分层部署决策相连接,从而将“提示词工程”重新定义为一门基础设施学科。

由此衍生出两项采购级别的启示:

  1. 通过在并发环境下进行 KV 扩展,长上下文和智能体工作流将“每次会话 GB 数”转变为“每个机组 TB 数”;
  2. RAG 的行为类似于队列深度较低的随机读取工作负载,其 p99/p99.9 延迟(而非高队列深度下的标称 IOPS)决定了最终用户的首次词元获取时间。

生产环境所用提示词是经过编译的上下文集合,其中包含策略、模板、用户意图、会话历史记录、检索到的证据、工具模式以及工具输出结果。对于给定的模型和服务栈,提示词结构决定了哪些状态对象会被实例化(KV 缓存块、检索载荷、工具工件),以及它们如何进行扩展。

这些状态对象会形成可衡量的 I/O 模式和服务质量要求。上下文窗口在不断扩大(某些模型支持百万词元的窗口),这增加了预填充工作量并扩大了状态占用空间。1长上下文和智能体循环会增加状态;并发则会成倍增加状态。

  • KV 缓存成为主要的运行中工作集,并成为 TTFT、ITL 稳定性和成本的首要限制因素。2、3、4
  • 在并发环境下,RAG 的行为类似于队列深度较浅的随机读取工作负载。
  • 采购成效取决于在真实并发和混合负载条件下,队列深度为 1–4 时的 p99/p99.9 延迟,而非高队列深度下的峰值 IOPS 或峰值 GB/s。5、6、7

如果您的提示词包含固定长前缀、锚定规则、工具架构和检索载荷,实则已然选定了分层架构设计,以及高并发场景下的尾延迟性能指标。

通过下方链接阅读完整的白皮书,了解更多信息。


关于作者

Jeff Harthorn 是 Solidigm 的 AI 应用研究负责人,他的工作重点是研究 AI 工作负载与存储架构之间的关系,尤其侧重于推理、上下文内存以及数据管道设计。Jeff 结合应用研究、基准测试和技术传播工作,把复杂的基础设施主题转化为对客户、合作伙伴以及高层领导具有实际指导意义的见解。他拥有加州州立大学萨克拉门托分校计算机工程理学学士学位。

参考资料

1) Google,《长上下文》,Gemini API 文档 (Google AI for Developers)。来源:https://ai.google.dev/gemini-api/docs/long-context(访问时间:2026 年 2 月 24 日)。(Google AI for Developers

2) 英伟达,《依托 CPU 与 GPU 协同,实现大语言模型大规模推理加速及键值缓存卸载》(Accelerate Large-Scale LLM Inference and KV Cache Offload with CPU-GPU),

英伟达技术博客(2025 年 9 月 5 日)。来源:https://developer.nvidia.com/blog/accelerate-large-scale-llm-inference-and-kv-cache-offload-with-cpu-gpu-memory-sharing/(访问时间:2026 年 2 月 24 日)。(NVIDIA Developer)

3) Hugging Face,《键值缓存策略》(KV cache strategies),Transformers 文档 (v4.55.4)。来源:https://huggingface.co/docs/transformers/v4.55.4/en/kv_cache(访问时间:2026 年 2 月 24 日)。(Hugging Face)

4) W. Kwon 等人,《基于 PagedAttention 的大语言模型服务高效内存管理》(Efficient Memory Management for Large Language Model Serving with PagedAttention),arXiv:2309.06180。来源:https://arxiv.org/abs/2309.06180(访问时间:2026 年 2 月 24 日)。(arXiv)

5) J. Dean 和 L. A. Barroso,《大规模场景下的长尾延迟问题》(The Tail at Scale),《Communications of the ACM》,第 56 卷,第 74–80 页(2013 年)。来源:https://research.google/pubs/the-tail-at-scale/(访问时间:2026 年 2 月 24 日)。(Google Research)

6) 英特尔,《面向 PCIe 与 NVMe 企业级固态硬盘的性能基准测试》(Performance Benchmarking for PCIe* and NVMe* Enterprise Solid-State Drives),白皮书(2015 年 2 月)。来源:https://www.intel.com/content/dam/www/public/us/en/documents/white-papers/performance-pcie-nvme-enterprise-ssds-white-paper.pdf(访问时间:2026 年 2 月 24 日)。(intel.com)

7) S.-H. Cho 等人,《面向低延迟固态硬盘的高效垃圾回收算法》(Efficient Garbage Collection Algorithm for Low Latency SSD),《Electronics》,第 11 卷,第 7 期,第 1084 页(2022 年)。来源:https://www.mdpi.com/2079-9292/11/7/1084(访问时间:2026 年 2 月 24 日)。(MDPI)