提示词结构会系统地生成状态对象,继而影响存储架构以及 LLM 推理和 RAG 的服务质量要求。
本白皮书提供了一种映射框架,将提示层与状态对象(KV 缓存块、检索载荷和工具工件)、I/O 模式、主要 SLO 以及分层部署决策相连接,从而将“提示词工程”重新定义为一门基础设施学科。
由此衍生出两项采购级别的启示:
生产环境所用提示词是经过编译的上下文集合,其中包含策略、模板、用户意图、会话历史记录、检索到的证据、工具模式以及工具输出结果。对于给定的模型和服务栈,提示词结构决定了哪些状态对象会被实例化(KV 缓存块、检索载荷、工具工件),以及它们如何进行扩展。
这些状态对象会形成可衡量的 I/O 模式和服务质量要求。上下文窗口在不断扩大(某些模型支持百万词元的窗口),这增加了预填充工作量并扩大了状态占用空间。1长上下文和智能体循环会增加状态;并发则会成倍增加状态。
如果您的提示词包含固定长前缀、锚定规则、工具架构和检索载荷,实则已然选定了分层架构设计,以及高并发场景下的尾延迟性能指标。
通过下方链接阅读完整的白皮书,了解更多信息。
Jeff Harthorn 是 Solidigm 的 AI 应用研究负责人,他的工作重点是研究 AI 工作负载与存储架构之间的关系,尤其侧重于推理、上下文内存以及数据管道设计。Jeff 结合应用研究、基准测试和技术传播工作,把复杂的基础设施主题转化为对客户、合作伙伴以及高层领导具有实际指导意义的见解。他拥有加州州立大学萨克拉门托分校计算机工程理学学士学位。
1) Google,《长上下文》,Gemini API 文档 (Google AI for Developers)。来源:https://ai.google.dev/gemini-api/docs/long-context(访问时间:2026 年 2 月 24 日)。(Google AI for Developers)
2) 英伟达,《依托 CPU 与 GPU 协同,实现大语言模型大规模推理加速及键值缓存卸载》(Accelerate Large-Scale LLM Inference and KV Cache Offload with CPU-GPU),
英伟达技术博客(2025 年 9 月 5 日)。来源:https://developer.nvidia.com/blog/accelerate-large-scale-llm-inference-and-kv-cache-offload-with-cpu-gpu-memory-sharing/(访问时间:2026 年 2 月 24 日)。(NVIDIA Developer)
3) Hugging Face,《键值缓存策略》(KV cache strategies),Transformers 文档 (v4.55.4)。来源:https://huggingface.co/docs/transformers/v4.55.4/en/kv_cache(访问时间:2026 年 2 月 24 日)。(Hugging Face)
4) W. Kwon 等人,《基于 PagedAttention 的大语言模型服务高效内存管理》(Efficient Memory Management for Large Language Model Serving with PagedAttention),arXiv:2309.06180。来源:https://arxiv.org/abs/2309.06180(访问时间:2026 年 2 月 24 日)。(arXiv)
5) J. Dean 和 L. A. Barroso,《大规模场景下的长尾延迟问题》(The Tail at Scale),《Communications of the ACM》,第 56 卷,第 74–80 页(2013 年)。来源:https://research.google/pubs/the-tail-at-scale/(访问时间:2026 年 2 月 24 日)。(Google Research)
6) 英特尔,《面向 PCIe 与 NVMe 企业级固态硬盘的性能基准测试》(Performance Benchmarking for PCIe* and NVMe* Enterprise Solid-State Drives),白皮书(2015 年 2 月)。来源:https://www.intel.com/content/dam/www/public/us/en/documents/white-papers/performance-pcie-nvme-enterprise-ssds-white-paper.pdf(访问时间:2026 年 2 月 24 日)。(intel.com)
7) S.-H. Cho 等人,《面向低延迟固态硬盘的高效垃圾回收算法》(Efficient Garbage Collection Algorithm for Low Latency SSD),《Electronics》,第 11 卷,第 7 期,第 1084 页(2022 年)。来源:https://www.mdpi.com/2079-9292/11/7/1084(访问时间:2026 年 2 月 24 日)。(MDPI)