GPT-6 Astra缓存按前缀复用,跨组织与跨区域有边界
OpenAI提示缓存可以复用重复输入的计算,但复用范围、账户隔离和客户成本分摊是不同问题。GPT-6 Astra应用若服务多个中文客户,需要区分稳定提示前缀、组织与区域边界,以及prompt_cache_key的核算用途,不能把一个自定义键理解成跨账户共享缓存或重复使用旧答案的开关。

把多名客户的请求接入GPT-6 Astra时,重复的系统说明或工具定义可能带来提示缓存收益,但这也不意味着所有账户共享一份缓存。OpenAI现行指南明确,缓存不会在不同组织之间共享,也不会跨越区域数据处理边界。对中文软件服务商而言,降低重复输入成本与确认数据隔离,应作为两个问题分别检查。
提示缓存利用的是输入前缀相同的部分。指南建议把稳定内容放在前面,把每次变化的材料放在后面。若系统说明、工具定义或前面的对话记录不断变化,后续请求就可能无法复用原来的前缀。由此可见,缓存策略首先涉及请求的组织方式,而不是简单地增加一个参数,就保证所有输入都能享受同等复用效果。
文档还规定,提示达到至少一千零二十四个可见输入令牌时,才满足缓存的起始长度要求。OpenAI内部加入的隐藏内容不计入这一门槛。开发者因此应依据自己提供的实际输入判断,而不能把模型上下文总量、输出长度,或供应商内部指令猜测为可用的缓存长度。达到门槛也不等于每次都会命中缓存。请求中一段位于提示开头、每次都会变化的日期或客户资料,也可能改变其后的可复用前缀。
缓存的保留时间另有规则。指南说明,自最近一次写入或复用起,缓存至少保留三十分钟,也可能保留更久。这个时间描述的是计算复用的生命周期,并不能单独替代账户整体的数据保留政策。中文团队若评估敏感材料的处理条件,应同时核查适用的产品与区域设置,不宜从缓存时长直接推导所有请求记录何时删除。
容易误解的还有prompt_cache_key。官方现行说明称,在GPT-5.6及更新模型上,该参数是可选的,可用于按客户、用户或工作区划分缓存成本核算。需要分组时,应让同一组的键保持稳定;它并不是提高缓存效果的必要条件。较旧模型对该字段的路由行为另有说明,不能把旧经验不加区分地迁移到Astra。
这意味着,一家服务多个客户的应用可以同时面对两层安排:请求内容决定哪些前缀可被复用,自定义键帮助区分相关核算。组织及区域边界则仍由平台规则约束,不能因为两个请求使用了相同的键,就推断它们可以越过隔离边界。把这些概念分开,也有助于解释同样长的请求为何出现不同的缓存统计。
提示缓存不是答案缓存。后续请求仍会生成新的输出,输入计算的复用并不保证回答与前一次相同。本文依据供应商文档说明运行条件,没有对实际命中率、延迟或账单开展实验;应用最终应结合真实请求的使用统计,验证前缀安排与客户核算是否符合自身需求。
프리즘코리아 편집국 > 林知远



