大模型生成内容是逐个 Token 蹦出来的。每产生一个新词,Transformer 都要计算当前词与之前所有词的关联。KV Cache 的逻辑很简单:把已经算好的 Key 和 Value 向量存进显存,下次直接复用,模型只需为新词计算 Query。这就像写文章,你不需要每写一个字都从头构思整篇大纲,只需盯着新落下的笔尖,同时大脑自动关联已写好的内容。 这是典型的“空间换时间”。KV Cache 是 ...
平台声明:该文观点仅代表作者本人,搜狐号系信息发布平台,搜狐仅提供信息存储空间服务。