大模型架构下的注意力(attention)机制本质上是一套记忆系统:每个词把自己写进上下文,后面的词再从中读取。过去十年,几乎所有的改进都在讨论“读”:该从哪里读、按什么权重读;却很少有人追问“写”:一个词写进记忆时,应该原样存进去,还是只存下它相对 ...