Tag: transformer
All the articles with the tag "transformer".
-
从 GPT-2 到 KimiK3:七年 22580 倍的架构演进
Published: at 11:56 PM从 GPT-2 的 softmax attention 出发,历经 Linear Attention、DeltaNet、Gated DeltaNet、Kimi Linear,最终到达 KimiK3 的混合架构。七年内模型参数增长 22580 倍,但真正的变化发生在注意力机制如何存储、更新和检索信息的方式上。
-
Less is More:当精简的 Harness 在基准测试中击败了功能完备的对手
Published: at 09:16 PMDatabricks 百万行代码基准测试揭示了一个反直觉的结果:Pi 每轮发送的上下文仅为 Claude Code 的约 1/3,但任务完成率持平。这篇文章深入分析两种截然不同的 harness 设计哲学,以及为什么在 Transformer 架构下更少的信息反而能带来更好的决策质量。