Tag: LLM
All the articles with the tag "LLM".
-
四种 LLM 缓存:省在哪里,错在哪里
Published: at 12:12 AM从 KV、Prefix、Prompt 到 Semantic Cache,讲清四种 LLM 缓存保存什么、何时命中、为何失效,以及生产环境该如何排查成本、延迟与错误命中。
-
RAG 其实没那么复杂:六种检索架构怎么选
Published: at 04:41 AM很多 RAG 项目一开始就上向量库、切块和重排,复杂度先于问题出现。本文拆解六种检索方案,从 BM25 与查询改写开始,按数据新鲜度、查询类型、规模和实测结果选择升级路径,并给出多意图查询与验证清单。
-
Agent 成本高,先查 Harness
Published: at 08:20 AM同一个模型和任务,Agent 仍可能因为上下文膨胀与工具调用过多而多花几倍 token。本文拆解 Harness 的成本来源,并用 TrueForge 说明延迟加载、结果卸载、子代理、Code Mode 与压缩如何协同。
-
Agent Harness 是什么?模型之外的运行环境
Published: at 12:47 AMAgent Harness 给大模型提供指令、工具、执行循环与模型切换能力。本文用登山安全带和邮件代理的例子讲清四部分,并解释用户为什么能自主运行、换模型并保留本地会话。
-
AI 工程能力地图:从模型到生产
Published: at 11:52 AMAndrew Ng 将 AI 工程拆成六类能力:理解模型、准备上下文、设计 Agent、建立评测、运行生产系统和掌握机器学习基础。本文把这张地图整理成一套判断学习重点与工程工作的框架。
-
ChatGPT Agent 循环优化:Harness、API 与推理层的三层提效实践
Published: at 12:39 AMBytebytego 与 OpenAI 工程师深入交流,拆解了 ChatGPT Agent 在 Harness 接入层、API 中间层和推理层分别采用了哪些优化手段来降低单次任务成本。文章梳理了持久 WebSocket、增量请求、缓存感知路由、推测解码等 11 项具体技术及其协同关系。
-
从 GPT-2 到 KimiK3:七年 22580 倍的架构演进
Published: at 11:56 PM从 GPT-2 的 softmax attention 出发,历经 Linear Attention、DeltaNet、Gated DeltaNet、Kimi Linear,最终到达 KimiK3 的混合架构。七年内模型参数增长 22580 倍,但真正的变化发生在注意力机制如何存储、更新和检索信息的方式上。