Tag: Agent
All the articles with the tag "Agent".
-
ChatGPT Work 实测:与 Chat 到底差在哪
Published: at 01:48 AMOpenAI 上线两个月的 ChatGPT Work 到底与普通 Chat 有何不同?本文以 Simon Willison 的实测为底,并核对官方文档,讲清联网代码执行、无头浏览器、持久文件、Sites、子代理与安全边界。
-
AI 编程时代,软件基础仍是核心
Published: at 01:34 PMAndrew Ng 认为,coding agent 可以扩大开发者的工作范围,却无法替你判断延迟、可靠性、成本和安全边界。本文把软件基础整理成全栈、数据、架构与生产能力四个检查方向。
-
Agent Harness 是什么?模型之外的运行环境
Published: at 12:47 AMAgent Harness 给大模型提供指令、工具、执行循环与模型切换能力。本文用登山安全带和邮件代理的例子讲清四部分,并解释用户为什么能自主运行、换模型并保留本地会话。
-
AI 工程能力地图:从模型到生产
Published: at 11:52 AMAndrew Ng 将 AI 工程拆成六类能力:理解模型、准备上下文、设计 Agent、建立评测、运行生产系统和掌握机器学习基础。本文把这张地图整理成一套判断学习重点与工程工作的框架。
-
Codex 多代理编排:给 Sol 一个团队
Published: at 11:48 PMGPT-5.6 Sol 有了团队才更有意思。整理 Codex Multi-Agent V2 的实战编排:Scout/Worker/智能 Worker 分工、推理档位匹配、上下文继承、并发预算与技能固化,附作者编排技能原文。
-
Agentic Code Quality:质量藏在约束里
Published: at 06:26 AMAI agent 每天生成海量代码,逐行 review 已不可行。本文梳理 Addy Osmani 的约束驱动质量框架:质量门有哪些形态、背压如何贯穿管道、人类注意力该投向哪里,附 Guillermo 清单与自主性分级模型。
-
在 C# 中构建 MCP 服务器和客户端:完整指南
Published: at 01:05 PM从零构建 MCP Server 和 Client:Stdio 与 Streamable HTTP 传输、工具/资源/提示词的定义方式、依赖注入、安全认证、Azure 部署,以及 MCP Inspector 调试方法。
-
AI 基准测试没告诉你的那些事:为什么排行榜高分不等于你的场景好用
Published: at 12:05 AM新模型发布,SWE-bench 92%,朋友圈刷屏「最强编码模型」。你切过去跑了一圈,结果跟之前差不多,甚至更差了。问题出在哪?本文从 Goodhart 定律出发,拆解基准测试的五个隐蔽问题:分布差距、优化过拟合、Harness 差异,以及为什么你的私有代码和团队约定才是唯一有效的评测标准。