最新文章

AI 与 Agent 前沿的中文解读与一手原文。

1408
质量与安全2026-09-19阅读约 4 分钟

Evals 终极 FAQ:教过 700 个工程师后的全部答案

Hamel Husain 与 Shreya Shankar 把教 700+ 工程师和 PM 时被问最多的问题整理成一篇 40 问的 FAQ。核心立场:evals 不是基建工程,是从看数据开始的纪律——先错误分析,再谈自动化。

解读 + 原文
产品与应用2026-09-18阅读约 4 分钟

Claude Design 的创造者怎么用自家产品

Anthropic 产品设计师 Nate Parrott 亲述 Claude Design 的诞生:一个为了跟上工程师交付速度的 side project,发现 HTML 才是 Claude 的视觉母语,最终长成覆盖幻灯片到动画的视觉创作媒介。

解读 + 原文
工具与行动2026-09-18阅读约 4 分钟

Anthropic 官方 Skill 解剖:社媒内容引擎

Anthropic knowledge-work-plugins 仓里一个完整 SKILL.md:给小企业主管社媒内容的长设运营 skill。九步流程、三道审批关口、配额预算制,是生产级 skill 写作的实战教材。

解读 + 原文
部署与运行2026-09-18阅读约 3 分钟

把 Jev 插进 Agent Loop 当决策器

LangChain 工程师 Sydney Runkle 演示怎么把 TypeSafe 的 Jev 接进 agent loop:不替代 LLM,而是在循环里替它做快速分类决策——模型路由和危险动作拦截两个场景已经给出 middleware 实现。

解读 + 原文
记忆与上下文2026-09-18阅读约 5 分钟

上下文工程选型图:什么信息、何时给模型

Mastra 的 context engineering 指南把'给模型看什么'拆成九种机制和一道选择题:指令、内联、工具、RAG、文件系统、记忆、观察记忆、信号、动态技能。

解读 + 原文
模型进展2026-09-18阅读约 3 分钟

Harness 税:Claude 不必配 Claude Code

UC Berkeley × Arena 实测 7 模型 × 3 harness 共 21 种组合:harness 对成功率影响甚微,对成本影响可达 5 倍,且原厂 harness 多数情况不是最优配。

解读 + 原文
模型进展2026-09-18阅读约 4 分钟

TypeSafe:不做聊天,造给机器用的模型

OpenAI RLHF 方向的元老 Diogo Almeida 两年隐身创业,发布 System One Models 和首个模型 Jev:输出类型化决策而非字符串,快两个数量级,且数学上不可能有类型错误。

解读 + 原文
工具与行动2026-09-17阅读约 7 分钟

AI 吃掉战术层后,工程师还剩什么

Matt Pocock 与 The Pragmatic Engineer 96 分钟对谈精编:grill me、spec→tickets、wayfinder 工作流,以及把 25 年前软件工程经典术语变成提示词的'引导词'发现。

解读 + 原文
AI 编程2026-09-17阅读约 5 分钟

网页动效词典中篇:20 个提示词词条

Vibe Coding 动效词典中篇,补完动效类型层第 17-36 词条:文字动效、滚动与空间、鼠标指针互动,每条附适用边界和可直接抄给 AI 的句式。

解读 + 原文
Agent 设计2026-09-17阅读约 6 分钟

把 Agent 当新员工来装备

LangChain 开源了自家管五个广告平台的投放 Agent。六个月做到 20% 管线、CPL 降 30%,真正的干货是六条反直觉的工程教训。

解读 + 原文
部署与运行2026-09-17阅读约 4 分钟

Agent = 模型 + Harness,胜负在后者

LangChain 提出 agent = model + harness 的定义:harness 的职责是每一步给模型喂对上下文,middleware 是定制它的原语。

解读 + 原文
Agent 设计2026-09-11阅读约 7 分钟

Agent Loop 正在变成托管资源

OpenAI、Anthropic、AWS、微软先后把 agent loop 托管化。文章拆解托管 harness 的七个共同模式,回答谁该拥有 agent loop。

解读 + 原文
Agent 设计2026-09-11阅读约 4 分钟

Agents API:云端底座

Agents API 把 Codex 的上下文管理、工具调用和多 Agent 协调能力托管化,开发者只需选择任务、模型、工具与运行环境。

解读 + 原文
产品与应用2026-09-11阅读约 4 分钟

让人人都能让数据干活

Data agent 把企业数据、语义层和 BI 工具接入对话,让更多非技术人员用自然语言完成分析、看板和后续行动。

解读 + 原文
质量与安全2026-09-11阅读约 5 分钟

Astra 的电脑操作为何变强

Astra 用可访问性树、持久会话和 Guardian 安全审查,把电脑操作从看图点击推进到可验证的代码执行循环。

解读 + 原文
质量与安全2026-09-07阅读约 3 分钟

OpenAI 首席科学家要求减速

Jakub Pachocki 判断递归自我改进正在逼近,并呼吁共享安全门槛与国际协调。

解读 + 原文
质量与安全2026-09-07阅读约 3 分钟

一封邮件让 Agent 擅自付款

九种模型读取注入邮件,部分在无授权下创建付款单,517 次付款仅 4 次告警。

解读 + 原文
模型进展2026-09-07阅读约 3 分钟

Claude 写出可机检的费马证明

Claude 用 Lean 完成费马大定理形式化,11 天生成约 1300 万行证明代码。

解读 + 原文
AI 编程2026-09-07阅读约 3 分钟

OpenAI 的研究 Agent 拐点

OpenAI 首次公开内部编码 Agent 用量、实验速度、任务跨度与安全减速数据。

解读 + 原文
Agent 设计2026-09-06阅读约 8 分钟

高效商业 Agent 的完整架构

Anthropic 总结生产级商业 Agent 的架构、延迟、缓存、记忆、安全与评测方法。

解读 + 原文
质量与安全2026-09-06阅读约 3 分钟

Git 配置劫持了七种代码 Agent

Manifold Security 在七种代码 Agent 中发现同类漏洞:后台 Git 采集会信任仓库配置,可能在审批与沙箱之外执行命令。

解读 + 原文
Agent 设计2026-09-06阅读约 2 分钟

让 Agent 自己接管客服闭环

Olly 用不到 500 行 TypeScript 打通 Agent 与人工支持:经用户同意携带上下文升级,再把人工回复翻译后送回原会话。

解读 + 原文
模型进展2026-09-06阅读约 2 分钟

LLM 正在让大家做同一种产品

Armin Ronacher 从一次 CarPlay 硬件改造出发,追问一个被忽略的问题:当开发者都向相似模型寻求灵感时,模型是否在悄悄收敛产品方向。

解读 + 原文
Agent 设计2026-09-06阅读约 3 分钟

用蜜罐反过来诱捕 Agent

Thinkst 把传统 Canary 改造成对话诱饵,利用攻击 Agent 的目标导向与可暗示性触发告警,并在内部多模型靶场中实现全部命中。

解读 + 原文