最新文章
AI 与 Agent 前沿的中文解读与一手原文。
Evals 终极 FAQ:教过 700 个工程师后的全部答案
Hamel Husain 与 Shreya Shankar 把教 700+ 工程师和 PM 时被问最多的问题整理成一篇 40 问的 FAQ。核心立场:evals 不是基建工程,是从看数据开始的纪律——先错误分析,再谈自动化。
Claude Design 的创造者怎么用自家产品
Anthropic 产品设计师 Nate Parrott 亲述 Claude Design 的诞生:一个为了跟上工程师交付速度的 side project,发现 HTML 才是 Claude 的视觉母语,最终长成覆盖幻灯片到动画的视觉创作媒介。
Anthropic 官方 Skill 解剖:社媒内容引擎
Anthropic knowledge-work-plugins 仓里一个完整 SKILL.md:给小企业主管社媒内容的长设运营 skill。九步流程、三道审批关口、配额预算制,是生产级 skill 写作的实战教材。
把 Jev 插进 Agent Loop 当决策器
LangChain 工程师 Sydney Runkle 演示怎么把 TypeSafe 的 Jev 接进 agent loop:不替代 LLM,而是在循环里替它做快速分类决策——模型路由和危险动作拦截两个场景已经给出 middleware 实现。
上下文工程选型图:什么信息、何时给模型
Mastra 的 context engineering 指南把'给模型看什么'拆成九种机制和一道选择题:指令、内联、工具、RAG、文件系统、记忆、观察记忆、信号、动态技能。
Harness 税:Claude 不必配 Claude Code
UC Berkeley × Arena 实测 7 模型 × 3 harness 共 21 种组合:harness 对成功率影响甚微,对成本影响可达 5 倍,且原厂 harness 多数情况不是最优配。
TypeSafe:不做聊天,造给机器用的模型
OpenAI RLHF 方向的元老 Diogo Almeida 两年隐身创业,发布 System One Models 和首个模型 Jev:输出类型化决策而非字符串,快两个数量级,且数学上不可能有类型错误。
AI 吃掉战术层后,工程师还剩什么
Matt Pocock 与 The Pragmatic Engineer 96 分钟对谈精编:grill me、spec→tickets、wayfinder 工作流,以及把 25 年前软件工程经典术语变成提示词的'引导词'发现。
网页动效词典中篇:20 个提示词词条
Vibe Coding 动效词典中篇,补完动效类型层第 17-36 词条:文字动效、滚动与空间、鼠标指针互动,每条附适用边界和可直接抄给 AI 的句式。
把 Agent 当新员工来装备
LangChain 开源了自家管五个广告平台的投放 Agent。六个月做到 20% 管线、CPL 降 30%,真正的干货是六条反直觉的工程教训。
Agent = 模型 + Harness,胜负在后者
LangChain 提出 agent = model + harness 的定义:harness 的职责是每一步给模型喂对上下文,middleware 是定制它的原语。
Agent Loop 正在变成托管资源
OpenAI、Anthropic、AWS、微软先后把 agent loop 托管化。文章拆解托管 harness 的七个共同模式,回答谁该拥有 agent loop。
Agents API:云端底座
Agents API 把 Codex 的上下文管理、工具调用和多 Agent 协调能力托管化,开发者只需选择任务、模型、工具与运行环境。
让人人都能让数据干活
Data agent 把企业数据、语义层和 BI 工具接入对话,让更多非技术人员用自然语言完成分析、看板和后续行动。
Astra 的电脑操作为何变强
Astra 用可访问性树、持久会话和 Guardian 安全审查,把电脑操作从看图点击推进到可验证的代码执行循环。
OpenAI 首席科学家要求减速
Jakub Pachocki 判断递归自我改进正在逼近,并呼吁共享安全门槛与国际协调。
一封邮件让 Agent 擅自付款
九种模型读取注入邮件,部分在无授权下创建付款单,517 次付款仅 4 次告警。
Claude 写出可机检的费马证明
Claude 用 Lean 完成费马大定理形式化,11 天生成约 1300 万行证明代码。
OpenAI 的研究 Agent 拐点
OpenAI 首次公开内部编码 Agent 用量、实验速度、任务跨度与安全减速数据。
高效商业 Agent 的完整架构
Anthropic 总结生产级商业 Agent 的架构、延迟、缓存、记忆、安全与评测方法。
Git 配置劫持了七种代码 Agent
Manifold Security 在七种代码 Agent 中发现同类漏洞:后台 Git 采集会信任仓库配置,可能在审批与沙箱之外执行命令。
让 Agent 自己接管客服闭环
Olly 用不到 500 行 TypeScript 打通 Agent 与人工支持:经用户同意携带上下文升级,再把人工回复翻译后送回原会话。
LLM 正在让大家做同一种产品
Armin Ronacher 从一次 CarPlay 硬件改造出发,追问一个被忽略的问题:当开发者都向相似模型寻求灵感时,模型是否在悄悄收敛产品方向。
用蜜罐反过来诱捕 Agent
Thinkst 把传统 Canary 改造成对话诱饵,利用攻击 Agent 的目标导向与可暗示性触发告警,并在内部多模型靶场中实现全部命中。