THE CODEX FIELD GUIDE

把模型能力
变成工程结果。

跟进 Astra 与 Codex 的产品变化,收集真实代码库里的任务、工作流和验证方法。 重点不是跑一次 Demo,而是让 Agent 能持续交付。

85 篇中文解读6 个 Astra 实战任务

NOW ROLLING OUT

Astra 现场

OpenAI 官方指南 ↗

TRY THESE IN A REAL CODEBASE

六个任务,真正推一把

查看完整案例 →
01

清理代码赘肉

审计无效测试、薄包装函数、重复抽象和已经失去用途的兼容层。

02

追踪性能收益

先建立基线,再让 Agent 找瓶颈、做有取舍的修改,并用数据证明收益。

03

升级验证闭环

让模型反向列出它缺少的调试入口、测试工具、日志和端到端 QA 流程。

04

清理 PR 与 Issue

批量分诊积压项,识别可关闭、可合并和需要补证据的工作。

05

逐级开放合并

从可回滚的小改动开始,在 PR、Main、Staging、Production 之间设置清晰关卡。

06

接管停滞任务

把长期打转的分支交给新上下文,允许推翻旧实现,以验收标准重新开局。

WORKFLOWS · SKILLS · PROMPTS · CASES

Codex 文章库

83 ARTICLES

Agents API:云端底座

Agents API 把 Codex 的上下文管理、工具调用和多 Agent 协调能力托管化,开发者只需选择任务、模型、工具与运行环境。

阅读全文

OpenAI 的研究 Agent 拐点

OpenAI 首次公开内部编码 Agent 用量、实验速度、任务跨度与安全减速数据。

阅读全文

Agent 的记忆,不该被锁在某个产品里

Hugging Face 开源 funes,把 Claude Code、Codex、pi 与 Hermes 的本地会话轨迹统一成可检索的 Lance 数据集。它保留原始证据与出处,结合向量、BM25、重排和时间衰减,并可同步到用户自己控制的私有 Hugging Face Dataset。

阅读全文

ChatGPT Work 不是聊天:它是一套 Agent Runtime

Simon Willison 拆出 ChatGPT Work 的真实能力边界:联网执行环境、浏览器、持久文件系统、子 Agent、自动化与 Sites,共同组成一套通用任务运行时。

阅读全文

NVIDIA 把 Skill 放进对照实验:正确性从 46 升到 87

NVIDIA 开源 SkillEvaluator,用同一任务在安装与不安装 Skill 的条件下运行 Codex 和 Claude Code,并从结构、安全、去重、正确性、可发现性与效率等维度衡量 Skill 的真实边际贡献。

阅读全文

OpenAI Codex 角色插件:110 个技能,非开发者增速是开发者的 3 倍

OpenAI 为 Codex 推出 6 个角色插件(数据分析、创意生产、销售、产品设计、股票投资、投行),共 62 个应用连接和 110 个技能。非开发者已占 Codex 用户的 20%,增速是开发者的 3 倍。插件模板已开源在 GitHub(MIT 许可)。

阅读全文

OpenAI Codex 开放浏览器开发者模式:CDP 协议让 Agent 能调试网页

OpenAI 为 Codex 内置浏览器和 Chrome 推出开发者模式,支持通过 Chrome DevTools Protocol(CDP)深度调试网页:profile JS 性能、检查控制台输出、监控网络流量、分析 DOM/CSS。每次 CDP 调用需用户授权。

阅读全文

Token Casino:为什么 AI Agent 的「花出去」和「上线」是两笔账,Labs 在卖你筹码

Veeral Patel 的元层观察:AI agent 的 token 经济激励错位——Labs 通过「token 抽象掉美元」「retro terminal 让你进 flow」「lifetime tokens 变 X 上炫耀的数字」三招,让用户像在赌场里一样持续烧 token,但没产出可上线的产品。Calvin French-Owen(前 Codex 工程师)说『agent 经常做错事,你会追损』——这是赌徒行为。AI 把 execution 变近乎免费,但把 align-before-build 的压力也拆掉了。两条对抗思路:align agents first、pay for outcomes 不 pay for tokens。

阅读全文

Codex 的 8 个 Coding 之外高频场景:一个 Power User 是怎么把它用成日常办公助手的

小盖总结的 8 个 Codex Coding 之外的高频场景:配图(信息型 HTML / Excalidraw 手绘 / PPT 插图)、磁盘清理、长文转 Slides、会议纪要(含多会议串分析)、飞书接入(含飞书文档 @Codex)、微信读书、部署网站、HR/法务/财务琐事。每一条都是真实场景+工具链的组合,不是 prompt 玄学。

阅读全文

Harness 才是产品:决定 Coding Agent 体验的不是 Model,是它周围的整套 Runtime

马东锡 NLP 把 coding agent 拆成六个核心组件:Live repo context、Prompt shape、Structured tools、Context reduction、Transcripts and memory、Delegation。Model 在 loop 里,harness 拥有 loop。Anything that must be reliable belongs in the harness.

阅读全文

Loop Engineering:你不再 prompt Agent,你设计让 Agent 自己跑的循环

Addy Osmani 提炼出 Loop 的五件套 + 一个外部记忆:Automations、Worktrees、Skills、Plugins/Connectors、Sub-agents,Claude Code 和 Codex 都已经集齐,循环工程把工程师从逐轮 prompt 的人变成系统设计者。

阅读全文

10 个 Codex Skills 覆盖中文内容创作者整套流程:写作+配图+封面+小红书卡片的最小套装

Joruno 整理的 10 个 Codex Skills 清单,覆盖中文内容创作者一整套生产流程:去 AI 味(Humanizer-zh)、选题诊断(dbskill)、完整写作(content-research-writer)、资料型写作(NotebookLM skill)、长文流(khazix-skills)、中文配图(ian-xiaohei-illustrations)、小红书卡片(guizang-social-card-skill)、视觉工具箱(baoyu-skills)、PPT/封面(guizang-ppt-skill)、HTML/海报(html-anything)。仓库 stars 全部核验。给出 5 个最小推荐套装(按 3+2 分层)+ 创作链顺序 + 选型决策树:先看痛点属于哪一段(写作/配图/分发),再装对应 skill。

阅读全文

Hermes Agent 怎么配模型:不是选最强,是搭一个能跑几个小时不心痛的栈

zaimiri 给 Hermes Agent 出了一份 7 模型选型指南:Codex OAuth(默认、订阅制去心理 taximeter)/ Claude Sonnet 4.6(高代价任务的 judgment)/ Gemini Pro+Flash(长上下文 + 便宜辅助)/ DeepSeek(日常 worker)/ Grok(xAI 生态用户)/ Qwen3 Coder(编程向便宜)/ OpenRouter(一把钥匙多模型)/ Nous Portal(all-in-one 入门)。每条都带适用场景、setup 命令、caveat。结论:Hermes 是 OS 不是聊天窗,模型按 job 路由不是按 ego 选。

阅读全文

Emmett:HTML 品牌资产正在替代 PDF 品牌指南——当 Agent 接手执行,定价的形状也跟着变

Emmett Shine 长文详解:精品创意工作室给早期 founder 的 deliverable 已经从"网站 / PDF 品牌指南"变成 "/human + /agent 双 zip",agent 端用 YAML/JSON/Markdown/HTML/CSS/SVG 编码整套品牌系统,丢进 Claude Design/Cursor/Codex 就能生成 landing page。核心论点:执行层被 agent 接管后,价值向项目最开头集中—— **定位 / 品味 / 灵感(magic_trick.md)才是卖的东西,输出只是副产品。**

阅读全文

Xudong Han 个人 Agent 合集:30 天把 EvoPaw 养成只懂你的工作系统

Xudong Han 把过去一个多月 X 系列串成一篇完整合集:为什么自己搭 Agent 是主权问题、15 天从 0 到日常使用的 5 步流程、Vibe Coding 的命门是把模糊需求逼成 spec、测试是换模型换底层的胆量、Claude Code 8 个配置 + Codex 10 个 TOML 配置、superpowers 5 个 skill、双模型互审破解自我盲区。

阅读全文

Matt Van Horn 六月 Agentic Engineering 攻略:plan.md + 语音 + 6 个并行 Tab

Notion 联创 Matt Van Horn 把他一年 agentic engineering 实战整理成 18 条 hack:plan.md 是给 agent 的契约、语音输入是 LLM 时代才真正可用的输入方式、6 个并行 Tab 跑不同任务、YOLO 模式 + 声音 hook 是 6 session 不爆炸的关键、Codex 跟 Claude 配对当第二引擎。

阅读全文

CC Switch 3.16 本地路由:让 Codex CLI 真正接进 DeepSeek 与 Kimi

新版 Codex CLI 强制走 OpenAI Responses API,但 DeepSeek/Kimi/硅基流动这些供应商只暴露 Chat Completions 接口。CC Switch 3.16 用本地路由(127.0.0.1:15721)做协议中转——Codex 发 Responses,路由改写为 Chat,上游返回再转回 Responses。这套本地代理模式正在成为模型网关的事实标准。

阅读全文

0xShimei:10 分钟搭 AI 自生长知识库——Obsidian + Codex 让信息自动帮你干活

中文社区的 Obsidian+Codex 自生长知识库方案:4 个文件夹(A 原料库 / B 概念库 / C Skill 库 / D 输出库)形成闭环。Codex 定期从 A 消化进 B,从 B 提炼出 C 的方法论模板,再按任务从 C 调用生成 D。核心是"消化系统"而非"收藏夹"——信息进去,干货出来,不用你手动搬运。

阅读全文

Codex Skill 是 AI 工作流入口

Codex 不只是对话工具,Skill 体系才是它的真正的上限。通过 impeccable、taste skill、Frontend App Builder 这三条路径,可以把 AI 从「能跑」升级到「能看」。

阅读全文

苍何开源 CodexGuide:最全 Codex 实战指南

开发者苍何用两周时间整理了 Codex 桌面端、CLI、ChatGPT 端和手机端的完整使用教程,包括 Plus 订阅避坑指南和远程操控方案,开源在 GitHub 并配有独立网站。

阅读全文

Codex 5.5 "变笨"?可能是本地文件膨胀

Codex 5.5 推理质量下降的一个被忽视原因:~/.codex 目录下的状态库、日志、会话记录持续膨胀,拖累响应速度。附安全清理步骤。

阅读全文

Codex的10个工作流用法:从码农到任务设计师

老爸的AI联萌总结的Codex进阶用法:固定线程、看现场、/goal合约、steering和queue、工具选择、skill沉淀、AGENTS.md规则、自动化、质量门、角色转变。

阅读全文

Codex Goals模式:让AI自己跑到达标为止

知野介绍Codex Goals模式:不再一步步推动,而是设定最终目标让AI自主检查、迭代、直到达标。包含六个写好Goal的要素。

阅读全文

Claude Code vs Codex:100 小时实测对比

Nate Herk 对 Claude Code 和 Codex 进行 100 小时深度实测,发现两者功能重叠度极高,但哲学差异明显:Claude 是可定制的工作流系统,Codex 是统一的交付机器。

阅读全文

国产模型 API 接入 Codex:10 个核心玩法实测

卡尔的 AI 沃茨实测将阶跃星辰 Step Plan 接入 Codex App 的完整方案:API 模式保留完整功能(手机端、锁屏、截屏),step-router-v1 自动在 deepseek-v4-pro 和 step-3.5-flash 间切换,附一键安装脚本和 10 个核心玩法验证。

阅读全文

开源 Agent 的护城河:当 Codex 和 Claude 补齐记忆与定时任务

Chris Wang 分析开源 Agent(Hermes/OpenClaw)在 Codex/Claude 快速补齐功能后的生存逻辑:记忆、本地执行、定时任务等旧护城河已被侵蚀,真正的差异化在于"调度层"——不是做大厨,而是做餐厅老板。

阅读全文

Codex /goal 实战指南:从"继续"到"验收单"

Codex 的 /goal 不是让 AI 瞎跑更久,而是给它一张清清楚楚的验收单。核心原则:别写愿望,写验收;别催继续,给清单;别信口头完成,看测试和 diff。附三个文件(PLAN.md / EXPERIMENTS.md / EXPERIMENT_NOTES.md)管理长任务记忆。

阅读全文

Codex 连接问题排查:一次说清 Reconnecting 1/5 的原因和三种解法

Suu 分析了 Codex 频繁出现 Reconnecting 1/5 的根本原因:WebSocket 在代理环境下握手失败,分享了强制 HTTP、配置代理、开 TUN 模式三种解法。

阅读全文

OpenAI 工程师的 9 条 Codex 用法

OpenAI 工程师 Jason Liu 分享了 9 条 Codex 用法:持久线程、共享记忆、语音输入、Steering、Computer Use、远程控制、Heartbeat、Goal 和 Side Panel。

阅读全文

用 Obsidian 作为 Codex 的跨项目长期记忆库

逸尘分享了一个巧妙方案:用外置 Obsidian Vault 长期保存 Codex 重要记忆,解决 Codex 跨项目遗忘问题。

阅读全文

2026 年 Codex 精通指南(构建者课程)

Avid 用 Claude Code 12 个月后转投 Codex 30 天,发现这不是更聪明的自动补全,而是完整的 Agentic 软件开发平台。

阅读全文

Codex 深度使用指南:OpenAI 工程师的实战心法

OpenAI 工程师 Jason Liu 分享 Codex 从"代码工具"进化为"工作操作系统"的完整实践:持久线程、语音输入、Heartbeats、Goals、侧边栏等核心功能的高阶用法。

阅读全文

Codex 逆向文生图提示词:双 Agent 协作工作流

阅读全文

Open Design 集成 Codex:设计意图全流程保持

Open Design 新增 Codex 集成支持,Agent 可直接操作画布,实现设计→代码→动效的一体化工作流。

阅读全文

/goal 命令的产品经理视角:从模糊需求到可验证目标

George 从产品经理视角分析 Claude Code /goal 和 Codex /goal 命令的本质:不是更智能的模型,而是 Ralph Wiggum 循环的产品化封装。核心洞察是需求必须变成可验证的目标状态——包含可观察行为、负面案例、范围边界、验证证据、停止条件和状态报告。

阅读全文

/goal 只是八分之一:Intent Engineering 完整框架

Paweł Huryn 指出 OpenAI 和 Anthropic 的 /goal 命令只覆盖了 Intent Engineering 框架的 2/8(Objective + Desired Outcomes)。真正让 Agent 在生产环境可靠运行的,是另外六个被忽略的部分:Strategy、Health Metrics、Org Context、Constraints、Autonomy Boundaries、Stop Rules。

阅读全文

Kimi Web Bridge 发布:Agent 像人类一样操作浏览器

月之暗面发布 Kimi Web Bridge 浏览器扩展:Agent 可搜索、滚动、点击、输入并完成任务。支持 Kimi Code CLI、Claude Code、Cursor、Codex、Hermes 等主流 Coding Agent。

阅读全文

/goal:Coding Agent 的新原语

/goal 不是功能,是原语。Codex、Claude Code、Hermes 三家 converge 到同一指令格式,让不同工具可组合。从 prompting(你驱动)到 assigning(Agent 向目标驱动)。

阅读全文

/goal 命令终极指南:让 AI Agent 24/7 自主工作

Anthropic、OpenAI 等都在推 /goal 命令——让 AI Agent 在闭环中自主完成任务,无需人工逐轮批准。从语法到高级 prompt 结构,从研究到编码到视觉设计的完整用例。

阅读全文

Vercel 产品设计团队真正在用的工具

Hannah Hearth 分享 Vercel 产品设计团队的工具现状:AI 设计工作流落后于工程、Claude+Codex 结对编程、并行线程保持心流、从生产环境设计、Figma 仍是探索首选。

阅读全文

agentmemory:给 Claude/Cursor/Codex 装上无限记忆

agentmemory 开源项目 3 天获得 4000+ stars,用本地服务替代 CLAUDE.md/.cursorrules 等静态文件记忆方案。通过 12 个 Claude Code lifecycle hook 自动捕获会话,四层记忆压缩,混合检索(BM25 + 向量 + 图谱),实现跨会话的无限记忆。

阅读全文

Codex Goals 实战指南:如何让 Agent 连续运行数天

OpenAI 的 Chris Hayduk 分享 Codex /goal 模式的高效使用技巧:目标必须具体可量化、反馈循环要尽可能快、用 markdown 文件(PLAN.md / EXPERIMENTS.md / EXPERIMENT_NOTES.md)让 Agent 持久化思考状态,从而支持数天的连续运行。

阅读全文

Open Design:用 Coding Agent 三分钟做绝美 PPT

尹珉实测 Open Design:不自带 AI 引擎,直接调用本地 Claude Code/Codex 等 16 种 coding agent CLI,通过 31 个内置 Skill + 72 套 Design System + Discovery Form + 5 维自检,让 agent 从写代码切换到做 PPT。

阅读全文

Codex for Product Marketing:PMM 的三种日常用法

OpenAI Codex 首位 PMM 分享三种日常用法:作为个人助理整合跨工具信号、深入产品和工程源码理解变更、快速生成交叉职能对齐文档。

阅读全文

Codex 知识库自动进化系统:从书签到持久记忆

Ziwen 分享如何用 Codex + Obsidian 构建自动进化的知识库:每天自动抓取 X 书签和 YouTube 观看列表,通过每日/每周审计 prompt 让 AI 持续自我升级。

阅读全文

Codex App 完全入门指南:把一个超级 AI 工作台的每个细节讲清楚

一篇面向小白的 Codex App 完整教程:从界面分区、插件系统、权限设置到实际使用场景,手把手带你从 0 到 1 上手这个 AI 超级工作台。

阅读全文

Peter Yang:聊天时代即将结束

140K 订阅的 Peter Yang 宣布自己和许多 AI builder 已从 ChatGPT/Claude 聊天切换到 Codex/Claude Code——因为后者能做实事,前者只能聊天。下一阶段是让普通用户也能用 Agent,方法是让 AI 在聊天 App 里内置 Agent 能力,而不是让他们学 CLI。

阅读全文

Long-Running Agent 需要的不只是 Ralph Loop

Jarrod Watts 实测 Codex /goal 功能后提出三个核心缺陷:歧义累积、多角色胜出、跨上下文记忆,并给出自己的完整工作流:setup phase + 多 Agent 协作 + 四文件记忆系统。

阅读全文

Codex 更新总结:GPT-5.5 + Chrome 扩展 + CLI 0.129

OpenAI Codex 五月更新汇总:GPT-5.5 成默认模型、Chrome 扩展上线、CLI 迈入 0.129 时代。快速了解 Codex 当前能力边界。

阅读全文

Codex + GPT Image-2 视频制作工作流:先出图再复刻成代码

外包一个几十秒的产品视频要上万块,但可以不打开任何剪辑软件,只用代码跑出来。核心:先用 GPT-Image-2 把每个场景的视觉预演图出好,再把图交给 Codex 复刻成代码。

阅读全文

Claude Code 和 Codex 不是同一个工具

大多数团队把这两个 AI Agent CLI 当成可互换的工具——然后在错误的配置下多花 40-60% 的修正轮次。问题不是模型,是控制平面。一个持久化记忆并通过 hooks 执行规则,另一个沙盒一切、阻断网络、每次运行重置。

阅读全文

Codex + HyperFrames:代码驱动的视频剪辑自由

自媒体人 Sac 分享用 Codex + HyperFrames 做视频的实战经验——不用打开剪辑软件,直接写代码生成视频。基础剪辑和动画 1 小时搞定。

阅读全文

Entire 发布跨 Agent Skills:让 Claude/Codex/Cursor 读懂你的代码历史

Entire.io 开源了跨 Agent Skills 仓库,让 Claude Code、Codex、Cursor 等编码 Agent 能搜索过去的工作、理解代码意图、接手其他 Agent 的会话——本质是给 Agent 装上长期记忆。

阅读全文

Codex 新功能:/goal 六小时自主运行实录

作者实测 Codex CLI 的持久化目标功能,历时 6 小时 44 分钟的自主运行,间隔 5.5 小时后无缝继续,token 成本因 94% 缓存命中率大幅降低。

阅读全文

GPT-5.5 + GPT-Image-2 + Codex:一张截图生成一个 Artemis II 任务 App

OpenAI 技术讲师分享 GPT-5.5 和 GPT-Image-2 组合用法:先用图像模型生成 UI 设计稿,再交给 GPT-5.5/Codex 实现,最成功的做法是两个步骤分开到两个独立 session 里做。

阅读全文

什么是Agent Harness:框架与 Harness 的根本区别

Aparna Dhinakaran 厘清 Agent Harness 的真正定义:Harness 是从编码 Agent 底向上演化出来的架构(Cursor/Claude Code/Windsurf/Codex),不是 LangChain/LangGraph 那种给人类搭框架的工具。Harness 的核心是 while 循环驱动的闭环,框架是人工配置状态图。两者根本不同:框架为人类设计,Harness 为 Agent 设计。

阅读全文

Codex 全攻略:OpenAI 最被低估的产品

OpenAI 工程师 Riley Brown 在 Startup Ideas Podcast 上做了个 Codex masterclass。核心论点:Codex = Claude Code + Cowork,一个产品覆盖所有 agent 工作流。GUI 赢了终端,Skills 是可复用 agent 的正确打开方式。

阅读全文

Coding Assistant 对决:SemiAnalysis 硬核横评 GPT-5.5 vs Opus 4.7

SemiAnalysis 工程师实战对比 GPT-5.5 与 Opus 4.7,发现两者各有胜负:Codex 更擅长精准执行和数据推理,Claude 更擅长理解和做规划。核心结论是「每任务成本」而非「每 Token 成本」才是真正的北极星指标。

阅读全文

OpenAI 给 Responses API 加 WebSocket:Agent 循环快 40%,原来是协议开销在拖后腿

OpenAI 在 Responses API 中引入 WebSocket 持久连接,解决了一个在 GPU 推理速度提升后才变得显著的问题:当模型吞吐量从 65 tokens/s 跃升到近 1000 tokens/s 后,API 层面的处理开销(对话历史重建、安全分类、token 重新渲染、计费等)反而成了 Agent 循环的主要延迟来源,而不是模型推理本身。WebSocket 方案通过在连接内维护缓存(response 对象、工具定义、已渲染 token),让后续请求复用已计算的状态,而非每次从头重建。实测结果:Agent 端到端循环快 40%,首 token 延迟提升近 45%,GPT-5.3-Codex-Spark 的峰值吞吐达到 4000 tokens/s。方案刻意选择 WebSocket 而非 gRPC,理由是不需要开发者重构已有 API 集成结构。OpenAI 称这是「Responses API 自 2025 年 3 月发布以来最重要的新能力之一」。

阅读全文

OpenAI Workspace Agents:Codex 驱动企业 Agent,离线运行 + 工具调用 + 人工审批流

OpenAI 推出 Workspace Agents,将 Codex 能力打包成企业级 Agent 产品,面向 ChatGPT Business、Enterprise、Edu 和 Teachers 计划。核心特点:Agent 在云端运行,用户离线后继续执行;可写代码、调用已集成工具、跨会话保持记忆;团队描述重复工作流,ChatGPT 引导创建自动化 Agent。产品内置四层防护:防 prompt injection 攻击、对外部内容进行内容分类、敏感操作(发邮件、改表格)需人工审批、管理员通过 Compliance API 监控 Agent 配置和执行历史。OpenAI 提供了五类预置用例模板:软件需求审查机器人、产品反馈路由 Agent、周报生成 Agent、销售线索邮件草稿 Agent、供应商风险评估 Agent。定价为研究预览期间(截至 2026 年 5 月 6 日)免费,之后切换为 credit 计费。

阅读全文

GPT-Image-2 全面发布:Elo 领先第二名 242 分,图像生成正在成为代码 Agent 的前端接口

OpenAI 于 2026 年 4 月 22 日正式在 ChatGPT、API 和 Codex 全面推出 GPT-Image-2,并立即完成与 Figma、Canva、Adobe Firefly 等平台的集成。Arena 排行榜上,GPT-Image-2 在文本到图像得分 1512,单图编辑 1513,多图编辑 1464,比第二名领先 242 Elo 分。核心提升集中在文字渲染精度、布局保真度和多语言支持。"Thinking" 模式支持联网搜索、多候选生成和输出自检。最重要的产品信号:评测者强调这个模型的价值不在艺术创作而在实用场景——UI 设计稿、信息图表、幻灯片——图像生成正在成为代码 Agent 的前端接口。

阅读全文

Cursor Bugbot 从用户反馈中自动生成规则:代码审查解决率达 78%,超越所有竞品

Cursor 的 AI 代码审查工具 Bugbot 推出自学习机制,解决率从 beta 阶段的 52% 提升至 78.13%,超过 Greptile(63%)、CodeRabbit(49%)、GitHub Copilot(47%)、Codex(45%)和 Gemini Code Assist(31%)。学习信号来自三个实时源:用户对评论的 downvote(无用信号)、开发者的回复说明(改进信号)、人工审查员标注的遗漏问题(能力边界信号)。系统将这些信号转化为候选规则,累积足够证据后激活影响后续审查;产生持续负反馈的规则则被禁用。11 万个仓库启用学习能力,累计生成 4.4 万条规则。

阅读全文

Claude Code 定价争议:Simon Willison 的公开质问与 Anthropic 的 A/B 测试代价

Anthropic 曾短暂将 Claude Code 的定价页面更新为仅限 $100-$200/月 Max 计划,随后几小时内回滚,但据称实验在后台继续进行。Simon Willison 今日发文详解这一事件的多层影响:$20→$100 对非高收入国家用户是质的跨越;用推文而非官方公告处理定价变更伤害了用户信任;潜在用户开始质疑继续投入学习成本是否值得。Willison 指出 Codex 团队已公开承诺维持 $20 计划,要求 Anthropic 给出同等的明确承诺,否则将把教学内容迁移到 Codex。

阅读全文

我是如何不再需要向 Codex 解释任何事情的

OpenAI 工程师 Dominik Kundel 分享了他如何把 Codex 从一个需要手把手指导的工具,变成一个能自主理解上下文、了解他的工具偏好和工作习惯的同事。关键:Chronicle 屏幕记忆 + 个人 Vault + 多源上下文注入,让他只需要说\"同步文档草稿然后消息 Romain\",Codex 就能自己搞定全部流程。

阅读全文

编程 Agent 的六个核心构件:Sebastian Raschka 的拆解手册

Sebastian Raschka(《从零构建大型语言模型》作者)系统拆解了编程 Agent 的架构设计:为什么 Claude Code、Codex CLI 这类工具用同样的模型,却比普通聊天界面感觉强大得多?答案在于 Agent Harness——包裹在 LLM 外层的控制循环。Raschka 归纳了编程 Agent 的六个核心构件:Repo Context(仓库上下文注入)、Tool Design(工具设计与边界)、Prompt Cache Stability(Prompt 缓存稳定性)、Memory(短期/长期记忆管理)、Long-Session Continuity(长会话连续性)以及 Agent Loop(目标驱动循环机制)。文章同时厘清了三个常被混淆的概念:LLM 是核心预测引擎,Reasoning Model 是强化推理版本,Agent 是在两者之上叠加的任务执行控制层。这一区分对于理解为什么"换个更好的模型"不能解决所有编程任务问题至关重要,因为 Agent Harness 本身的设计决定了大部分实际使用体验。

阅读全文

mcp-cli:让 AI Agent 免交 fork/exec 税,73% 系统调用开销消失

madeye 开源 mcp-cli,通过 sidecar-daemon + MCP bridge 架构,让 Claude Code/Codex 通过 Unix Domain Socket 直接访问项目文件系统/git状态/源码,省去每次 shell 工具调用的 fork+exec 开销。Codex 测试:execve 调用从 83 次降到 22 次(-73%),rg 调用从 13 次降到 0 次。

阅读全文

构建 Claude/Codex Skills 完整指南:提示词时代的终结

把 AI 当通用聊天机器人用的时代正式结束。Top 1% 在构建 Skills,其余 99% 还在写提示词。这是 Anthropic 2025年10月发布的 Skills 开放规范完整技术指南。

阅读全文

Codex App自动化升级:让AI主动盯着你的PR和项目进度

Codex App推出线程自动化:每15分钟主动监控指定线程,自动创建/更新自动化、追踪Notion数据库项目进度、PR冲突合并、Slack/GitHub集成——AI不再被动响应,主动巡逻你的工作流。

阅读全文

Codex 长线程自动化:让一个线程持续替你盯住工作

Nick Baumann 介绍了自己如何把 Codex 线程变成长期运行的工作队友:定时检查 Slack、Gmail、PR 和日历,只在真正改变优先级时打断他。

阅读全文

Warp 推出 Universal Agent Support:把终端变成多 Agent 编码的指挥台

Warp 终端发布 Universal Agent Support,让 Warp 成为支持所有主流编码 Agent CLI(Claude Code、Codex、Gemini CLI、OpenCode)的通用工作台。新功能:垂直 Tab(多 Agent 分组+元数据)、Tab Configs(一键初始化环境)、统一通知中心、Inline 代码审查(直接推送评论到运行中的 Agent session)、Attach 代码为上下文、Rich Input(多行提示词+语音+@上下文)、Remote Control(云端监控+远程操控)。核心理念:终端才是 Agentic 开发最好的地方。

阅读全文

与其喂文档,不如给 AI 造个专用命令

OpenAI Codex 团队工程师 Nick Baumann 的工作流:把常用操作封装成带参数、输出 JSON、有帮助文档的 CLI,让 Codex 自己串命令链。三个真实案例:对话检索、Slack 搜索、推文排期。

阅读全文

OpenAI Codex 上线官方用例库:工作流即用即开

OpenAI Codex use cases 页面把常见任务整理成可执行工作流,每个用例包含适用场景、starter prompt 以及相关插件和 skills。

阅读全文

Codex 最好的工具是定制 CLI:Nick Baumann 的 Agent 工具设计方法论

Nick Baumann(OpenAI Codex 团队)分享了他设计 Codex 工具的核心原则:Connector/MCP 适合简单 API 访问,但复杂/noisy/大量数据源应该封装成 CLI——精确命令、稳定 JSON、可预测错误、帮助文档。三个真实案例:codex-threads、slack-cli、typefully-cli。

阅读全文

Compound Engineering 2.64.0:Codex 委托、因果调试、会话挖掘三大更新

Compound Engineering 发布 2.64.0,带来三个重要新功能:Codex 委托(Claude 保留规划权,Codex 执行代码)、ce-debug(因果链门控调试)、ce-sessions(跨 Claude Code/Codex/Cursor 挖掘历史会话洞察)。同时移除 Swarm 模式,token 效率提升 30%+。

阅读全文

Multica:把编码Agent变成真正的团队成员

Multica是一个多Agent协作平台,把Claude Code和Codex变成有档案库、有看板、有评论、有技能积累的真正团队成员。

阅读全文

把你的X书签变成本地知识库

Field Theory CLI把X书签同步到本地,用BM25全文搜索+SQLite FTS5索引,支持Claude Code、Codex等agent直接调用。数据留在本地,无遥测。

阅读全文

Codex 团队如何用自己的产品构建产品

OpenAI Codex 团队访谈:整个产品 spec 只有 10 个要点,50-100 人团队长期只有一个 PM,海盗船式运作。设计师写的代码超过六个月前一个工程师的产出。PM 是填空岗位,不是领导岗位。

阅读全文

Anthropic封禁第三方OAuth后:Claude替代方案与人格化三步改造指南

Meta Alchemist 梳理Anthropic封禁后的Claude替代品:GLM 5.1、Minimax 2.7、Codex各有什么优势,以及三步Skill系统让人格化任何模型接近Claude水准。

阅读全文

团队 Skills 管理:Git + Symlink 的实战经验

用 Codex CLI 的 .agents/skills 目录管理 Skills,Git 版本控制和 Symlink 是核心,既能保持版本干净,又能让 Agent 直接在 Repo 里改完提 PR。

阅读全文

Cline Kanban:CLI无关的多Agent编排,独立应用来了

Cline发布独立Kanban应用:工作树运行任务、点击审核diff、卡片链接形成依赖链、Claude和Codex双兼容。1.4M浏览量。

阅读全文

客户对话 Agent 的六大硬伤

Sierra 联合创始人 Vijay Iyengar 拆解客户对话 Agent 六大硬伤,解释为何不能直接用 Claude Code 或 Codex 拼。

阅读全文

用 Codex 在 1 小时内进入陌生行业:建行业操作系统

Aron厚玉 的方法论:进入陌生行业时不是 Google + 收藏夹 200 链接,而是用 Codex 帮你建结构化的行业操作系统——品牌库、产品库、痛点库、关键词库、竞品拆解、内容生态分类、知识地图。4 步把零散信息变成可复用的认知体系。

阅读全文

30 分钟搭出完整 Codex 工作流:14 步从空白到上线

servasyy 给出 14 步把 Codex 用出 97% 能力的实操路线图:建文件夹、写 AGENTS.md、计划模式、.env.local、MCP、Skills、部署、调度、QA,30 分钟从空白到生产。

阅读全文