2026 年 5 月:AI 编程复盘(工具与效率)
2026 年 5 月的两段 AI 编程复盘:一次 Codex 与 Claude Code 的真实对比,以及月烧 6 亿 Token 之后仍然有效的效率方法。
2026年5月16日 · 更新于 2026年7月16日 · Jackie
这是两段有日期的 AI 编程复盘,都发生在 2026 年 5 月。视频和文章里的模型名称、价格和百分比不作为今天的购买建议,当前选择看 AI 常见问题。
一次 Codex 与 Claude Code 的真实对比
这一段记录 2026 年 5 月的一次真实使用体验。模型和产品已经继续迭代,下面的结论只用于理解当时的选择。
当时发生了什么
任务是优化一个带分组和子菜单的下拉菜单。我先用当时的 Claude 方案,多轮沟通后仍没有得到满意结果;换到当时的 GPT-5.5 与 Codex 后,两轮完成了可接受的版本。
这次体验让我从长期偏爱 Claude,转向把 Codex 作为主力执行工具。但它只是一个任务样本,不能证明某个品牌长期更强。
真正值得保留的判断
- 工具体验来自模型、Agent 设计、界面和任务类型的组合。
- 同一模型在 Chat、CLI、桌面 App 和 API 中可能表现不同。
- 出现连续失败时,先保存证据、缩小任务,再换工具重试。
- 订阅价值要用完成的任务和节省的时间衡量。
今天怎么重新比较
- 选择一个真实、可在 30 到 60 分钟内完成的任务。
- 给两个工具相同的背景、范围和完成标准。
- 记录读取文件、修改范围、验证结果、耗时和费用。
- 至少测试三个不同类型的任务,再决定主力工具。
月烧 6 亿 Token 后,哪些方法仍然有效
仍然有效的五个方法
- 语音输入:先把背景、目标和约束完整说出来,再让 AI 整理任务。
- 能力分层:明确任务用快速层,疑难问题和发布审查用攻坚层。
- 窗口并行:只并行相互独立、能分别验收的任务。
- 批量给背景:一次交代完整上下文,再拆成有边界的子任务。
- 复用 Skills:把稳定、重复的流程做成可检查的指令和脚本。
当时最容易误用的地方
- 一次给十个要求,不代表十个改动都能安全并行。
- Token 消耗高,不等于交付效率高。
- 具体模型组合只对当时的账户、版本和任务有效。
- Skills 不能代替仓库规则、验证命令和人工审查。
今天怎么执行
先写目标、范围和完成标准。只有任务没有共享写入、没有强顺序依赖时,才开多个 Agent。
每个 Agent 使用隔离工作区,完成后查看 diff,运行对应检查,再合并结果。
当前型号和购买建议看 AI 常见问题。