GPT-6 出了 Sol 和 Luna,我测了三轮才把 codex 的活分下去
codex 里的 agent 之前全跑 Astra/high,用量烧得很快。GPT-6 的 Sol 和 Luna 出来以后, 我拿七种模型和 effort 组合在真实 repo 上跑了三轮:自己的 monorepo、工作上三个 repo 的跨项目题、 还有盲测复现历史 PR。代码能写对的比想象中多,但在 agent 自己的集成 runner 里把真实调用路径也跑通的少很多, 好几份自测全绿的提交其实没修好。文末是最后定下来的分工表和几个派活规则。