场景定位
把 Codex 作为可评分的改进循环,用于攻克复杂任务。 本页把官方 use case 的章节、工具、起步提示词和检查点整理成中文执行流程,便于直接对照落地。
- 难度
- 中级
- 时间跨度
- 约 30-60 分钟
适合用于
- 需要把「把 Codex 作为可评分的改进循环,用于攻克复杂任务。」做成可复用流程的团队
- 希望 ChatGPT 或 Codex 保留来源、检查点和可审阅输出的使用者
- 需要把「迭代解决困难问题」从一次性对话变成可复查工作流的场景
Starter Prompt
起步提示词
I have a difficult task in this workspace and I want you to run it as an eval-driven improvement loop.
Before changing anything:
- Read `AGENTS.md`.
- Find the script or command that scores the current output.
Iteration loop:
- Make one focused improvement at a time.
- Re-run the eval command after each meaningful change.
- Log the scores and what changed.
- Inspect generated artifacts directly. If the output is visual, use `view_image`.
- Keep going until both the overall score and the LLM average are above 90%.
Constraints:
- Do not stop at the first acceptable result.
- Do not revert to an earlier version unless the new result is clearly worse in scores or artifacts.
- If the eval improves but is still below target, explain the bottleneck and continue.
Output:
- current best scores
- log of major iterations
- remaining risks or weak spots 在 ChatGPT 中尝试 介绍
这一节对应官方流程中的「Introduction」。落地时围绕「迭代解决困难问题」把目标、输入、执行步骤和验证证据保持在同一条工作流里。
操作要点:把已确认的上下文转成「迭代解决困难问题」所需的可审阅草稿或交付物,并关注 Codex 等相关来源或工具,并保留后续修改入口。
操作要点:围绕「Introduction」推进「迭代解决困难问题」时,保持目标、输入、执行步骤和验证结果一致,并关注 Codex 等相关来源或工具。
从 evals 开始
这一节对应官方流程中的「Start with evals」。落地时围绕「迭代解决困难问题」把目标、输入、执行步骤和验证证据保持在同一条工作流里。
操作要点:在继续执行前检查来源、假设、受众、权限和输出质量;不确定内容应进入待确认列表。
操作要点:在继续执行前检查来源、假设、受众、权限和输出质量,并关注 Codex 等相关来源或工具;不确定内容应进入待确认列表。
操作要点:运行最小可信验证并保存证据,让后续审查能看到命令、结果和失败处理方式。
- 在继续执行前检查来源、假设、受众、权限和输出质量;不确定内容应进入待确认列表。
- 在继续执行前检查来源、假设、受众、权限和输出质量;不确定内容应进入待确认列表。
提供 Codex a stopping rule
这一节对应官方流程中的「Give Codex a stopping rule」。落地时围绕「迭代解决困难问题」把目标、输入、执行步骤和验证证据保持在同一条工作流里。
操作要点:围绕「Give Codex a stopping rule」推进「迭代解决困难问题」时,保持目标、输入、执行步骤和验证结果一致。
操作要点:围绕「Give Codex a stopping rule」推进「迭代解决困难问题」时,保持目标、输入、执行步骤和验证结果一致。
操作要点:运行最小可信验证并保存证据,并关注 Codex 等相关来源或工具,让后续审查能看到命令、结果和失败处理方式。
- 围绕「Give Codex a stopping rule」推进「迭代解决困难问题」时,保持目标、输入、执行步骤和验证结果一致。
- 围绕「Give Codex a stopping rule」推进「迭代解决困难问题」时,保持目标、输入、执行步骤和验证结果一致。
- 围绕「Give Codex a stopping rule」推进「迭代解决困难问题」时,保持目标、输入、执行步骤和验证结果一致,并关注 Codex 等相关来源或工具。
保持 a running log of the loop
执行阶段要让 ChatGPT 或 Codex 留下可复现证据:运行命令、检查输出、记录失败点,并在必要时把流程收窄到最小可验证步骤。
操作要点:先把本节需要的来源材料、权限和上下文补齐,并关注 Codex 等相关来源或工具;缺失内容要明确标记,不要让 ChatGPT 或 Codex 隐式猜测。
操作要点:运行最小可信验证并保存证据,让后续审查能看到命令、结果和失败处理方式。
操作要点:运行最小可信验证并保存证据,让后续审查能看到命令、结果和失败处理方式。
- 围绕「Keep a running log of the loop」推进「迭代解决困难问题」时,保持目标、输入、执行步骤和验证结果一致。
- 围绕「Keep a running log of the loop」推进「迭代解决困难问题」时,保持目标、输入、执行步骤和验证结果一致。
- 围绕「Keep a running log of the loop」推进「迭代解决困难问题」时,保持目标、输入、执行步骤和验证结果一致。
- what Codex 计划 to try next
Inspect the artifact, not just the logs
这一节对应官方流程中的「Inspect the artifact, not just the logs」。落地时围绕「迭代解决困难问题」把目标、输入、执行步骤和验证证据保持在同一条工作流里。
操作要点:围绕「Inspect the artifact, not just the logs」推进「迭代解决困难问题」时,保持目标、输入、执行步骤和验证结果一致,并关注 Codex 等相关来源或工具。
操作要点:围绕「Inspect the artifact, not just the logs」推进「迭代解决困难问题」时,保持目标、输入、执行步骤和验证结果一致,并关注 Codex 等相关来源或工具。
操作要点:围绕「Inspect the artifact, not just the logs」推进「迭代解决困难问题」时,保持目标、输入、执行步骤和验证结果一致。
操作要点:运行最小可信验证并保存证据,让后续审查能看到命令、结果和失败处理方式。
- 围绕「Inspect the artifact, not just the logs」推进「迭代解决困难问题」时,保持目标、输入、执行步骤和验证结果一致。
- 围绕「Inspect the artifact, not just the logs」推进「迭代解决困难问题」时,保持目标、输入、执行步骤和验证结果一致。
- 围绕「Inspect the artifact, not just the logs」推进「迭代解决困难问题」时,保持目标、输入、执行步骤和验证结果一致。
让 every iteration explicit 可执行
这一节对应官方流程中的「Make every iteration explicit」。落地时围绕「迭代解决困难问题」把目标、输入、执行步骤和验证证据保持在同一条工作流里。
操作要点:围绕「Make every iteration explicit」推进「迭代解决困难问题」时,保持目标、输入、执行步骤和验证结果一致,并关注 Codex 等相关来源或工具。
操作要点:围绕「Make every iteration explicit」推进「迭代解决困难问题」时,保持目标、输入、执行步骤和验证结果一致,并关注 Codex 等相关来源或工具。
- 运行最小可信验证并保存证据,让后续审查能看到命令、结果和失败处理方式。
- 围绕「Make every iteration explicit」推进「迭代解决困难问题」时,保持目标、输入、执行步骤和验证结果一致。
- 围绕「Make every iteration explicit」推进「迭代解决困难问题」时,保持目标、输入、执行步骤和验证结果一致。
- Re-运行 the evals.
- 围绕「Make every iteration explicit」推进「迭代解决困难问题」时,保持目标、输入、执行步骤和验证结果一致。
- 围绕「Make every iteration explicit」推进「迭代解决困难问题」时,保持目标、输入、执行步骤和验证结果一致。
Prompt Library
建议提示词
先界定范围
For Iterate on difficult problems, first inspect the available sources and propose the smallest useful scope. Name the inputs, outputs, validation steps, permissions, and anything that needs approval before action. 交付前复核
Review the result for Iterate on difficult problems. Check source coverage, assumptions, unresolved questions, and the evidence that proves the output is ready to use.