记忆任务 · 实验索引
RoboDojo · GPT 规划器实验
用 GPT-6 Astra 当规划器,在 RoboDojo 的 6 个记忆任务上比较不同框架和历史设置:每一轮都有成功率、钱花在哪,以及每一局的逐回合回放。
-
第二轮2026-09-27 · 6 个记忆任务 × 3 局 · 配对
只带状态记录(S)vs 纯文字记忆(B)
同一套 RPent 框架、同一个发布包、同一批场景(layout 0,seed 0–2),只换历史设置。S:最近 1 轮 + 携带 STATE + 当前观测;B:最近 2 轮 + 携带 STATE + 调用日志。
成功率相同(各 15/18),S 组总花费是 B 组的 ×0.61(省 39%)。每次调用 ×0.54,调用次数 ×1.15。18 对同场景:14 对都成功,只有 S 成功 1 对,只有 B 成功 1 对,都失败 2 对。
打开对比与回放 →S 组只带状态记录 15/18 成功 $155.28B 组纯文字记忆 15/18 成功 $253.05花费条:两轮用同一个比例尺。
-
第一轮2026-09-27(旧框架 2026-09-24)· 6 个记忆任务 × 3 局
新框架(RPent 纯文字记忆)vs 旧框架
新框架 = RPent(最近 2 轮 + 携带 STATE + 调用日志,即第二轮的 B 组设置);旧框架 = GPT-only do_harness(astra)。不是受控 A/B:工具、回合预算和完成判定都不同,只有 s0 / L0 是同一个场景。
新框架 13/18 vs 旧框架 11/18 成功,总花费是旧框架的 ×6.15。
swap_blocks 不可比:新框架这次关着弹簧按钮复位补丁,这个任务怎么按都不会判成功(旧框架开着);去掉 swap_blocks 后,新框架 13/15 vs 旧框架 8/15。新框架这次还漏装了训练姿态范围库。
打开对比与回放 →新框架RPent 纯文字记忆 13/18 成功 $278.08旧框架do_harness(astra) 11/18 成功 $45.25