记忆任务 · 实验索引
RoboDojo · GPT 规划器实验
用 GPT-6 Astra 当规划器,在 RoboDojo 的 6 个记忆任务上比较不同框架、历史设置和观测文字:每一轮都有成功率、钱花在哪,以及每一局的逐回合回放。第一轮的页面在主结果站。
钱花在哪了:各轮对比
每次调用的钱 = 缓存写入(12.5 USD/M)+ 缓存读取(1 USD/M)+ 输出(50 USD/M)。缓存只认「与上一次请求相同的开头」,所以请求越短、开头越稳定,重写的越少。
| 方案 | 成功 | 总花费 | 每格调用 | 每次输入 token | 缓存命中 | 每次重写 token | 每次调用 缓存写入 缓存读取 输出 |
|---|---|---|---|---|---|---|---|
| 旧框架do_harness(astra),第一轮对照 | 11/18 | $45 | 23 | 9,181 | 17% | 7,609 | $0.110 |
| B · 第一轮纯文字记忆,缺按钮补丁和姿态库 | 13/18 | $278 | 99 | 15,268 | 26% | 11,364 | $0.156 |
| B · 第二轮纯文字记忆:最近 2 轮 + STATE + 调用日志 | 15/18 | $253 | 89 | 15,483 | 25% | 11,560 | $0.158 |
| S · 第二轮只带状态记录:最近 1 轮 + STATE + 当前观测 | 15/18 | $155 | 102 | 10,576 | 48% | 5,451 | $0.085 |
| SC · 第三轮S + 精简每轮文字 | 14/18 | $79 | 95 | 6,830 | 66% | 2,356 | $0.046 |
- 少带历史(B → S):每次调用 $0.158 → $0.085,缓存命中 25% → 48%,成功率不变(15/18 vs 15/18)。
- 精简每轮文字(S → SC):每次调用 → $0.046,每次输入 10,576 → 6,830 token,每次重写进缓存 5,451 → 2,356;成功 14/18(少 1 格,imitate 白等的问题补跑已修好)。
- 还没省下来的是调用次数:RPent 每格 89–102 次,旧框架 23 次;所以 SC 总花费仍是旧框架的 1.7 倍。下一步省钱主要靠减少调用次数。
-
第三轮2026-09-28 · 6 个记忆任务 × 3 局 · 与第二轮 S 组配对
精简文字(SC)vs 完整文字(S)
SC = 第二轮 S 组的历史设置(最近 1 轮 + 携带 STATE + 当前观测)+ 精简观测文字(compact_v1);S = 第二轮的 S 组(2026-09-27,同一批 18 局)。两次独立运行、发布包不同,但框架相同、场景相同(layout 0,seed 0–2),按任务 + seed 配对。
SC 14/18 vs S 15/18 成功(SC 组少 1 格),SC 组总花费是 S 组的 ×0.51(省 49%)。每次调用 ×0.54,调用次数 ×0.93。18 对同场景:12 对都成功,只有 SC 成功 2 对,只有 S 成功 3 对,都失败 1 对。
2 个补跑,各在 SC 上改一处:imitate_sorting_sequence(保留当前官方步数)2/3,同任务 SC 1/3,不再白等;press_by_number(计数规则)2/3,同任务 SC 2/3,没有再多按。
打开对比、补跑与回放 →SC 组只带状态记录 + 精简文字 14/18 成功 $78.68S 组只带状态记录,完整文字 15/18 成功 $155.28补跑(各 3 局,只跑一个任务)
补跑 SCL2/3 成功$26.59补跑 SCR2/3 成功$19.56花费条:三轮用同一个比例尺。
-
第二轮2026-09-27 · 6 个记忆任务 × 3 局 · 配对
只带状态记录(S)vs 纯文字记忆(B)
同一套 RPent 框架、同一个发布包、同一批场景(layout 0,seed 0–2),只换历史设置。S:最近 1 轮 + 携带 STATE + 当前观测;B:最近 2 轮 + 携带 STATE + 调用日志。
成功率相同(各 15/18),S 组总花费是 B 组的 ×0.61(省 39%)。每次调用 ×0.54,调用次数 ×1.15。18 对同场景:14 对都成功,只有 S 成功 1 对,只有 B 成功 1 对,都失败 2 对。
打开对比与回放 →S 组只带状态记录 15/18 成功 $155.28B 组纯文字记忆 15/18 成功 $253.05 -
第一轮在主结果站2026-09-27(旧框架 2026-09-24)· 6 个记忆任务 × 3 局
新框架(RPent 纯文字记忆)vs 旧框架
新框架 = RPent(最近 2 轮 + 携带 STATE + 调用日志,即第二轮的 B 组设置);旧框架 = GPT-only do_harness(astra)。不是受控 A/B:工具、回合预算和完成判定都不同,只有 s0 / L0 是同一个场景。
新框架 13/18 vs 旧框架 11/18 成功,总花费是旧框架的 ×6.15。
swap_blocks 不可比:新框架这次关着弹簧按钮复位补丁,这个任务怎么按都不会判成功(旧框架开着);去掉 swap_blocks 后,新框架 13/15 vs 旧框架 8/15。新框架这次还漏装了训练姿态范围库。
在主结果站打开对比与回放 ↗新框架RPent 纯文字记忆 13/18 成功 $278.08旧框架do_harness(astra) 11/18 成功 $45.25