记忆任务 · 实验索引
RoboDojo · GPT 规划器实验
用 GPT-6 Astra 当规划器,在 RoboDojo 的 6 个记忆任务上比较不同框架、历史设置和观测文字:每一轮都有成功率、钱花在哪,以及每一局的逐回合回放。第一轮的页面在主结果站。最新一张卡是 GPT 规划器调用 75k WAM 技能策略的混合冒烟(不是记忆任务)。
钱花在哪了:各轮对比
每次调用的钱 = 缓存写入(12.5 USD/M)+ 缓存读取(1 USD/M)+ 输出(50 USD/M)。缓存只认「与上一次请求相同的开头」,所以请求越短、开头越稳定,重写的越少。
| 方案 | 成功 | 总花费 | 每格调用 | 每次输入 token | 缓存命中 | 每次重写 token | 每次调用 缓存写入 缓存读取 输出 |
|---|---|---|---|---|---|---|---|
| 旧框架do_harness(astra),第一轮对照 | 11/18 | $45 | 22.8 | 9,181 | 17% | 7,609 | $0.110 |
| B · 第一轮纯文字记忆,缺按钮补丁和姿态库 | 13/18 | $278 | 99.1 | 15,268 | 26% | 11,364 | $0.156 |
| B · 第二轮纯文字记忆:最近 2 轮 + STATE + 调用日志 | 15/18 | $253 | 88.9 | 15,483 | 25% | 11,560 | $0.158 |
| S · 第二轮只带状态记录:最近 1 轮 + STATE + 当前观测 | 15/18 | $155 | 101.8 | 10,576 | 48% | 5,451 | $0.085 |
| SC · 第三轮S + 精简每轮文字 | 14/18 | $79 | 94.8 | 6,830 | 66% | 2,356 | $0.046 |
| SCF · 第四轮SC + 少调用(一次 move_to / reset、等待 1-100 步、并行查询)+ 计数规则 + 恢复 | 16/18 | $49 | 56.7 | 6,986 | 65% | 2,425 | $0.048 |
| SCM · 第四轮SCF + 一次串多段移动(最多 4 段)+ 训练姿态表放进首条消息 | 14/18 | $31 | 30.5 | 10,672 | 76% | 2,549 | $0.056 |
| 75k WAM + GPT · 混合冒烟4 格冒烟:75k WAM 技能策略 + GPT 规划器(SCF 设置),不是记忆任务 | 4/4 | $14 | 67.8 | 8,697 | 70% | 2,648 | $0.051 |
- 少带历史(B → S):每次调用 $0.158 → $0.085,缓存命中 25% → 48%,成功率不变(15/18 vs 15/18)。
- 精简每轮文字(S → SC):每次调用 → $0.046,每次输入 10,576 → 6,830 token,每次重写进缓存 5,451 → 2,356;成功 14/18(少 1 格,imitate 白等的问题补跑已修好)。
- 少调用(SC → SCF → SCM):每格调用 94.8 → 56.7 → 30.5 次(SCM 是 SC 的 ×0.32),总花费 $78.68 → $49.13 → $30.60;每次调用反而贵了一点($0.046 → $0.048 → $0.056,SCM 首条消息带训练姿态表、一次调用做的事更多),成功 14 → 16 → 14/18。
- SCM 是第一个总花费低于旧框架的 RPent 方案:$30.60 vs $45.25;每格调用仍比旧框架多(30.5 vs 22.8 次),便宜在每次调用($0.056 vs $0.110,缓存命中 76% vs 17%)。
-
混合冒烟2026-09-28 · 4 个任务 × 1 局 · GPT 规划器 + WAM 技能策略
75k WAM + GPT 规划器(SCF 设置)冒烟 vs 09-25 的 skill30 + GPT
GPT-6 Astra 规划、DO-WAM config_exp WSD-S c02 75k EMA 当技能策略,用第四轮 SCF 的设置(最近 1 轮 + STATE、精简文字、少调用)。对照是 2026-09-25 的 skill30 + GPT 混合评测(skill30 w125 spell02 30k EMA;发布包、推理强度、回合上限都不同,是跨框架冒烟,不是消融),以及第四轮纯 GPT 的 SCF 两格。
4 格全部成功,共 $13.70。共有的 3 格(general_pickup、cover_blocks、swap_blocks):$11.68 vs $44.03(×0.27,省 73%),成功 3/3 vs 2/3。调用反而多 30%(236 vs 182 次),便宜在每次调用($0.050 vs $0.242):09-25 的版本每次重发整段历史和所有图片(每次输入 8.6k vs 150k token)。
打开对比、调用分析与回放 →75k + GPT4 格冒烟 4/4 成功 $13.7075k + GPT共有的 3 格 3/3 成功 $11.68skill30 + GPT2026-09-25,同 3 格 2/3 成功 $44.03纯 GPT · SCF第四轮,2 格参照 2/2 成功 $7.96花费条:和下面各轮同一个比例尺(这张卡每组只有 2–4 格)。
-
第四轮2026-09-28 · 6 个记忆任务 × 3 局 · 与第三轮 SC 配对
少调用(SCF)与一次串多段移动(SCM)vs SC
SCF = SC + 少调用(一次 move_to / reset、等待 1-100 步、并行查询)+ 计数规则 + 恢复;SCM = SCF + 一次串多段移动(最多 4 段)+ 训练姿态表放进首条消息。三次独立运行、发布包不同,但框架相同、场景相同(layout 0,seed 0–2),按任务 + seed 配对;SC 就是第三轮的 SC 组。
关键是调用次数:每格 94.8 → 56.7 → 30.5 次调用(SC → SCF → SCM),总花费 $78.68 → $49.13 → $30.60(SCM 是 SC 的 ×0.39),成功 14 → 16 → 14 格。每次调用 $0.046 → $0.048 → $0.056,略贵。SCM 是第一个总花费低于旧框架($45.25)的 RPent 方案。 18 个同场景:三组都成功 12 个;SC、SCF 成功、SCM 失败 2 个;SCF、SCM 成功、SC 失败 2 个;三组都失败 2 个。
打开对比、调用分析与回放 →SC 组第三轮的基线 14/18 成功 $78.68SCF 组SC + 少调用 16/18 成功 $49.13SCM 组SCF + 一次串多段移动 14/18 成功 $30.60花费条:四轮用同一个比例尺。
-
第三轮2026-09-28 · 6 个记忆任务 × 3 局 · 与第二轮 S 组配对
精简文字(SC)vs 完整文字(S)
SC = 第二轮 S 组的历史设置(最近 1 轮 + 携带 STATE + 当前观测)+ 精简观测文字(compact_v1);S = 第二轮的 S 组(2026-09-27,同一批 18 局)。两次独立运行、发布包不同,但框架相同、场景相同(layout 0,seed 0–2),按任务 + seed 配对。
SC 14/18 vs S 15/18 成功(SC 组少 1 格),SC 组总花费是 S 组的 ×0.51(省 49%)。每次调用 ×0.54,调用次数 ×0.93。18 对同场景:12 对都成功,只有 SC 成功 2 对,只有 S 成功 3 对,都失败 1 对。
2 个补跑,各在 SC 上改一处:imitate_sorting_sequence(保留当前官方步数)2/3,同任务 SC 1/3,不再白等;press_by_number(计数规则)2/3,同任务 SC 2/3,没有再多按。
打开对比、补跑与回放 →SC 组只带状态记录 + 精简文字 14/18 成功 $78.68S 组只带状态记录,完整文字 15/18 成功 $155.28补跑(各 3 局,只跑一个任务)
补跑 SCL2/3 成功$26.59补跑 SCR2/3 成功$19.56花费条:四轮用同一个比例尺。
-
第二轮2026-09-27 · 6 个记忆任务 × 3 局 · 配对
只带状态记录(S)vs 纯文字记忆(B)
同一套 RPent 框架、同一个发布包、同一批场景(layout 0,seed 0–2),只换历史设置。S:最近 1 轮 + 携带 STATE + 当前观测;B:最近 2 轮 + 携带 STATE + 调用日志。
成功率相同(各 15/18),S 组总花费是 B 组的 ×0.61(省 39%)。每次调用 ×0.54,调用次数 ×1.15。18 对同场景:14 对都成功,只有 S 成功 1 对,只有 B 成功 1 对,都失败 2 对。
打开对比与回放 →S 组只带状态记录 15/18 成功 $155.28B 组纯文字记忆 15/18 成功 $253.05 -
第一轮在主结果站2026-09-27(旧框架 2026-09-24)· 6 个记忆任务 × 3 局
新框架(RPent 纯文字记忆)vs 旧框架
新框架 = RPent(最近 2 轮 + 携带 STATE + 调用日志,即第二轮的 B 组设置);旧框架 = GPT-only do_harness(astra)。不是受控 A/B:工具、回合预算和完成判定都不同,只有 s0 / L0 是同一个场景。
新框架 13/18 vs 旧框架 11/18 成功,总花费是旧框架的 ×6.15。
swap_blocks 不可比:新框架这次关着弹簧按钮复位补丁,这个任务怎么按都不会判成功(旧框架开着);去掉 swap_blocks 后,新框架 13/15 vs 旧框架 8/15。新框架这次还漏装了训练姿态范围库。
在主结果站打开对比与回放 ↗新框架RPent 纯文字记忆 13/18 成功 $278.08旧框架do_harness(astra) 11/18 成功 $45.25