每日报告 — 2026-06-19

任务

架构与策略

  • pi0.5 完整排行榜复现 — 按照排行榜协议对 pi0.5 模型进行完整评估(50 项任务,50 次试验)。当前正在 node2 上处理原子任务。预计完成时间:约 18–22 小时。
  • GR00T-N1.6 完整排行榜复现 — 通过并行推理实现优化,速度提升 5 倍,已完成 node4(4 块 GPU)上的烟雾测试和完整评估。结果已与目标基准对比。
  • NVIDIA Predict 2.5 基线部署用于 RoboCasa — 解决了 Cosmos 3 与 Predict 2.5 模型之间的歧义;实现了基于 Slurm 的 pipeline(基线成功率为 71.1%)。解决了批量模式下的交互式下载障碍,并验证了 HF 认证。
  • MIHD 消融研究:STAIG 基线修正 — 识别并纠正了“原始 STAIG”的错误标签(使用 UNI2 代替 BYOL)。使用 BYOL 嵌入重新生成真实 STAIG 数据,添加了 HVG 基线,并生成准确的消融图表。发现发布数据(约 0.70 ARI)与复现数据(约 0.54 ARI)之间存在差异。
  • TokenMonitor 刷新漏洞修复(桌面应用) — 修复了 5 小时旧用窗口和 Codex 速率限制显示漏洞。解决了三个层面问题:在前端添加定期计时器,在 Rust 后端实现时间分桶缓存键以进行滚动窗口处理,并修复了用于交错通知的 JSON-RPC 解析器。
  • 🔄 ErrorRecoveryBenchmark:并行增强与重新训练管道 — 1. 诊断出模拟增强的 CPU 限制问题,在 Tianhe2 HPC 上从串行改为并行工作并采用分块保存。2. 解决了 LeRobot 转换中的磁盘配额故障和 EGL 渲染错误。3. 使用验证过的增强数据开始重新训练管道的第一步(LeRobot 转换)。
  • Universal Seed-Search 聚类管道开发 — 构建了用于 367 种嵌入的 Leiden 超参数扫描的 Python 管道。启动分块 SLURM 数组和Manifest 生成工具以进行稳健的聚类评估。

问题与解决方案

关键问题

1. 最初的 Cosmos 部署尝试针对错误的模型架构;Predict 2.5 是 RoboCasa 的相关基线,而非 Cosmos 3。

解决方案: 进行了深入技术分析以映射动作空间和权重。调整策略转向 Predict 2.5,向用户说明世界模型与策略之间的区别。

关键洞察: 新的基础模型可能无法直接与特定基准兼容;检查特定的策略检查点至关重要。

2. STAIG “原始”面板错误地将 UNI2 特征标记为 BYOL,导致消融比较无效。

解决方案: 审查代码路径以验证特征来源,找到真实的 BYOL 嵌入,并重新进行评估。确认发布的 STAIG 分数在没有特定未共享优化的情况下无法复现。

关键洞察: 关于基线特征的假设必须通过代码检查来验证;高层标签可能具有误导性。

3. TokenMonitor UI 数据因前端计时器缺失和滚动窗口的静态后端缓存键而失效。

解决方案: 在 Rust 中实现时间分桶缓存键,禁用 5 小时视图的磁盘缓存,并添加启动刷新逻辑。修复了 Codex JSON-RPC 解析以处理交错通知。

关键洞察: 滚动时间窗口需要动态缓存键;静态键会冻结时间数据。

4. ErrorRecoveryBenchmark 增强失败是由于无头 HPC 的磁盘配额限制和 EGL 渲染错误。

解决方案: 区分配额与物理空间;清理损坏文件,并重新启动并行循环并采用分块保存。通过导出 MUJOCO_GL=egl 和调整 PYTHONPATH 来修复 LeRobot 转换问题,以适应混合环境。

关键洞察: HPC 配额与磁盘使用不同;无头渲染需要明确的后端配置。

一般问题

5. RoboCasa 资产下载器在 Slurm 批处理作业中因交互式 stdin 提示而失败。

解决方案: 修改设置脚本以抑制交互式提示并自动处理无头下载。

关键洞察: 模拟环境通常包含假设有交互式终端的旧式下载器;这些必须与 HPC 部署分离。

人类与 AI 方法

战略层面

模型选择与架构方向

角色 方法
人类 用户最初请求部署 Cosmos 3,但提供了 Predict 2.5 链接;接受 AI 的修正以转向正确的基准基线。
AI AI 进行差距分析,识别兼容的权重(Predict 2.5),并在向用户说明模型差异的同时实现管道实施。

差异分析: AI 根据资源限制和可行性主动纠正架构方向。

科学分析中基线的有效性

角色 方法
人类 用户识别了错误的 STAIG 基线(UNI2 与 BYOL),并发现排除“无编码器”HVG基线时的逻辑漏洞。
AI AI 最初依赖标签;在用户修正后,验证代码路径并调整消融结构以包含必要的基线。

差异分析: 用户提供了特定领域的方法论知识,纠正了 AI 的隐含假设和文件管理限制。

数据过旧的诊断洞察

角色 方法
人类 用户提供了显示实时数据的 CLI 输出,与应用的陈旧 UI 状态相矛盾。
AI AI 将诊断重点从延迟转移到流解析,通过检查日志发现 Codex 连接器中的交错 JSON-RPC 错误。

差异分析: 人类的洞察通过提供外部参考数据从而揭示内部解析器缺陷至关重要。

AI 限制

关键限制

  • 未能立即识别代码中“原始 STAIG”对应 UNI2 特征,依赖标签而非文件来源。

一般限制

  • 由于 API 速率限制或缓存缺失,难以直接通过网络获取特定原始文件;需要依赖 MCP 工具作为替代方案。
  • 最初尝试通过更改密钥跳线进行无效的 SSH 路由,并将低 GPU 利用率误认为失败而非 CPU 限制工作负载。

经验教训

关键经验

  • NVIDIA 的 RoboCasa 生态系统明确将 Predict 2.5 策略(基线)与 Cosmos 3(通用世界模型)分开;始终验证特定策略检查点以确保基准兼容性。
  • 真实的原始 STAIG 结果(约 0.54 ARI)明显低于发布数据(约 0.70 ARI),表明原始运行中没有共享优化。
  • 对于滚动时间窗口,缓存键必须包含时间分桶组件;静态键会保留过旧数据。
  • 无头 HPC 环境需要明确导出 MUJOCO_GL=egl 以防止 MuJoCo/Robosuite 工作流中的 GLFW 错误。

实际经验- 在 HPC 集群上,使用 Slurm 批处理作业时,始终检查依赖安装器/资源下载器中是否有交互式提示。

对话总结

机器人竞赛排行榜与基准测试复现(pi0.5, GR00T, Predict2.5)

• 多模型评估与基准设置 20:40:42.446 | claude_code 已完成 GR00T-N1.6 的排行榜复现(优化并行推理),结果待汇总。开始对 pi0.5 进行评估(剩余约 18-22 小时)。通过 Slurm 管道实现和稳健的批处理模式处理,确定 NVIDIA Predict 2.5 为 RoboCasa 的正确基准,从而绕过不兼容的 Cosmos 3 路径。

MIHD 消融研究

✅ 基准校正与聚类管道 04:46:53.257 | claude_code 纠正了 STAIG 基准中的关键错误标签(UNI2 vs BYOL),反驳了之前关于 STAIG 占主导地位的说法。使用 SLURM 数组为 367 个嵌入数据开发了一种通用种子搜索聚类管道。确认复现结果与已发布的 STAIG 分数存在显著差异。

TokenMonitor 与错误恢复基准测试

• 桌面应用漏洞修复与 HPC 管道调度 21:47:39.800 | claude_code 解决了 TokenMonitor 中的关键数据刷新问题(前端计时器、后端缓存、JSON-RPC 解析)。同时通过诊断 Tianhe2 HPC 的 CPU 密集型增强需求,解决了磁盘配额/渲染障碍,并启动了 LeRobot 重新训练管道转换。

令牌使用情况

AI Usage · 2026-06-19 Claude Code + Codex
Total cost
$253.95
Total tokens
228M
Output tokens
1M
Cache read
90.3%
Cost split Claude Code $244 · Codex $10
Token character Cache reads 90.3% · Active 9.7%

Most token volume came from cache reads; Claude Code drove nearly all cost.