每周报告 — 2026-W30 (2026-07-20 ~ 2026-07-26)

本周重点在于稳定并验证 ErrorRecoveryBenchmark 数据集,执行 NIPS 反驳实验(OpenVLA-OFT 和 GR00T),为 Qualcomm 硬件准备量化模型基准测试,以及解决复杂的基础设施瓶颈问题。主要成就包括纠正训练/评估数据分割中的关键数据泄露问题,通过验证的数据来源成功启动 OpenVLA 的多 GPU LoRA 训练,并在本地集群和 HPC 基础设施上建立稳定的 pi0.5 和 GR00T 评估流程。

每周概览

指标 数值
日期范围 2026-07-20 ~ 2026-07-26
活跃天数 6 / 7
总对话数 14
项目数 9
已完成任务 30
进行中任务 6
总token数 701,366,311
总成本 $526.67
Claude 代码token数 978,767
Claude 代码成本 $3.05
Codex token数 700,387,544
Codex成本 $523.62
日均成本 $131.67

项目进展

ErrorRecoveryBenchmark & NIPS Rebuttal(活跃4天) — 🔄 活跃

成就:

  • 审查并修复了恢复演示中的假阴性逻辑,恢复了555条有效轨迹。
  • 发现并公开了由于共享干净轨迹导致的训练/评估数据集之间的数据泄露问题。
  • 制定了针对 NIPS 评审员的回应策略,涉及数据集分割和政策覆盖情况。

阻碍因素:

  • ⚠️ AI 安全政策阻止了将8GB数据集档案批量上传到 HuggingFace,需要手动处理。

OpenVLA-OFT 训练(活跃3天) — 🔄 活跃

成就:

  • 审查了六个不同的数据集(标称/错误变体),并通过 SHA-256 哈希验证了数据来源多样性。
  • 在 Tianhe-3 GPU上同时执行了四个 LoRA 训练任务,达到第10,000步。
  • 优化了数据管道,解决了由 CPU/MuJoCo 瓶颈导致的初始 GPU利用率低问题。

阻碍因素:

  • ⚠️ LoRA 合并脚本因 tmux 环境中的路径解析错误而失败。
  • ⚠️ 在885个增强样本中发现了种子多样性不足的问题(仅从29个基础演示中衍生而来)。

pi0.5 & GR00T 量化与评估(活跃3天) — 🔄 活跃

成就:

  • 修复了 GR00T 的 Qwen3VL 集成中的关键静默绕过错误。
  • 定义了量化精度的验证框架(单调误差/FP64 等价性)。
  • 发现 FP16 主干与 Qualcomm IQ-9075 NPU 不兼容,因为二进制大小限制(~3.78GB > 3.67GB 限制)。

阻碍因素:

  • ⚠️ GR00T 评估流程中的静默绕过错误。
  • ⚠️ 需要深度分析以了解 SpinQuant 延迟开销。

基础设施与工具(活跃2天) — ✅ 完成

成就:

  • 在 HPC 上清理了840GB的旧 GR00T 检查点。
  • 恢复了 Tianhe-3上的SSH连接,解决了旧的端口绑定问题。
  • 完成了带有模糊去重功能的视频 OCR 管道。

阻碍因素:

  • ⚠️ 复杂的跨-shell命令转义问题(PowerShell/SSH/Bash)。
  • ⚠️ AI 代理在处理大二进制文件和嵌套shell语法时的限制。

关键任务

  • 审查训练/评估数据泄露(2026-07-22) — 追踪代码以确认训练/评估数据集之间的共享干净轨迹关系,需要在 NIPS 反驳中公开。
  • ErrorRecoveryBenchmark 数据审计与对账(2026-07-23) — 修改了审计脚本逻辑,恢复了555条高置信度轨迹,并统一了本地/远程数据集状态。
  • quantize-MVP 仓库整理与迁移准备(2026-07-21) — 重构代码库为可最小复现的 MVP,移除集群依赖,为 A100 迁移做准备。
  • 多 GPU OpenVLA LoRA 训练执行(2026-07-26) — 同时运行了四个 LoRA 任务,达到第10,000步,并使用了经过验证的检查点和优化数据加载器。
  • GR00T 评估流程修复(2026-07-20) — 纠正了导致 Qwen3VL 集成中模型静默绕过的 PyTorch 属性遮蔽问题。
  • pi0.5 FP16 量化与分析(2026-07-21) — 确认了 FP16 主干与 IQ-9075 NPU 的结构不兼容;确定需要 A100 才能实现完全精确的量化。
  • 🚫 解决 pi0.5 GPU 矩阵任务失败问题(2026-07-22) — pi0.5 矩阵运算的后台任务因退出代码1而失败;需要调查 GPU资源分配问题。
  • 人类数据质量审计与 MiMicGen 增强(2026-07-26) — 审查了人类演示的资格,并执行了增强处理;发现合成变体中的种子多样性不足。

问题与解决方案

1. 审计脚本假阴性:验证逻辑错误地将模拟重置为错误状态,从而拒绝有效的演示。[ErrorRecoveryBenchmark](2026-07-23)

解决方案: 修改了审计脚本,从收集的 NPZ 文件的 $states[0] 重新开始,恢复了555条有效轨迹。

2. 通过共享干净轨迹导致的数据泄露:训练集和评估集共享相同的干净轨迹,违反了分割完整性。[ErrorRecoveryBenchmark](2026-07-24)

解决方案: 通过 JSONL 清单验证数据来源,确认源数据100%重叠,需要在反驳中公开并在未来进行轨迹级分割。

3. pi0.5 FP16 主干不兼容:上下文二进制大小(3.78GB)超过 IQ-9075 NPU 限制(3.67GB),导致无法执行。[pi0.5 Quantization](2026-07-21)

解决方案: 通过 QNN 日志确认不兼容;确定对此硬件而言必须进行量化或分割。

4. OpenVLA 低 GPU 利用率:缓慢的训练速度和高 CPU 负载表明是数据管道瓶颈,而非 GPU 限制。[OpenVLA Training](2026-07-25)

解决方案: 优化 MuJoCo 工作进程和数据预处理;重新分配 GPU 以解决资源竞争问题。

5. GR00T 静默绕过错误:量化模型显示100%成功,原因是 Qwen3VL 中的 PyTorch 属性遮蔽。[GR00T Evaluation](2026-07-20)

解决方案: 发现 nn.Module.__setattr__ 拦截了赋值操作;通过在赋值时验证子模块身份来修复。

6. SSH 反向代理故障:旧的僵尸进程在 Tianhe-3上占用默认端口,导致连接中断。[Infrastructure](2026-07-23)

解决方案: 更新 SSH 配置使用临时端口(10090+)与 ServerAliveIntervalExitOnForwardFailure

7. 增强数据多样性不足:仅从29个基础人类演示中衍生出885个合成样本。[OpenVLA Data](2026-07-26)

解决方案: 使用 SHA-256 哈希验证来源;得出结论需要在未来运行中收集更多多样化的基础数据。

经验教训

调试(调试)- 在基于模拟的机器人技术中,审计逻辑必须与控制器的初始重置状态一致;如果不一致,会导致灾难性的数据丢失。身份断言(assert x is y)是防止属性获取被绕过的有效防御措施。

  • 审计大规模科学数据集需要验证原始文件系统状态、审计 JSON 文件以及发布清单,以发现度量定义的不一致之处。即使注入的错误是唯一的,共享源清洁轨迹仍会导致数据泄露。

架构

  • 需要 >3.67GB 上下文数据的 FP16 模型无法在 Qualcomm IQ-9075 NPU 上运行。VLA 训练中 GPU 利用率低通常表明是 CPU 端的数据加载/渲染瓶颈,而非计算限制。
  • 为了生成可靠的合成数据,需要同时审计“种子多样性”(独特的基础样本)和总样本数量。仅依靠样本量不能保证模型的泛化能力。

工具

  • 多层 Shell 执行(PowerShell -> SSH -> Bash)需要 careful escaping;使用绝对路径和原生 CLI 工具如 jq 比复杂的内联 Python/PowerShell 命令更可靠。
  • 人工智能安全过滤器可能会阻止合法的大批量数据上传(例如上传到 HF),如果它们认为外部目标不可信;通常需要手动处理或检查点恢复策略。

AI 使用注意事项

有效模式:

  • ✓ 使用多智能体编排(Grok/Fable/Cursor)进行科学协议审计,提高了严谨性并防止标签泄露。
  • ✓ SHA-256 来源追踪在大规模增强流程中验证数据完整性和唯一性非常有效。
  • ✓ 通过迭代的 SSH 命令交叉对比本地/远程状态,解决了严重的数据集差异问题。

限制:

  • ✗ 人工智能代理在处理复杂的嵌套 Shell 转义(PowerShell/SSH/Bash)时遇到困难,经常产生语法错误。
  • ✗ 代理缺乏自动解决过时的 HPC 端口绑定或无需明确配置即可推断内部集群主机名的能力。
  • ✗ 人工智能安全过滤器阻止了合法的大批量数据上传,需要手动干预。

下周计划

在 LoRA 合并/step-10,000 检查点间隔后,专注于恢复和优化 OpenVLA-OFT 训练。继续通过验证 GPU 资源状态和内核执行环境来调查 pi0.5 GPU 矩阵任务失败问题(退出代码 1)。在验证数据来源后,对 Tianhe-3 上的新 OpenVLA-OFT 实验进行初步环境验证。解决剩余的 GR00T 延迟分析结果问题,并最终确定用于公开分享的 MVP 仓库结构。

令牌使用统计

AI Usage · 2026-W30 Claude Code + Codex
Total cost
$526.67
Total tokens
701M
Output tokens
3M
Cache read
96.0%
Cost split Claude Code $3 · Codex $524
Token character Cache reads 96.0% · Active 4.0%

Most token volume came from cache reads; Codex drove nearly all cost.

高峰日: 未知 — $288.00 / 396.6M 令牌

每日平均: $131.67