每周报告 — 2026-W30 (2026-07-20 ~ 2026-07-26)
本周重点在于稳定并验证 ErrorRecoveryBenchmark 数据集,执行 NIPS 反驳实验(OpenVLA-OFT 和 GR00T),为 Qualcomm 硬件准备量化模型基准测试,以及解决复杂的基础设施瓶颈问题。主要成就包括纠正训练/评估数据分割中的关键数据泄露问题,通过验证的数据来源成功启动 OpenVLA 的多 GPU LoRA 训练,并在本地集群和 HPC 基础设施上建立稳定的 pi0.5 和 GR00T 评估流程。
每周概览
| 指标 | 数值 |
|---|---|
| 日期范围 | 2026-07-20 ~ 2026-07-26 |
| 活跃天数 | 6 / 7 |
| 总对话数 | 14 |
| 项目数 | 9 |
| 已完成任务 | 30 |
| 进行中任务 | 6 |
| 总token数 | 701,366,311 |
| 总成本 | $526.67 |
| Claude 代码token数 | 978,767 |
| Claude 代码成本 | $3.05 |
| Codex token数 | 700,387,544 |
| Codex成本 | $523.62 |
| 日均成本 | $131.67 |
项目进展
ErrorRecoveryBenchmark & NIPS Rebuttal(活跃4天) — 🔄 活跃
成就:
- 审查并修复了恢复演示中的假阴性逻辑,恢复了555条有效轨迹。
- 发现并公开了由于共享干净轨迹导致的训练/评估数据集之间的数据泄露问题。
- 制定了针对 NIPS 评审员的回应策略,涉及数据集分割和政策覆盖情况。
阻碍因素:
- ⚠️ AI 安全政策阻止了将8GB数据集档案批量上传到 HuggingFace,需要手动处理。
OpenVLA-OFT 训练(活跃3天) — 🔄 活跃
成就:
- 审查了六个不同的数据集(标称/错误变体),并通过 SHA-256 哈希验证了数据来源多样性。
- 在 Tianhe-3 GPU上同时执行了四个 LoRA 训练任务,达到第10,000步。
- 优化了数据管道,解决了由 CPU/MuJoCo 瓶颈导致的初始 GPU利用率低问题。
阻碍因素:
- ⚠️ LoRA 合并脚本因 tmux 环境中的路径解析错误而失败。
- ⚠️ 在885个增强样本中发现了种子多样性不足的问题(仅从29个基础演示中衍生而来)。
pi0.5 & GR00T 量化与评估(活跃3天) — 🔄 活跃
成就:
- 修复了 GR00T 的 Qwen3VL 集成中的关键静默绕过错误。
- 定义了量化精度的验证框架(单调误差/FP64 等价性)。
- 发现 FP16 主干与 Qualcomm IQ-9075 NPU 不兼容,因为二进制大小限制(~3.78GB > 3.67GB 限制)。
阻碍因素:
- ⚠️ GR00T 评估流程中的静默绕过错误。
- ⚠️ 需要深度分析以了解 SpinQuant 延迟开销。
基础设施与工具(活跃2天) — ✅ 完成
成就:
- 在 HPC 上清理了840GB的旧 GR00T 检查点。
- 恢复了 Tianhe-3上的SSH连接,解决了旧的端口绑定问题。
- 完成了带有模糊去重功能的视频 OCR 管道。
阻碍因素:
- ⚠️ 复杂的跨-shell命令转义问题(PowerShell/SSH/Bash)。
- ⚠️ AI 代理在处理大二进制文件和嵌套shell语法时的限制。
关键任务
- ✅ 审查训练/评估数据泄露(2026-07-22) — 追踪代码以确认训练/评估数据集之间的共享干净轨迹关系,需要在 NIPS 反驳中公开。
- ✅ ErrorRecoveryBenchmark 数据审计与对账(2026-07-23) — 修改了审计脚本逻辑,恢复了555条高置信度轨迹,并统一了本地/远程数据集状态。
- ✅ quantize-MVP 仓库整理与迁移准备(2026-07-21) — 重构代码库为可最小复现的 MVP,移除集群依赖,为 A100 迁移做准备。
- ✅ 多 GPU OpenVLA LoRA 训练执行(2026-07-26) — 同时运行了四个 LoRA 任务,达到第10,000步,并使用了经过验证的检查点和优化数据加载器。
- ✅ GR00T 评估流程修复(2026-07-20) — 纠正了导致 Qwen3VL 集成中模型静默绕过的 PyTorch 属性遮蔽问题。
- ✅ pi0.5 FP16 量化与分析(2026-07-21) — 确认了 FP16 主干与 IQ-9075 NPU 的结构不兼容;确定需要 A100 才能实现完全精确的量化。
- 🚫 解决 pi0.5 GPU 矩阵任务失败问题(2026-07-22) — pi0.5 矩阵运算的后台任务因退出代码1而失败;需要调查 GPU资源分配问题。
- ✅ 人类数据质量审计与 MiMicGen 增强(2026-07-26) — 审查了人类演示的资格,并执行了增强处理;发现合成变体中的种子多样性不足。
问题与解决方案
1. 审计脚本假阴性:验证逻辑错误地将模拟重置为错误状态,从而拒绝有效的演示。[ErrorRecoveryBenchmark](2026-07-23)
解决方案: 修改了审计脚本,从收集的 NPZ 文件的 $states[0] 重新开始,恢复了555条有效轨迹。
2. 通过共享干净轨迹导致的数据泄露:训练集和评估集共享相同的干净轨迹,违反了分割完整性。[ErrorRecoveryBenchmark](2026-07-24)
解决方案: 通过 JSONL 清单验证数据来源,确认源数据100%重叠,需要在反驳中公开并在未来进行轨迹级分割。
3. pi0.5 FP16 主干不兼容:上下文二进制大小(3.78GB)超过 IQ-9075 NPU 限制(3.67GB),导致无法执行。[pi0.5 Quantization](2026-07-21)
解决方案: 通过 QNN 日志确认不兼容;确定对此硬件而言必须进行量化或分割。
4. OpenVLA 低 GPU 利用率:缓慢的训练速度和高 CPU 负载表明是数据管道瓶颈,而非 GPU 限制。[OpenVLA Training](2026-07-25)
解决方案: 优化 MuJoCo 工作进程和数据预处理;重新分配 GPU 以解决资源竞争问题。
5. GR00T 静默绕过错误:量化模型显示100%成功,原因是 Qwen3VL 中的 PyTorch 属性遮蔽。[GR00T Evaluation](2026-07-20)
解决方案: 发现 nn.Module.__setattr__ 拦截了赋值操作;通过在赋值时验证子模块身份来修复。
6. SSH 反向代理故障:旧的僵尸进程在 Tianhe-3上占用默认端口,导致连接中断。[Infrastructure](2026-07-23)
解决方案: 更新 SSH 配置使用临时端口(10090+)与 ServerAliveInterval 和 ExitOnForwardFailure。
7. 增强数据多样性不足:仅从29个基础人类演示中衍生出885个合成样本。[OpenVLA Data](2026-07-26)
解决方案: 使用 SHA-256 哈希验证来源;得出结论需要在未来运行中收集更多多样化的基础数据。
经验教训
调试(调试)- 在基于模拟的机器人技术中,审计逻辑必须与控制器的初始重置状态一致;如果不一致,会导致灾难性的数据丢失。身份断言(assert x is y)是防止属性获取被绕过的有效防御措施。
- 审计大规模科学数据集需要验证原始文件系统状态、审计 JSON 文件以及发布清单,以发现度量定义的不一致之处。即使注入的错误是唯一的,共享源清洁轨迹仍会导致数据泄露。
架构
- 需要 >3.67GB 上下文数据的 FP16 模型无法在 Qualcomm IQ-9075 NPU 上运行。VLA 训练中 GPU 利用率低通常表明是 CPU 端的数据加载/渲染瓶颈,而非计算限制。
- 为了生成可靠的合成数据,需要同时审计“种子多样性”(独特的基础样本)和总样本数量。仅依靠样本量不能保证模型的泛化能力。
工具
- 多层 Shell 执行(PowerShell -> SSH -> Bash)需要 careful escaping;使用绝对路径和原生 CLI 工具如
jq比复杂的内联 Python/PowerShell 命令更可靠。 - 人工智能安全过滤器可能会阻止合法的大批量数据上传(例如上传到 HF),如果它们认为外部目标不可信;通常需要手动处理或检查点恢复策略。
AI 使用注意事项
有效模式:
- ✓ 使用多智能体编排(Grok/Fable/Cursor)进行科学协议审计,提高了严谨性并防止标签泄露。
- ✓ SHA-256 来源追踪在大规模增强流程中验证数据完整性和唯一性非常有效。
- ✓ 通过迭代的 SSH 命令交叉对比本地/远程状态,解决了严重的数据集差异问题。
限制:
- ✗ 人工智能代理在处理复杂的嵌套 Shell 转义(PowerShell/SSH/Bash)时遇到困难,经常产生语法错误。
- ✗ 代理缺乏自动解决过时的 HPC 端口绑定或无需明确配置即可推断内部集群主机名的能力。
- ✗ 人工智能安全过滤器阻止了合法的大批量数据上传,需要手动干预。
下周计划
在 LoRA 合并/step-10,000 检查点间隔后,专注于恢复和优化 OpenVLA-OFT 训练。继续通过验证 GPU 资源状态和内核执行环境来调查 pi0.5 GPU 矩阵任务失败问题(退出代码 1)。在验证数据来源后,对 Tianhe-3 上的新 OpenVLA-OFT 实验进行初步环境验证。解决剩余的 GR00T 延迟分析结果问题,并最终确定用于公开分享的 MVP 仓库结构。
令牌使用统计
高峰日: 未知 — $288.00 / 396.6M 令牌
每日平均: $131.67