每周报告 — 2026-W31(2026-07-27 ~ 2026-08-02)
本周重点在于诊断 OpenVLA-LoRA 训练中的基本故障模式,并建立可靠的评估基础设施。主要成果是发现“协变量偏移”是仅使用名义参数策略时零成功率的根本原因,确认恢复增强数据对闭环稳定性至关重要。同时,维护工作包括重建 15 个仓库的全局 AI 配置标准,恢复 BetterSSH 工作空间,并在 Tianhe3 集群上继续进行密集训练实验。
每周概览
| 指标 | 数值 |
|---|---|
| 日期范围 | 2026-07-27 ~ 2026-08-02 |
| 活跃天数 | 4 / 7 |
| 总对话数 | 9 |
| 项目数 | 5 |
| 完成任务数 | 15 |
| 进行中任务数 | 2 |
| 总token数 | 333,545,535 |
| 总成本 | $283.74 |
| Claude 代码token数 | 32,278,096 |
| Claude 代码成本 | $77.93 |
| Codex token数 | 301,267,439 |
| Codex成本 | $205.81 |
| 每日平均成本 | $56.75 |
项目进展
OpenVLA-LoRA 训练与评估(4天活跃) — 🔄 活跃
成果:
- 发现协变量偏移是 Coffee Nominal 策略零成功的原因。
- 建立了可靠的磁盘故障容错检查点 fallback 机制。
- 在 Tianhe3 上并行开展六个 Robosuite 任务的评估。
- 通过自动 JSON 完整性检查验证了评估基础设施。
阻碍因素:
- ⚠️ 缺少 OPENVLA_OFT_ROOT 环境变量导致初始崩溃循环。
- ⚠️ 磁盘配额耗尽,需要手动清理和 /tmp fallback 逻辑。
- ⚠️ 远程执行时的复杂 PowerShell 到 Bash SSH 转义问题。
仓库维护与配置(2天活跃) — ✅ 完成
成果:
- 在 15 个 GitHub 仓库中标准化了 CLAUDE.md 和 AGENTS.md。
- 从单个包环境中重建 BetterSSH pnpm 工作空间配置。
- 同步合并了 7 个仓库的 PR,统一主分支。
阻碍因素:
- ⚠️ 安全分类器阻止了高风险 git 工作流的自动合并。
- ⚠️ 旧配置文件中的过时文档需要完全替换。
关键任务
- ✅ Coffee Nominal 零成功根因分析(2026-07-28)— 通过排除管道错误并识别闭环协变量偏移,确定了 0% 成功率的原因。证明微小的初始偏差在偏离流形状态时会累积,需要恢复数据。
- 🔄 OpenVLA-LoRA 训练管理(2026-07-31)— 在 Tianhe3 上协调六个并发训练任务。通过修改启动脚本解决了缺少环境变量问题,并通过远程 SSH 监控进度。
- ✅ 全局仓库配置重建(2026-07-30)— 删除了 15 个仓库中的过时配置,使用并行 AI 代理重建了标准的 CLAUDE.md/AGENTS.md 文件,确保最新指导。
- ✅ BetterSSH 工作空间恢复(2026-07-31)— 通过分析单个包依赖关系恢复了缺失的根配置文件(package.json, pnpm-workspace.yaml),并解决了 ESM/CJS 互操作问题。
- ✅ LoRA 检查点合并与评估部署(2026-07-27)— 合并了四个任务检查点的 LoRA 权重,解决了 Python 路径依赖问题,并启动了并行 VLA 评估服务器。
问题与解决方案
1. Coffee Nominal 策略尽管训练损失较低但显示 0% 成功率,最初怀疑是管道错误或检查点损坏。[OpenVLA-LoRA 训练与评估](2026-07-28)
解决方案: 使用恢复数据进行配对评估并验证权重差异。发现“闭环协变量偏移”,即偏离名义轨迹导致无法恢复状态,因为训练数据中缺乏恢复示例。
2. 检查点保存过程中主要磁盘空间配额超过,可能导致 Tianhe3 上的训练中断。[OpenVLA-LoRA 训练与评估](2026-07-27)
解决方案: 实现 try-except 逻辑,在主存储失败时回退到 /tmp。用户后来清理了 700GB 的磁盘空间以恢复默认行为并确保长期稳定性。
3. OpenVLA 训练任务因缺少 “OPENVLA_OFT_ROOT” 环境变量而崩溃,出现在导入成功后。[OpenVLA-LoRA 训练与评估](2026-07-31)
解决方案: 通过回溯日志识别缺失变量,并在启动脚本中应用补丁以导出正确路径,从而允许任务重新提交成功。
4. betterSSH 根工作空间文件在仓库迁移过程中丢失,导致 pnpm 构建和类型检查失败。[仓库维护与配置](2026-07-31)
解决方案: 通过从单个包配置中推断来重建根配置。通过更新导入项和测试签名,解决了 ssh-config 5.2 的 ESM/CJS 互操作问题。
经验教训
领域知识(domain)
- 仅使用名义参数的模仿学习在闭环环境中本质上不稳定;即使是小的错误恢复轨迹(4%)也可能导致策略功能正常或损坏,这是由于协变量偏移所致。
调试(debugging)
- 通过 SHA256 哈希验证检查点的来源是确认模型状态完整性的有效方法,避免在分布式训练中浪费时间调试“错误模型”问题。
工具(tools)
- 自动配置生成应采用“薄适配器”策略(将特定工具注释与通用指南分离),以防止多个仓库之间的文档漂移。
- 在 pnpm 单仓库中,当根工作空间配置文件丢失时,检查单个 package.json “extends” 字段是通过静态分析准确重建结构的可靠方法。
架构(architecture)
- 在分布式深度学习中,缺失环境变量是无声的故障原因。验证脚本必须在启动前检查配置完整性,避免浪费 GPU 时间。
AI 使用注意事项
有效模式:
- ✓ 使用并行 AI 代理同时扫描代码库并在多个仓库中重建标准配置文件。
- ✓ 通过 SSH 通过 stdin 发送 base64 编码的 Python 脚本,绕过 Windows 和 Linux 之间复杂的跨平台 shell 转义问题。
限制:
- ✗ AI 在没有明确人类假设指导的情况下难以从零成功指标诊断协变量偏移,只能进行环境检查。
- ✗ Claude Code 的安全分类器阻止了 “gh pr merge” 的自动执行,尽管技术上有能力,仍需手动干预最终合并。
- ✗ 在远程环境中自动检测缺失模块依赖通常失败,除非事先知道 conda 环境名称。
下周展望下周的重点包括提高 OpenVLA-LoRA 训练中恢复数据的比例,以缓解协变量偏移问题,并提升闭环系统的鲁棒性。继续监控在 Tianhe3 上进行的六次并行训练进程,重点关注咖啡任务和堆栈任务의收敛指标。解决剩余仓库文档中的不一致问题,并在 ESM 更新后完成 BetterSSH 工作空间的稳定性优化。
令牌使用统计
高峰日: 2026-07-27 — 80.45美元/1.061亿个令牌
每日平均: 56.75美元