Weekly Report — 2026-W19 (2026-05-04 ~ 2026-05-10)

本周是一个集高强度准备与技术稳定化于一体的多维度阶段。关键成就包括:通过元数据生成和数据验证,使 ErrorRecoveryBench 符合 NeurIPS 2026 的合规性要求;修复了研究论文数据中的关键错误;并通过解决视频损坏问题稳定了 LeRobot 数据集。此外,TokenMonitor 项目在版本发布和架构重构方面取得了显著进展,同时完成了对 AdaptVision 代码库的深度分析,并计划进行环境迁移的系统维护。

Weekly Overview

Metric Value
Date Range 2026-05-04 ~ 2026-05-10
Active Days 7 / 7
Total Conversations 19
Projects 12
Tasks Completed 49
Tasks In Progress 2
Total Tokens 1,929,559,195
Total Cost $1,794.96
Claude Code Token 1,481,708,943
Claude Code Cost $1,367.30
Codex Token 447,850,252
Codex Cost $427.66
Daily Average Cost $256.42

Project Progress

TokenMonitor (3 days active) — 🔄 active

Accomplishments:

  • 成功执行了混合上游合并(hybrid upstream merge),同时保留了本地的 OAuth/Cursor/Codex 功能
  • 发布了 v0.13.0/v0.13.1 版本,采用了 statusline-first 的速率限制架构
  • 解决了 Windows 下 Codex 路径解析以及 NVIDIA PCIe power-state 导致的崩溃问题
  • 重构了 Settings UI 以支持多 provider

ErrorRecoveryBench (NeurIPS Submission) (1 days active) — 🔄 active

Accomplishments:

  • 生成了用于 NeurIPS E&D 合规性的 Croissant 元数据
  • 从 tianhe server 下载了 30GB 数据集
  • 修正了关键的论文数据错误 (BC-RNN SR)
  • 创建了出版质量的图表 (Fig 4-7)

Blockers:

  • ⚠️ 正在诊断 MimicGen segmentation 和 filter 失败问题

LeRobot Dataset & Error Recovery (1 days active) — 🔄 active

Accomplishments:

  • 开发了针对损坏 MP4 文件的诊断与修复脚本
  • 在 PairedDataset 中实现了鲁棒的错误处理和黑名单机制
  • 从原始 HDF5 源重新编码了损坏的 episodes

AdaptVision Analysis (1 days active) — ✅ completed

Accomplishments:

  • 梳理了完整的训练与评估流程
  • 追踪了 PPO reward 逻辑(outcome vs turn-level scores)

System Maintenance (1 days active) — 🔄 active

Accomplishments:

  • 导出了 4 个用于迁移的 conda environments
  • 为将 Miniconda 重新安装至 D: drive 做好了准备

Key Tasks

  • NeurIPS 2026 Compliance & Data Integrity — 生成了 Croissant 元数据,修正了 Table 6 中关键的 BC-RNN 数据错误(修复了 167% 的误差差异),并传输了 30GB 的发布数据用于托管。
  • LeRobot Video Data Repair & Pipeline Optimization — 通过 HDF5 重新编码识别并修复了 60 个损坏的 episodes,并在 PairedDataset 中实现了鲁棒的错误处理/黑名单机制。
  • AdaptVision Codebase & Reward Logic Mapping — 梳理了用于 adaptive visual acquisition 的 PPO 训练流水线和 reward 计算机制。
  • TokenMonitor Architecture & Release — 发布了 v0.13.0/v0.13.1,重构了 Settings UI,并解决了关键的 Windows/NVIDIA 硬件相关崩溃问题。
  • Scientific Visualization — 使用标准化的排版和配色方案制作了出版质量的图表 (4-7)。

Problems & Solutions

1. BC-RNN Normal SR 在论文中严重错误 (21% vs 实际 56%) [ErrorRecoveryBench]

Solution: 将所有表格数值与验证运行产生的 fact-check JSON 进行交叉验证,并将其拆分为两个 policy 行。

2. 解码增强视频帧时出现 RuntimeError: InvalidDataError [LeRobot Dataset]

Solution: 创建了修复脚本从 HDF5 重新编码损坏的 episodes,并在 DataLoader 中实现了动态 try-except/masking。

3. 在 AdaptVision 的 README.md 中发现硬编码的 API keys [AdaptVision]

Solution: 已识别并建议进行修复,并建议使用 environment variables。

4. JAX JIT compilation 阻止了对损坏样本的条件跳过 [LeRobot Dataset]

Solution: 确保 loss contribution 被 mask 为零,以符合 static graph 的要求。

5. Windows Codex 路径解析和 NVIDIA PCIe power-state 崩溃 [TokenMonitor]

Solution: 解决了关键的路径问题和驱动层面的 power state 冲突。

Learnings

Domain Knowledge (domain)

  • 必须根据原始 JSON 输出对实验结果进行事实核查;论文中的数值可能与实际测量值有显著偏差。
  • 在自定义 RL 中,reward engineering 逻辑通常是分布式的;追踪数据流比单纯阅读 config 更有效。

Debugging (debugging)

  • 损坏的视频可能会通过 header 检查,但在 PyAV 解码期间失败;需要进行显式解码以进行彻底诊断。

Tools (tools)

  • Conda environments 应该通过 export/rebuild 进行迁移,而不是直接复制文件夹,以避免硬编码路径问题。

AI Usage Notes

Effective Patterns:

  • ✓ 使用 AI 从高层脚本追踪到具体的 reward functions 的复杂代码执行路径。
  • ✓ 利用 AI 进行安全审计(检测硬编码的 keys)和文档优化。

Limitations:

  • ✗ AI 缺乏对机器人操作流水线调试的领域直觉(例如,无法察觉算法版本的不兼容性)。
  • ✗ AI 倾向于信任现有的 LaTeX/文档内容,而没有对原始数据进行独立验证。
  • ✗ AI 会尝试使用不受支持/无权限的 shell tools(如在沙盒环境中使用 ‘rg’),且没有立即提供 fallback 方案。

Next Week Outlook

优先完成将 Conda 迁移至 D: drive 的工作。重点解决 MimicGen segmentation 和 filter 失败问题,以提高成功率。通过确保满足所有数据集元数据和托管要求,完成 NeurIPS submission 的最后准备。

Token Usage Statistics

AI Usage · 2026-W19 Claude Code + Codex
Total cost
$1,794.96
Total tokens
1.93B
Output tokens
12M
Cache read
89.9%
Cost split Claude Code $1,367 · Codex $428
Token character Cache reads 89.9% · Active 10.1%

Most token volume came from cache reads.

Peak Day: 2026-05-06 — $695.86 / 692.4M tokens

Daily Average: $256.42