Weekly Report — 2026-W18 (2026-04-27 ~ 2026-05-03)

本周的特点是在软件稳定性、数据 pipeline 构建以及深度模型评估方面取得了显著进展。TokenMonitor 进行了多次更新(v0.12.1 至 v0.12.3),成功解决了关键的 Windows 平台 bug、UI/UX 不一致以及 tray icon 显示问题。在 robotics 领域,在 error recovery 数据收集和将大规模数据集传输到 tianhe server 方面取得了实质性进展,同时对 pi0.5 model v2 进行了关键的性能分析,发现其在 manipulation tasks 中存在显著的任务特定回归。此外,还完成了包括将报告批量部署到 GitHub Pages 在内的基础设施任务,尽管开发能力偶尔受到特定平台 CI 失败和环境身份验证问题的限制。

Weekly Overview

Metric Value
Date Range 2026-04-27 ~ 2026-05-03
Active Days 6 / 7
Total Conversations 23
Projects 7
Tasks Completed 23
Tasks In Progress 2
Total Tokens 1,828,169,469
Total Cost $1,439.54
Claude Code Token 1,184,554,421
Claude Code Cost $892.21
Codex Token 643,615,048
Codex Cost $547.33
Daily Average Cost $239.92

Project Progress

TokenMonitor (5 days active) — 🔄 active

Accomplishments:

  • 解决了主要的 Windows 平台 bug,包括 hover 震荡、tray icon focus 问题以及窗口对齐异常
  • 使用 Rust IPC 和 polling 逻辑实现了 Cursor IDE auto-reconnect 功能
  • 发布了 v0.12.1 并更新至 v0.12.3,提升了关键的 window resize 稳定性(500px cap)并优化了 UI
  • 统一了 model name 格式,扩展了品牌配色方案,并通过在 tray.rs 中实现 fallback utilization chain 修复了 Cursor FloatBall 的 ‘N/A’ 显示问题

Blockers:

  • ⚠️ 由于特定平台的 linting(macOS vs Windows)导致 CI 失败

Robotics ML Pipeline (1 days active) — 🔄 active

Accomplishments:

  • 为 error recovery pick_place demonstration 收集了 88 个 NPZ files
  • 通过 rsync 成功将 1.9GB 数据传输至 tianhe server

Blockers:

  • ⚠️ 由于脚本配置错误导致 subtype 收集不完整(缺失 stuck_no_progress_D1)

Robotics Model Evaluation (2 days active) — 🔄 active

Accomplishments:

  • 对 pi0.5 v1 vs v2 的性能进行了全面的统计分析
  • 识别出 Clean Rollout 和 Error Recovery 任务中的 regression patterns
  • 创建了评估结果的正式 markdown 文档

Blockers:

  • ⚠️ pick_place 任务中显著的性能下降需要进一步调查

Gadget Summarization Pipeline (1 days active) — ✅ completed

Accomplishments:

  • 成功将积累的 66 份每日报告批量部署到 GitHub Pages

Key Tasks

  • Windows hover oscillation bug 的根因诊断与修复 — 实现了三层防御(state check、resize blocking 和 shrink-guard),以打破 chart 交互期间窗口重新定位与浏览器 mouse events 之间的反馈循环。
  • 🔄 Error recovery pick_place 数据收集 — 系统性地收集 robotic error recovery subtypes;目前已覆盖 23/24 个 subtypes。
  • 分析 pi0.5 model v2 性能 vs v1 — 格式化了 benchmark tables 并计算了 deltas,以识别 v2 在 Clean Rollout 和 Error Recovery 场景中的 regression patterns,发现 pick_place 任务中存在关键下降(-24.1pp)。
  • 实现 Cursor IDE auto-reconnect 功能 — 添加了基于 Rust 的 IPC commands 和前端 polling 机制,无需重启应用即可自动恢复连接状态。
  • 将 error recovery 数据上传至 tianhe server — 将 1.9GB 经过验证的 NPZ files 和 scripts 传输到远程存储以供 pipeline 使用。
  • 修复 TokenMonitor Cursor FloatBall N/A 显示问题 — 修改了 tray.rs 以实现 fallback logic (extra_usage -> primary_window_utilization),确保拥有 plan-based usage 的 Cursor 用户可以查看 utilization 数据。

Problems & Solutions

1. 当悬停在 chart bars 上时,由于 resizing 和 mouseLeave events 之间的反馈循环,窗口高度会快速震荡。[TokenMonitor] (2026-04-27)

Solution: 实现了包括基于 state 的检测和 ResizeOrchestrator 在内的三层防御,以阻止 hover 期间由 observer 驱动的 resizing。

2. 在 Windows tray icon 点击时 SetFocus 失败,因为调用线程缺乏 foreground ownership。[TokenMonitor] (2026-04-27)

Solution: 切换到 SetForegroundWindow,它在 tray icon 上下文中提供隐式权限。

3. 初始 v0.12.1 发布因 cargo fmt 和 clippy warnings 导致 CI 失败。[TokenMonitor] (2026-04-28)

Solution: 执行了本地格式化修复,移除了多余的 returns,并管理了干净的 git tag 删除/重新创建工作流。

4. 由于缺少目录以及本地与远程预期根路径不匹配,导致服务器数据上传失败。[Robotics ML Pipeline] (2026-04-29)

Solution: 手动创建了远程目录,并将数据上传到多个位置,以同时满足本地脚本和下游工具的要求。

5. pi0.5 v2 在 Clean Rollout 中表现出整体 regression (-5.6pp),并在 pick_place Error Recovery 中表现出严重 regression (-24.1pp)。[Robotics Model Evaluation]

Solution: 通过 delta-formatted comparison tables 隔离了特定任务的性能变化,发现 threading 有所提升 (+24pp),而 manipulation tasks 则出现回归,这表明存在架构上的权衡(architectural trade-offs)。

6. 由于某些用户层级缺失 extra_usage 字段,TokenMonitor FloatBall 显示 Cursor utilization 为 N/A。[TokenMonitor]

Solution: 在 tray.rs 中实现了一个 fallback chain,当 extra_usage 为 None 时使用 primary_window_utilization。

Learnings

Architecture (architecture)

  • UI 系统中的反馈循环(resize → move → event → resize)需要多层干预,而非单点修复。
  • Git tag 管理:checkout 一个 tag 会进入 detached HEAD 状态,需要显式的 switch 和 merge 来更新本地分支。

Debugging (debugging)

  • 在 async window management 中,锚定到稳定的 work area bounds 比在快速更新期间查询“当前”窗口状态更可靠。
  • Rate limit 数据结构因用户层级而异;UI extraction 逻辑必须考虑到不同的可用字段(plan_usage vs spend_limit_usage)。

Tools (tools)

  • Pre-release validation 必须在本地包含完整的 CI suites(fmt, clippy with -D warnings),以避免 public tag churn。

Domain Knowledge (domain)- 品牌的 UI color systems 应使用 hue 进行家族区分,使用 brightness 进行版本区分,以确保与竞争对手之间有清晰的视觉区别。

  • Model version 的改进可以是特定任务导向的;在某一领域(threading)的显著提升可能会导致另一领域(manipulation/error recovery)的退化。
  • Error recovery 的鲁棒性是一个独立的评估维度,可以与基础任务的成功率解耦。

AI Usage Notes

Effective Patterns:

  • ✓ 增量式假设验证(在完整实现前检查 logs/state)
  • ✓ 利用人类领域知识来引导抽象的技术实现(例如 brand colors)
  • ✓ 自动化的统计深度:AI 在没有明确提示的情况下,有效地为原始 benchmark 数据添加了 delta 列和聚合统计数据。

Limitations:

  • ✗ 在确认面向用户的症状之前,倾向于直接跳转到复杂的技术实现
  • ✗ 未能在数据收集过程中主动根据 manifest ‘ground truth’ 验证 script targets
  • ✗ 缺乏主动排障能力:在 MacBook 上遇到重复的身份验证失败时,AI 未能建议使用 ‘/login’ 命令。

Next Week Outlook

优先调查 pi0.5 v2 pick_place 任务的 regression。完成 robotics dataset 中剩余的 ‘stuck_no_progress_D1’ 子类型。解决 MacBook 身份验证问题以恢复完整的开发能力。对于 TokenMonitor,在 v0.12.3 更新后保持稳定性,并继续完善 multi-platform CI pipeline。

Token Usage Statistics

AI Usage · 2026-W18 Claude Code + Codex
Total cost
$1,439.54
Total tokens
1.83B
Output tokens
12M
Cache read
91.5%
Cost split Claude Code $892 · Codex $547
Token character Cache reads 91.5% · Active 8.5%

Most token volume came from cache reads.

Peak Day: 2026-04-30 — $695.11 / 830.5M tokens

Daily Average: $239.92