Daily Report — 2026-05-02
Daily Overview
- 完成工作: 在 Clean Rollout 和 Error Recovery 任务中评估了 pi0.5 model v2 的性能;调试并修复了 TokenMonitor FloatBall Cursor 利用率显示问题
- 实施方式: 对 benchmark 数据进行统计分析,包含 delta 计算和 regression 识别;修改 Rust backend 并添加了 fallback 逻辑及全面的测试覆盖
- 影响: 识别出 pick_place 任务中需要调查的关键 regression 模式;为仅有 plan_usage data 的用户恢复了 Cursor rate limit 监控功能
MacBook
- 完成工作: 多次尝试登录但未进行实质性工作
- 实施方式: 尝试与 Claude Code 交互但遇到了身份验证障碍
- 影响: 无生产性输出;session 未能越过登录界面
TzJsDesktop
- 完成工作: 分析了 pi0.5 v1/v2 model 在 6 个 robotics 任务中的对比情况;修复了 TokenMonitor Cursor FloatBall 显示 N/A 的 bug
- 实施方式: 使用 delta 列格式化性能表格,计算了 aggregate statistics,并识别了特定任务的模式;修改了 tray.rs 的 utilization 提取逻辑,增加了 extra_usage→primary_window 的 fallback
- 影响: 发现 v2 在 Clean Rollout (-5.6pp) 和 pick_place 任务 (-24.1pp in Error Recovery) 中存在 regression,已标记待调查;为仅有 plan_usage data 的用户恢复了 Cursor utilization 显示
分析了 robotics model 性能 regression 并修复了 TokenMonitor Cursor utilization 显示 bug
Tasks
Architecture & Strategy
- ✅ Analyze pi0.5 model v2 performance vs v1 — 为 BCRNN 和 pi0.5 models 在 Clean Rollout 和 Error Recovery 场景下的 benchmark 表格进行了格式化,计算了 deltas,并识别了 v2 中的 regression 模式
Implementation & Fixes
- ✅ Fix TokenMonitor Cursor FloatBall N/A display — 修改了 tray.rs,使 Cursor 的利用率从 extra_usage_utilization fallback 到 primary_window_utilization,增加了两个测试,并通过 21 个测试且 clippy clean
Problems & Solutions
Critical Issues
1. pi0.5 v2 在 Clean Rollout 中表现出整体 regression (-5.6pp average),尽管在 threading task 中有所提升 (+24pp)
Solution: 使用带有 delta 列的对比表格来隔离特定任务的性能变化;识别出 pick_place, coffee, stack, 和 stack_three 为 regressing 任务
Key Insight: Model v2 具有任务特定的性能差异:threading 的显著提升与 manipulation 任务中的广泛 regression 形成对比,这表明是架构上的 trade-offs 而非统一的退化
2. pick_place 任务在 Error Recovery 场景中表现出严重的 regression:pi0.5 v2 下降了 -24.1pp (42.9% → 18.8%)
Solution: 在分析摘要中将 pick_place 标记为关键调查优先级;尚未实施即时修复,等待更深入的诊断
Key Insight: 即使基础任务完成率尚可,Error recovery 性能也可能显著下降,这表明 v2 可能降低了对 perturbations 的 robustness
General Issues
3. TokenMonitor FloatBall 对 Cursor utilization 显示 N/A,因为对于仅有 plan_usage data 的用户,extra_usage 字段为 None
Solution: 将 tray_utilization_from_rate_limits() 中的 Cursor utilization 提取逻辑从仅限 extra_usage 改为 fallback 链:extra_usage_utilization().or_else(|| primary_window_utilization())
Key Insight: 大多数 Cursor 用户拥有 plan_usage (基于 windows 的 auto_percent_used/api_percent_used),但缺乏 spend_limit_usage (基于 extra_usage);之前的代码仅检查 extra_usage,导致 None → N/A 显示
Human vs AI Approaches
Strategic Level
Model performance comparison methodology
| Role | Approach |
|---|---|
| Human | 用户提供了带有 running/completed 标记的原始 benchmark tables,并要求进行带有 v2-v1 delta analysis 的格式化对比 |
| AI | Claude 添加了 delta 列、用于 running 任务的 emoji 指示器、突出了每个任务中表现更好的版本、计算了 aggregate statistics,并提供了关于 regression 模式的书面解读 |
Difference Analysis: Human 侧重于视觉呈现和高层级的对比请求;AI 在未被要求的情况下增加了统计深度 (aggregate changes, task-specific pattern analysis) 和诊断性建议
AI Limitations
General Limitations
- 多个 MacBook sessions 显示 Claude 未登录,但未针对解决身份验证问题提供主动指导
Learnings
Key Learnings
- Model version 的改进可能是任务特定的而非统一的:pi0.5 v2 在 threading 上提升了 +24pp,但在其他 4 个 Clean Rollout 任务中出现 regression,这表明存在值得进行 per-task 调查的架构 trade-offs
- Error recovery 性能可能与基础任务成功率脱钩:尽管 Clean Rollout 状态未知,但 pick_place 在 Error Recovery 中 regressed -24.1pp,突显了 robustness 是一个独立的评估维度
Practical Learnings
- Rate limit 数据源因用户层级而异:Cursor 用户可能有 plan_usage (基于 windows) 但没有 spend_limit_usage (基于 extra_usage),这需要在 UI 数据提取中添加 fallback 逻辑以避免 null/N/A 显示
Conversation Summaries
Robotics Model Benchmarking
✅ pi0.5 v2 performance evaluation vs v1 across 6 tasks 05:56:19.034 | claude_code 用户提供了 BCRNN 和 pi0.5 models (v1/v2) 在 Clean Rollout 和 Error Recovery 场景下的原始 benchmark tables。Claude 使用 delta 列格式化了数据,计算了 aggregate statistics,并识别出 pi0.5 v2 在 Clean Rollout 中整体 regression (-5.6pp),除了 threading (+24pp) 之外,其中 pick_place 显示出严重的 Error Recovery regression (-24.1pp)。建议调查 v2 的 pick_place 和 coffee 任务的 regression。
TokenMonitor
✅ Fix Cursor FloatBall N/A display bug 05:57:21.549 | claude_code 延续之前的 session 以修复 Cursor rate limit utilization 在 FloatBall widget 中显示 N/A 的问题。根本原因:tray_utilization_from_rate_limits() 仅检查 extra_usage_utilization (来自 spend_limit_usage),但大多数 Cursor 用户只有 plan_usage (primary_window data)。修改了 Cursor 提取逻辑,使其从 extra_usage fallback 到 primary_window。增加了两个测试,所有 21 个测试均通过,clippy clean。