Daily Report — 2026-05-02

Daily Overview

  • 完成工作: 在 Clean Rollout 和 Error Recovery 任务中评估了 pi0.5 model v2 的性能;调试并修复了 TokenMonitor FloatBall Cursor 利用率显示问题
  • 实施方式: 对 benchmark 数据进行统计分析,包含 delta 计算和 regression 识别;修改 Rust backend 并添加了 fallback 逻辑及全面的测试覆盖
  • 影响: 识别出 pick_place 任务中需要调查的关键 regression 模式;为仅有 plan_usage data 的用户恢复了 Cursor rate limit 监控功能

MacBook

  • 完成工作: 多次尝试登录但未进行实质性工作
  • 实施方式: 尝试与 Claude Code 交互但遇到了身份验证障碍
  • 影响: 无生产性输出;session 未能越过登录界面

TzJsDesktop

  • 完成工作: 分析了 pi0.5 v1/v2 model 在 6 个 robotics 任务中的对比情况;修复了 TokenMonitor Cursor FloatBall 显示 N/A 的 bug
  • 实施方式: 使用 delta 列格式化性能表格,计算了 aggregate statistics,并识别了特定任务的模式;修改了 tray.rs 的 utilization 提取逻辑,增加了 extra_usage→primary_window 的 fallback
  • 影响: 发现 v2 在 Clean Rollout (-5.6pp) 和 pick_place 任务 (-24.1pp in Error Recovery) 中存在 regression,已标记待调查;为仅有 plan_usage data 的用户恢复了 Cursor utilization 显示

分析了 robotics model 性能 regression 并修复了 TokenMonitor Cursor utilization 显示 bug

Tasks

Architecture & Strategy

  • Analyze pi0.5 model v2 performance vs v1 — 为 BCRNN 和 pi0.5 models 在 Clean Rollout 和 Error Recovery 场景下的 benchmark 表格进行了格式化,计算了 deltas,并识别了 v2 中的 regression 模式

Implementation & Fixes

  • Fix TokenMonitor Cursor FloatBall N/A display — 修改了 tray.rs,使 Cursor 的利用率从 extra_usage_utilization fallback 到 primary_window_utilization,增加了两个测试,并通过 21 个测试且 clippy clean

Problems & Solutions

Critical Issues

1. pi0.5 v2 在 Clean Rollout 中表现出整体 regression (-5.6pp average),尽管在 threading task 中有所提升 (+24pp)

Solution: 使用带有 delta 列的对比表格来隔离特定任务的性能变化;识别出 pick_place, coffee, stack, 和 stack_three 为 regressing 任务

Key Insight: Model v2 具有任务特定的性能差异:threading 的显著提升与 manipulation 任务中的广泛 regression 形成对比,这表明是架构上的 trade-offs 而非统一的退化

2. pick_place 任务在 Error Recovery 场景中表现出严重的 regression:pi0.5 v2 下降了 -24.1pp (42.9% → 18.8%)

Solution: 在分析摘要中将 pick_place 标记为关键调查优先级;尚未实施即时修复,等待更深入的诊断

Key Insight: 即使基础任务完成率尚可,Error recovery 性能也可能显著下降,这表明 v2 可能降低了对 perturbations 的 robustness

General Issues

3. TokenMonitor FloatBall 对 Cursor utilization 显示 N/A,因为对于仅有 plan_usage data 的用户,extra_usage 字段为 None

Solution: 将 tray_utilization_from_rate_limits() 中的 Cursor utilization 提取逻辑从仅限 extra_usage 改为 fallback 链:extra_usage_utilization().or_else(|| primary_window_utilization())

Key Insight: 大多数 Cursor 用户拥有 plan_usage (基于 windows 的 auto_percent_used/api_percent_used),但缺乏 spend_limit_usage (基于 extra_usage);之前的代码仅检查 extra_usage,导致 None → N/A 显示

Human vs AI Approaches

Strategic Level

Model performance comparison methodology

Role Approach
Human 用户提供了带有 running/completed 标记的原始 benchmark tables,并要求进行带有 v2-v1 delta analysis 的格式化对比
AI Claude 添加了 delta 列、用于 running 任务的 emoji 指示器、突出了每个任务中表现更好的版本、计算了 aggregate statistics,并提供了关于 regression 模式的书面解读

Difference Analysis: Human 侧重于视觉呈现和高层级的对比请求;AI 在未被要求的情况下增加了统计深度 (aggregate changes, task-specific pattern analysis) 和诊断性建议

AI Limitations

General Limitations

  • 多个 MacBook sessions 显示 Claude 未登录,但未针对解决身份验证问题提供主动指导

Learnings

Key Learnings

  • Model version 的改进可能是任务特定的而非统一的:pi0.5 v2 在 threading 上提升了 +24pp,但在其他 4 个 Clean Rollout 任务中出现 regression,这表明存在值得进行 per-task 调查的架构 trade-offs
  • Error recovery 性能可能与基础任务成功率脱钩:尽管 Clean Rollout 状态未知,但 pick_place 在 Error Recovery 中 regressed -24.1pp,突显了 robustness 是一个独立的评估维度

Practical Learnings

  • Rate limit 数据源因用户层级而异:Cursor 用户可能有 plan_usage (基于 windows) 但没有 spend_limit_usage (基于 extra_usage),这需要在 UI 数据提取中添加 fallback 逻辑以避免 null/N/A 显示

Conversation Summaries

Robotics Model Benchmarking

✅ pi0.5 v2 performance evaluation vs v1 across 6 tasks 05:56:19.034 | claude_code 用户提供了 BCRNN 和 pi0.5 models (v1/v2) 在 Clean Rollout 和 Error Recovery 场景下的原始 benchmark tables。Claude 使用 delta 列格式化了数据,计算了 aggregate statistics,并识别出 pi0.5 v2 在 Clean Rollout 中整体 regression (-5.6pp),除了 threading (+24pp) 之外,其中 pick_place 显示出严重的 Error Recovery regression (-24.1pp)。建议调查 v2 的 pick_place 和 coffee 任务的 regression。

TokenMonitor

✅ Fix Cursor FloatBall N/A display bug 05:57:21.549 | claude_code 延续之前的 session 以修复 Cursor rate limit utilization 在 FloatBall widget 中显示 N/A 的问题。根本原因:tray_utilization_from_rate_limits() 仅检查 extra_usage_utilization (来自 spend_limit_usage),但大多数 Cursor 用户只有 plan_usage (primary_window data)。修改了 Cursor 提取逻辑,使其从 extra_usage fallback 到 primary_window。增加了两个测试,所有 21 个测试均通过,clippy clean。

Token Usage

AI Usage · 2026-05-02 Claude Code + Codex
Total cost
$62.31
Total tokens
81M
Output tokens
481K
Cache read
86.8%
Cost split Claude Code $9 · Codex $53
Token character Cache reads 86.8% · Active 13.2%

Most token volume came from cache reads; Codex drove nearly all cost.