每日报告 — 2026-07-17
日常概述
- 完成事项: 解决了 GR00T 量化中的关键评估流程故障;在 RoboMME 上进行了机器人实验,验证了仅基于动作的适应方法缺乏视觉草图的问题;对 LIBERO 进行了安全数据剪枝和大规模部署分析;通过 Claude Code 完成了 LifeCopilot 及 ai-companion 项目的广泛元数据本地化工作。
- 实施方式: 修复了 Slurm 作业中的 ZMQ 端口冲突和 PyTorch 属性遮蔽问题;为 Tianhe3 数据删除实现了哈希验证的清单工作流程;利用 Codex/Claude Code 进行并行 GPU 部署,自动翻译 JSON 元数据,并通过 Ollama 本地部署 DeepWiki。
- 影响: 推翻了之前的“完美”量化指标,为 GR00T 建立了有效的基准;验证了动作草图条件对机器人记忆任务的重要性假设;安全回收了 142GB 存储空间;实现了主要代码库的完整双语文档支持。
MacOS
- 完成事项: 没有记录到主要开发活动。
- 实施方式: 不适用
- 影响: 不适用
TzJsDesktop
- 完成事项: 通过 Ollama 本地部署 DeepWiki,对 LifeCopilot/ai-companion 元数据进行了大量批量翻译,修复了 TokenMonitor 界面问题,并协调了 Tianhe3 任务的远程执行。
- 实施方式: 配置 Ollama/qwen3.6 用于 DeepWiki;使用带有严格 JSON 约束的 Claude Code 进行本地化处理;修补了 FastAPI 路由;修复了 Svelte/Tauri 状态问题。
- 影响: 实现了自托管文档功能,稳定了桌面工具,并完成了代码库的全面国际化。
athena
- 完成事项: 没有记录到主要开发活动。
- 实施方式: 不适用
- 影响: 无
lighthouse
- 完成事项: 执行了 RoboMME 阶段 0 基准测试(pi0.5)和仅基于动作的 Action-Sketcher 实验;进行了大规模的 LIBERO 部署和追踪分析。
- 实施方式: 在 A100 GPU 上使用 pi0.5/Action-Sketcher;实现了 34%/26% 的基准指标和 0% 的仅动作结果;在 Tianhe3 GPU3-5 上部署了 100 个并行场景;解析追踪日志以识别提前终止约束。
- 影响: 证明原始动作适应方法在记忆任务中失败,验证了动作草图条件的必要性;揭示了 LIBERO 环境步骤限制问题,导致无法完成完整周期评估。
GR00T 量化中的关键基础设施错误被识别并修复,RoboMME 的机器人学习基准验证了动作草图条件的必要性,大规模 LIBERO 部署揭示了环境提前终止问题,LifeCopilot 及 ai-companion 项目完成了全面国际化工作。
任务
架构与策略
- ✅ GR00T 量化流程错误修复 — 解决了并行 Slurm 作业中的 ZMQ 端口冲突,修正了 LLM 主干注入时的 PyTorch 属性遮蔽问题。增加了零动作/垃圾 LLM 的合理性检查,以验证基准测试的敏感性。
- ✅ RoboMME 与 Action-Sketcher 基准验证 — 复现了 pi0.5 基准测试(34%/26%),并在 RoboMME 上进行了仅基于动作的微调。仅动作基准测试达到了 0% 的成功率,验证了动作草图条件的必要性。
- ✅ LIBERO 大规模部署与追踪分析 — 在 Tianhe3 上部署了 100 个并行 Action-Sketcher 场景(GPU 3-5)。分析追踪日志发现部分场景提前终止(约 580 步),无法完成完整的 5 周期规划评估。为失败案例生成了思维链文档。
- ✅ ErrorRecoveryBenchmark 安全数据剪枝 — 在 Tianhe3 上执行了基于哈希验证、清单优先的剪枝流程,删除了约 142GB 无效的 HDF5 数据,确保与有效人类演示无重叠。
实施与修复
- ✅ LifeCopilot 与 ai-companion 国际化 — 使用 Claude Code 对 LifeCopilot 和 ai-companion 项目的 JSON 元数据进行了广泛的双向翻译(英文/中文)。确保了技术标识符和 JSON 结构的严格保留。
- ✅ 桌面应用稳定性修复 — 修复了导致托盘价格瞬间归零的 TokenMonitor 竞争条件;更新了 MeetingHelper 标题窗口的拖拽/折叠逻辑;修补了用于本地 Ollama 部署的 DeepWiki FastAPI WebSocket 路由。
- ✅ DeepWiki 本地部署 — 使用 Ollama 和 qwen3.6:35b 生成嵌入文本,通过 nomic-embed-text 实现嵌入,完成了 DeepWiki 的本地配置和部署,解决了依赖冲突问题。
问题与解决方案
关键问题
1. 并行 Slurm 作业争夺 ZMQ 端口 5555,PyTorch 属性遮蔽悄悄绕过了量化模块分配。两者都导致 GR00T 评估中出现虚假的“100% 成功”指标。
解决方案: 在 eval_quant.sbatch 中实现了动态端口分配。修改 serve_quantized.py,直接针对内部 Qwen3VLModel,绕过父属性获取器。增加了针对零动作/垃圾输入的合理性检查。
关键洞察: 隐秘的基础设施故障(端口冲突/桌面属性覆盖)可以产生完全一致但完全虚假的指标。严格的环境隔离和语义验证是必需的。
2. Action-Sketcher 仅基于动作的基准在 RoboMME 记忆任务中达到 0% 的成功率,原因是领域偏移和缺乏视觉上下文。
解决方案: 分析日志确认,没有草图条件的情况下,约 3亿参数的动作专家训练不足。确立了第一阶段草图自适应训练的必要性。
关键洞察: 从 LIBERO 到 RoboMME 的原始动作适应因控制语义差异而失败;视觉草图对于消除基于计数的记忆决策歧义至关重要。
3. LIBERO 场景提前终止(约 580 步),导致模型无法执行其完整的 5 周期规划循环,限制了分析深度。
解决方案: 不适用
关键洞察: 基准测试环境限制(步骤限制)从根本上限制了对依赖规划的智能体的评估。评估框架必须考虑由环境引起的提前终止。
4. Tianhe3 清理过程中存在意外删除有效数据的风险。
解决方案: 实现了“清单优先”工作流,在执行 tmux 基于的删除操作前,先通过 SHA256 哈希验证删除目标,确保人类干预下的安全控制。
关键洞察: 意图清单的加密哈希比 UI 确认对于破坏性远程操作更具安全保障。
一般问题
5. TokenMonitor 托盘价格瞬间归零是由于 Cursor API 缓存过期竞争导致。
解决方案: 实现了“ stale-while-revalidate”逻辑,在等待获取期间保留最后一次非零成本。关键洞察: API TTL 事件不应触发零状态 UI 更新;缓存策略必须将显示一致性与源数据新鲜度分离。
6. DeepWiki 后端崩溃由已废弃的 FastAPI add_websocket_route及依赖冲突引起。
解决方案: 修补代码使用 add_api_websocket_route,并解决了 uv/poetry/pyproject.toml 冲突问题。
关键洞察: 第三方框架更新可能悄悄破坏本地部署;部署过程中必须验证 API 兼容性。
7. 通过 SSH 传递复杂 Python 逻辑进行追踪分析时出现 Shell 转义错误。
解决方案: 改为通过 SSH/SCP 下载特定追踪文件,并在 Windows PowerShell/ConvertFrom-Json 中进行本地解析,以避免远程 Shell 的复杂性。
关键洞察: 减少远程 Shell 脚本的复杂性;在需要复杂处理时,在本地获取原始数据进行分析。
人类与 AI 方法对比
战略层面
GR00T 量化异常诊断
| 角色 | 方法 |
|---|---|
| 人类 | 用户强烈质疑低位量化的“100% 成功”率的有效性,怀疑是基础设施问题而非模型鲁棒性。他们发现了 Transformers 中隐藏状态记录器时序错误,而最初的 AI 解释没有注意到这些错误。 |
| AI | 最初将结果归因于基准测试饱和或模型鲁棒性。AI 关注代码级端口冲突,但在人类质疑和库知识指导下才理解到 PyTorch 属性掩码的问题。 |
差异分析: 无
机器人学基线策略
| 角色 | 方法 |
|---|---|
| 人类 | 用户要求转向“仅动作”快捷基线,以绕过耗时的草图注释,从而快速验证视觉是必要的假设。 |
| AI | AI 通过修改数据转换器忽略推理字段,并实施 action_only.sh,高效执行简化训练流程。 |
差异分析: 无
实施层面
本地化结构完整性
| 角色 | 方法 |
|---|---|
| 人类 | 用户定义了严格的负面约束(不使用 Markdown,保留键),以确保批量翻译的 JSON 有效性。按目标语言分组翻译以保持一致性。 |
| AI | AI 遵守结构保护机制,仅翻译字符串值。然而,AI 在复杂技术短语方面遇到困难,偶尔在没有严格约束的情况下混合语言。 |
差异分析: 无
AI 局限性
关键局限
- 未能立即意识到 PyTorch
nn.Module属性赋值被父类属性悄悄绕过,专注于标准继承而非框架特定描述符。
一般局限
- 在重复的批量翻译任务中难以保持严格的格式约束,偶尔会在明确负面提示的情况下混合语言或输出 Markdown。
- 未能自动解决 RoboMME 数据格式转换效率和 DeepWiki 依赖冲突,需要 AI 进行大量手动脚本编写。
- 最初错误识别了无声评估失败的根本原因,过度假设之前的量化结果可用于分析,直到被迫调试基础设施。
- 对“训练”与“评估”数据集分割要求的理解错误,将混合样本与严格的来源基础重建需求混淆。
经验教训
关键经验
- 在新评估流程中始终包含“零动作”或“空输入” sanity 检查,以确保环境不会崩溃,并避免因基础设施无声故障而返回默认成功值。
- 对于远程集群上的破坏性数据操作,采用“清单优先”方法并辅以 SHA256 验证,对于安全的人工审核删除至关重要。
- 在机器人学 VLA 任务中,“内存”是一种与“动作执行”不同的失败模式。没有草图/内存条件观测的基线在计数任务上完全失败。
- 在替换 PyTorch 模型中的深度子模块时,通过断言或 sanity 测试验证替换是否实际使用,因为属性/描述符可能悄悄覆盖赋值。
- 基准环境(如 LIBERO)可能有严格限制(<580 步),导致注重规划的智能体无法进行更深的推理循环;评估框架必须适应这些限制。
实际经验
- 在调试 Tauri/Svelte 应用中的 UI 闪烁时,API 获取和本地缓存过期之间的竞态是导致如“$0”价格等瞬时状态错误的常见原因。
对话总结
GR00T 量化评估
✅ 基础设施漏洞修复和基线验证 14:50:00 | claude_code/codex 诊断并修复了 Slurm 作业中的关键 ZMQ 端口冲突和导致虚假“100%”成功指标的 PyTorch 属性掩码错误。通过零动作测试验证基线敏感性,确定 GR00T 对量化错误非常敏感。
RoboMME / Action-Sketcher 研究
✅ 机器人学基线实验 15:44:00 | cursor 执行了 RoboMME Phase 0 (pi0.5 基线)和 Action-Sketcher“仅动作”基线。尽管训练损失成功,但仅动作评估在内存任务上得分为 0%,确认草图条件对于消除歧义是必要的。
ErrorRecoveryBenchmark / WorldModel3DVisualPrompt
✅ 数据修剪和 LIBERO 部署分析 14:11:30 | codex 对 ErrorRecoveryBenchmark 的约 142GB 无效数据进行了安全、哈希验证的修剪。在 Tianhe3 上部署了 100 个并行 Action-Sketcher 部署,发现早期环境终止(~580 步)阻止了完整的 5 周期规划评估。
LifeCopilot / ai-companion
✅ 元数据国际化和概述生成
02:52:28 | claude_code
完成了两个项目的 JSON 元数据的广泛双向翻译。使用 /ccoverview生成双语架构概述。建立了严格的提示约束,以在本地化过程中保留技术标识符。
DeepWiki / 桌面工具
✅ 本地部署和 UI 修复 03:23:52 | claude_code/cursor 使用 Ollama/qwen3.6 在本地部署 DeepWiki,修复了 FastAPI 路由废弃问题。修复了 TokenMonitor 价格闪烁到零的竞态和 MeetingHelper 标题窗口交互错误。