每日报告 — 2026-06-24
日常概述
- 已完成工作: 对AI开发伴侣进行了端到端基础设施修复,将其整合为单仓库中的通用插件,并完成了视觉指令生成和视频性能评估的验证概念验证产品。这包括识别隐形的后台资源耗尽问题,在离线集群上修复损坏的远程模型权重,以及建立跨平台的AI编码助手一致性。
- 实现方式: 通过追踪 ‘collect-report-data.ts’ 中的孤立 vitest 进程,诊断并解决了CPU波动问题,实施了文件锁定单例保护机制;使用git subtree集成将ai-companion嵌入到gadget仓库中;为Claude Code和Codex创建独立的插件清单;在通过safetensors头部验证完整性后,通过跨设备同步修复了Tianhe2上的截断模型碎片;执行Slurm作业和本地脚本以生成评估报告。
- 影响: 通过消除后台线程拥塞恢复了系统稳定性,实现了跨AI编码平台的一键安装功能,尽管存在初始环境障碍,仍成功验证了两种不同VLM研究方向的技术流程。
MacBook
- 已完成工作: 管理了ai-companion插件的架构设计,对高CPU使用进行了深度诊断,合并了git分支,并开始编写服务器引导脚本。
- 实现方式: 使用CLI工具(ps、lsof)追踪‘collect-report-data.ts’中的僵尸进程;实施文件锁定机制;使用Claude Code/Codex来构建插件清单并合并仓库。
- 影响: 停止了导致功耗增加的失控守护进程循环,标准化了ai-companion的安装流程,通过分支合并确保了仓库的清洁度。
TzJsDesktop
- 已完成工作: 开发了Cosmos3-Nano MVP运行器,解决了网络/代理问题,修复了Tianhe2上的损坏模型权重,并通过本地脚本验证代码。
- 实现方式: 使用Python和ShellCheck包装器进行验证;通过SSH/scp管理远程状态;手动启用代理以同步截断碎片;分析git树拓扑结构以验证合并状态。
- 影响: 成功执行评估流程,生成了60条评分记录,在离线条件下验证了数据完整性,并确认了代码库中的分支差异问题。
athena.egr.duke.edu
- 已完成工作: 使用Cosmos模型执行了零样本箭头生成的MVP测试。
- 实现方式: 提交了一个Slurm作业(145452),运行‘wm_detect/arrow_mvp.py’,该作业在LIBERO/RoboCasa框架上查询冻结模型。分析了输出图像和坐标数据。
- 影响: 提供了实证证据,表明所选模型无法零样本地实现视觉指令的基础,未来工作将转向候选者选择方法。
解决了‘ai-companion’基础设施中的关键并发和CPU波动问题,将其作为跨平台插件整合到‘gadget’单仓库中(Claude Code/Codex),执行了两个不同的VLM MVP(一个在零样本生成上失败,另一个通过修复模型权重成功评估了视频性能),并开始设计自动服务器引导机制。
任务
架构与策略
- ✅ AI Companion并发错误修复与整合 — 解决了导致CPU波动的‘collect-report-data.ts’并发问题,通过subtree将ai-companion集成到gadget中,并转换为Claude Code和Codex的跨平台插件。
- ✅ 视觉指令MVP测试(零样本) — 执行了MVP以测试冻结的Cosmos Reason-1模型能否生成零样本视觉箭头;结果确认失败,策略转向候选者选择。
- ✅ Cosmos3-Nano视频评估MVP — 实现了并运行了使用Cosmos3-Nano对Tianhe2上的10个RoboCasa视频进行评判的端到端运行器,包括模型修复和流程验证。
- 🔄 服务器引导脚本架构 — 开始设计基于shell的脚本以自动化Ubuntu服务器引导,包括SSH密钥和插件安装。
实施与修复
- ✅ Git分支合并与分析 — 将开发分支合并到main;检测到并验证‘deploy/pi05-gr00t-n16-smoke’尽管标题如此,却未正确合并。
问题与解决方案
关键问题
1. ai-companion后台守护进程产生的无限制并发vitest进程导致严重的CPU拥塞。
解决方案: 追踪到‘collect-report-data.ts’中的根本原因;实施文件锁定单例保护机制以防止重复运行,并分析进程树以识别具体罪魁祸首。
关键洞察: 没有速率限制或单例锁定的后台自动化工具会导致系统立即退化;隔离需要限制速度或用户显式激活。
2. 冻结的VLM(Cosmos-Reason1-7B)在零样本生成箭头关键点时,无论输入任务如何,都会产生恒定且未锚定的坐标。
解决方案: 放弃直接坐标生成假设。策略转向使用“候选者选择”(MOKA/PIVOT式:程序化生成候选者,使用VLM进行排序/选择),从而消除了模型中最难的部分。
关键洞察: 当前冻结推理模型直接零样本像素定位过于困难;通过候选者排名的间接基础是更可行的路径。
3. Tianhe2上的Cosmos3-Nano模型权重损坏(截断碎片),导致vLLM启动失败和隐形的数据完整性问题。
解决方案: 使用Safetensors头部识别损坏碎片,利用主机互联网访问从HuggingFace重新下载特定文件,本地验证完整性,并通过SCP将其传输到远程集群。
关键洞察: 集群上的远程模型文件可能悄无声息地退化;在离线或代理链环境中,始终在提供权重前验证文件完整性(头部/大小)。
一般问题
4. git分支‘deploy/pi05-gr00t-n16-smoke’看似已合并,但main中缺少内容;ai-companion缺乏Codex兼容性。
解决方案: 通过树比较验证差异;创建独立的插件清单以确保Claude Code和Codex生态系统的一致性。
关键洞察: Git合并标题不是内容包含情况的可靠指标;不同的AI助手需要定制的配置机制以实现通用分发。
人类与AI方法
战略层面
损坏模型权重诊断与修复| 角色 | 方法 |
|——|——| | 人类 | 用户提供了关键的实时输入(本地代理状态、确认仓库中存储的是标记后的视频而非 openpi)。当标准连接方式失败时,用户还手动启用了网络代理。 | | AI | AI 使用 Python safetensors 读取器对 Tianhe2 进行迭代文件验证,精准定位被截断的碎片。然后利用自身的本地互联网访问能力(节点 lacks 此能力)重新获取特定 SHA-验证文件,并通过安全的 scp 传输来修复它们。 |
差异分析: AI 在程序化文件分析和跨机器协调方面表现优异,而人类提供了必要的上下文(代理状态),并确认了自动化检查无法发现的数据可用性假设。
视觉指令策略与 MVP 范围
| 角色 | 方法 |
|---|---|
| 人类 | 用户坚持采用简单的 MVP(“能否零样本生成箭头?”),而非立即进行复杂的统计严谨性或政策测试。后来明确表明动态生成是核心创新点。 |
| AI | AI 最初提出复杂的对抗性审计和完整的 ECL 图。根据用户反馈调整方案,将 MVP 范围与“零样本生成测试”目标对齐,再不涉及政策问题。 |
差异分析: 人类关注于核心可行性的即时验证;AI 则致力于全面的研究严谨性。妥协在于简化了的 MVP 脚本。
Codex 与 Claude Code 代码一致性
| 角色 | 方法 |
|---|---|
| 人类 | 人类意识到“一刀切”不可行,要求为 Codex 提供特定等价方案,而非强制使用 Claude Code hook 模型。 |
| AI | AI 最初提议采用 Claude Code 插件格式,但在人类明确需要 Codex 一致性后,转而创建专门的包装脚本。 |
差异分析: 人类对跨平台一致性的坚持迫使创建两条不同的集成路径,而非单一理想解决方案。
AI 局限性
关键局限
- Cosmos-Reason1-7B 明显无法执行零样本空间定位(像素精度),无论输入文本如何,均输出静态坐标。
- AI 未意识到在守护进程循环中运行 collect-report-data.ts 会导致大量 CPU 使用量激增,除非用户干预,否则直到深度进程分析完成。
一般局限
- 由于本地主机上的网络波动,初始 SSH 和 wget 连接 Tianhe2 会中断;Windows/WSL 环境在没有虚拟环境的情况下无法使用原生 bash 验证。AI 在 Codex 沙箱中运行 npm ci 时也遇到困难。
- “TzJsDesktop” 上工具执行中断以及无法视觉检查发布视频,限制了对分支状态和模型行为的全面验证。
经验教训
关键经验
- 单仓库设置中的后台任务必须采用严格的单例锁定;同时执行繁重的测试脚本是后台资源过度消耗的主要原因。
- 冻结的 VLMs(如 Cosmos-Reason1-7B)目前在零样本像素定位方面表现不佳;研究应转向候选模型选择或微调方法,而非依赖原始生成能力。
实际经验
- 开发工具脚本(如测试收集器)必须实现单实例保护机制,以防止因突发事件或手动重试导致的资源浪费。Git 子目录在保持历史记录的同时有效嵌入独立工具。
- 对于需要视频/音频数据的 MVP,通过实际文件系统对象验证manifest 路径可避免“幽灵运行”现象,这些运行看似成功但实际上评估的是空集合。Git 合并标题并非内容包含性的可靠指标。
对话总结
AI 辅助基础设施与集成
✅ 修复并发错误、合并到 gadget 单仓库,并创建跨平台插件一致性 22:13:53.341 | 合并 识别并修复了“ai-companion”中的关键错误,其中 collect-report-data.ts 生成了并发 vitest 进程,导致 CPU 使用量激增。通过文件锁定机制解决了问题。将独立的 ai-companion 仓库作为 git subtree 合并到 gadget 单仓库中,并重构为 Claude Code 和 Codex 的标准插件格式,以确保跨平台兼容性。
视觉指令政策指导 MVP
✅ 零样本视觉箭头生成测试的对齐、研究与执行 04:05:33.216 | 合并 将新功能需求与动态视觉指令的 VLA 政策对齐。进行了现有研究(RoVI、PEEK、OmniGuide)。执行了 MVP 脚本,测试当前冻结模型(Cosmos)能否零样本生成箭头。MVP 失败,确认需要候选模型选择策略而非直接坐标生成。
RoboCasa 视频评估 MVP
✅ 在 Tianhe2 上对 Cosmos3-Nano 进行端到端评估,包括模型权重修复 21:39:34.533 | 合并 开发并执行了使用 Cosmos3-Nano 在 Tianhe2 上评判 10 个 RoboCasa 视频的 runner。通过从主机机器同步发现并修复被截断的模型碎片。成功生成评估结果(AUROC 0.48)。分析 git 历史记录以确认代码库中的分支合并差异。
Gadget 引导策略
🔄 构建服务器引导脚本 21:18:21.056 | 合并 开始规划一个强大的“onboard-server.sh”脚本,以自动化设置带有 SSH 密钥、Claude 平台凭证和跨平台 AI 代理工具安装的新 Ubuntu 服务器。