每日报告 — 2026-06-22

日常概述

  • 已完成工作: 完成了 AI Companion双智能体生态系统的关键基础设施修复,完成了桌面视频功能的深度代码审计,进行了空间转录组聚类的基础研究,并部署了/验证了 Tianhe-2机器人模型基准测试环境。
  • 实施方式: 实现了 TypeScript 适配器以协调 Claude Code 与 Codex 之间的钩子模式;使用自动化对抗脚本配合人工验证进行桌面视频修复;汇总了 FM 与训练模型的 ARI 指标;在仅支持计算功能的 HPC 容器中部署 NVIDIA GL 库以实现 GPU 渲染。
  • 影响: 使 AI Dev Companion能够在不同智能体间无缝使用,稳定了桌面视频候选版本,明确了转录组数据中的“FM悖论”,并解除了等待模型权重获取的 Cosmos3-Nano 推理部署障碍。

DCC

  • 已完成工作: 未记录重要的交互会话。
  • 实施方式:
  • 影响:

MacBook

  • 已完成工作: 恢复中断的桌面视频对抗性审查;执行了远程基础设施设置的本地代理和网络诊断;建立了 Claude Code 技能符号链接。
  • 实施方式: 手动修复了 SlideshowController 中的观察者泄漏和安全范围错误;使用 SSH 隧道监控 Tianhe-2 部署;修正了符号链接路径生成脚本。
  • 影响: 解决了 10 个严重的桌面视频错误;尽管存在初始配置错误,仍实现了全局 Claude Code 技能安装;保持了远程访问的连续性。

TzJsDesktop

  • 已完成工作: 将 wm_detect 代码库部署到 Tianhe-2;诊断并修复了 Codex 上 AI Companion钩子故障;为新项目提供了初始化指导。
  • 实施方式: 使用 bash/SSH 进行文件完整性验证和环境修复;实现了 Claude/Codex 负载归一化的 TypeScript 适配器;调试了 stdin/BOM 处理问题。
  • 影响: 通过 GPU 渲染支持保障了 Tianhe-2 执行环境;恢复了 Codex 上 AI Companion功能;明确了项目启动流程。

athena.egr.duke.edu

  • 已完成工作: 建立了全局 Claude Code 技能;在 MIHD 分析中用于基准指标比较。
  • 实施方式: 通过修正的符号链接安装了“ponytail”插件和 6 个全局技能;访问了基线日志以实现可重复性目标。
  • 影响: 明确了 MIHD 研究的核心贡献(FM 检索与聚类),并实现了跨主机统一技能使用。

此阶段重点解决了 AI Companion框架的跨平台钩子兼容性问题,完成了桌面视频对抗性安全审查,建立了全局 Claude Code 技能,并推进了空间转录组(MIHD)分析和机器人环境设置(Tianhe-2/Cosmos3-Nano)工作。

任务

架构与策略

  • 完成桌面视频对抗性审查与修复 — 在对抗性验证7项新功能后,修复了 SlideshowController 中的观察者泄漏、安全范围错误和播放控制器问题。
  • 解决 AI Companion双智能体钩子兼容性问题 — 实现了 Claude/Codex 钩子模式的 TypeScript 适配器,修复了 Windows stdin/BOM 问题,并更新了安装脚本以支持两种智能体。
  • 将 RoboCasa/wm_detect 部署到 Tianhe-2 A800 Cluster — 打包仓库,在远程服务器上验证完整性,安装 vllm==0.19.1 并启用 Cosmos3 插件,通过分阶段 NVIDIA libs 实现 GPU OpenGL 渲染。
  • MIHD 空间转录组 FM 与训练模型分析 — 汇总了 ARI 指标,生成了比较图表,显示 scGPT/TEDDY 在聚类方面与 PCA 表现相似,但在检索方面表现更好,而原始 HVG 在聚类中占主导地位。
  • FM 与训练模型分析 — 使用 MIHD 指标将基础模型(scGPT/TEDDY)与 PCA 和 HVG 基线进行对比,生成了比较柱状图和表格。
  • 解决 Codex PostToolUse 钩子故障 — 诊断并修复了由于工具名称不匹配(apply_patch vs Edit/Write)和路径损坏导致 Codex 无法执行 PostToolUse 钩子的严重错误。
  • 在 Tianhe-2 上发现 labeled pi0.5 数据集 — 在 shared_deps/openpi/eval_results 中找到了 33,419 个 labeled pi0.5 播放视频,根据摘要 JSON 验证标签,并生成了包含 80 集的均衡清单。
  • 在 Tianhe-2 上启用 GPU OpenGL/EGL 渲染 — 下载 NVIDIA 驱动程序 535.104.12,提取 GL libs,并通过 glvnd 供应商配置分阶段部署,以绕过 MuJoCo 中的 llvmpipe 软件渲染。
  • 🔄 QueST 模型复现计划 — 修复了双幻灯片运行的脚本,并在 DLPFC 幻灯片上提交 SLURM 作业;修复了小数据集的硬编码批量大小假设问题。
  • 🔄 QueST 模型复现计划 — 计划并启动了 QueST 模型在 DLPFC 幻灯片 151673/151675 上的复现工作,包括环境设置和脚本编写。
  • 实现双智能体钩子兼容性层 — 创建了统一的 TypeScript 适配器以处理 Claude Code 和 Codex 事件负载,包括 Windows 特定的 stdin 问题(BOM、TTY 状态)。
  • 🔄 安装 Cosmos3-Nano 服务环境 — 在 Tianhe-2 上安装 vllm==0.19.1 并构建 vllm-cosmos3 git 插件。导入验证成功。

实施与修复- ✅ 将 robocasa-test 部署到 Tianhe-2 — 打包本地 git 仓库,通过 SCP 传输至 Tianhe-2 上的 HDD_POOL/tangzijia/robocasa-test,并验证文件完整性。

  • 下载 Cosmos3-Nano 模型权重 — 开始下载 35GB 的 nvidia/Cosmos3-Nano 权重,但因本地代理(Clash)上游故障而停滞。
  • 验证 A800 上 CUDA 12.8 的兼容性 — 运行 Torch CUDA 12.8 matmul 测试,确认 535 个驱动程序支持 cu128 框架,尽管主机为 12.2 驱动程序。
  • 更新 wm_detect 包的 CLAUDE.md — 分析新的 wm_detect/cosmos_eval_scaffold/ 目录,并更新 CLAUDE.md 以反映“World-Model Error Detection MVP”架构。
  • 安装全局 Claude 技能 — 修复符号链接路径错误,成功将 6 项 AI 辅助技能(ccdebug、ccdiscuss 等)作为全局链接安装到 ~/.claude/skills/。
  • 重新生成消融图 — 重新生成 11 个幻灯片的消融图,修正面板标签为 (STAIG_posted/Original),并删除 ‘(none-enc)’ 后缀。
  • 安装全局技能 — 修复符号链接路径错误,成功将 6 项 AI 辅助技能(ccdebug、ccdiscuss 等)作为全局链接安装到 ~/.claude/skills/。
  • 验证 Gadget 仓库中 AGENTS.md 状态 — 检查 gadget 仓库中是否存在贡献者指南,避免覆盖关键文档。
  • 更新安装和注册脚本 — 修改 CLI 和脚本安装器,配置 Claude 和 Codex 的技能/命令,允许用户针对特定代理。
  • 🔄 解决 CI/CD 测试超时问题 — 发现 npm run test 因 vitest watch 模式导致卡顿;切换至 npx vitest run 以通过所有 1687 项测试。

问题与解决方案

关键问题

1. Codex PostToolUse 钩子因与 Claude 钩子的架构不匹配而失败,特别是工具名称(apply_patch vs Edit/Write)和文件路径处理方面。

解决方案: 实现 TypeScript 适配器层以标准化负载;更新钩子匹配器;修复 Windows stdin BOM/TTY 问题并删除过期的配置项。

关键洞察: 不同的 LLM 客户端使用不同的内部架构来处理工具执行钩子;需要统一的适配器层来支持多代理,并特别注意操作系统级别的输入流差异。

2. Desktop Video 中的 SlideshowController 在快速切换视频时存在观察者泄漏和安全范围错误。

解决方案: 添加明确的观察者移除逻辑,修复安全范围书签释放时机,并修补并行审查脚本执行方式,使用 thunk 而非 promises。

关键洞察: 事件驱动的 UI 需要严格的观察者生命周期管理;如果直接将 promise 对象传递给期望延迟调用的函数,异步工作流脚本往往会静默失败。

3. 空间转录组结果中的模糊性在于基础模型(scGPT/TEDDY)是否优于传统基线。

解决方案: 按章节汇总 ARI 指标,使用统一编码器生成公平比较;确认“FM 悖论”:基础模型在跨样本检索方面表现优异,但在单切片聚类方面不如原始 HVG。

关键洞察: 基础模型嵌入具有独特的优势:在广泛数据理解(检索)方面表现优越,但在局部结构精度(聚类)方面不如 engineered 基线如 HVG。

4. MuJoCo 渲染在 Tianhe-2 仅计算节点上退化为 CPU (llvmpipe),导致评估受阻。

解决方案: 分阶段安装 NVIDIA GL/EGL 用户空间库,配置 glvnd 供应商路径以在缺乏完整驱动程序的容器中启用 GPU 渲染。

关键洞察: 计算容器通常将 CUDA 计算与 OpenGL 图形分离;如果主机驱动程序版本支持,需手动安装用户空间图形库以实现 GPU 渲染。

5. QueST 训练脚本在小型数据集上因硬编码的批量大小假设而崩溃。

解决方案: 检查源代码,识别硬编码逻辑,并修补导出脚本以明确设置 batch_num 用于两幻灯片运行。

关键洞察: 公共科学模型通常包含隐含的数据集规模假设;在集成前进行源代码检查至关重要,以避免小子集运行时崩溃。

一般问题

6. Claude Code 自动技能安装因包含无效符号链接路径的占位符而失败。

解决方案: 修正符号链接生成脚本中的 bash 循环,删除无效后缀,确保有效的文件链接。

关键洞察: 自动化脚本生成可能引入细微的字符串格式错误;实例化后手动验证文件完整性至关重要。

7. Hugging Face 模型下载在进度指示器显示活跃时仍停留在 0 KB/s。

解决方案: 发现 HF_HOME 目录配置错误导致令牌认证绕过;通过导出 HF_TOKEN 并验证登录状态来修复。

关键洞察: 自定义主目录通常改变凭证查找路径;在非标准环境中进行认证下载时,需要显式注入环境变量。

人类与 AI 方法

AI 辅助钩子架构与执行环境

角色 方法
人类 用户明确认识到双代理支持(Claude/Codex)的战略需求,提供调试约束;手动重构 Desktop Video 的 UI,以用户体验清洁度优先于传统契约遵守。
AI AI 设计技术解决方案:实现 TypeScript 适配器,标准化跨平台架构,诊断 Python/Node 执行环境,并在 UI 变更后保持 Desktop Video 后端的架构一致性。

差异分析: 人类定义高层需求并优先考虑用户体验/结果;AI 通过处理低级协议差异、跨平台边缘情况(Windows BOM)并保持后端稳定性来弥补差距。

空间转录组模型评估策略

角色 方法
人类 用户主导比较分析策略,质疑模型之间的等价性;修正“Original”与“Posted” STAIG 结果的语义定义以确保数据完整性。
AI AI 执行指标聚合、可视化生成和源代码检查。AI 正确指出了在聚类中 FM ≈ 训练模型,但在检索场景中则不同。

差异分析: 人类提供实验设计与语义基础;AI 提供统计验证和代码级集成支持,包括修正初始标签混淆问题。

Tianhe-2 部署与资源优化| 角色 | 方法 |

|——|——| | 人类 | 尽管存在版本风险,用户仍坚持使用 Cosmos3-Nano;最初认为需要复现 RoboCasa 环境。 | | AI | AI 验证了驱动器的兼容性,发现了现有的 labeled pi0.5 数据(节省了大量计算时间),并通过 lib staging 解决了 GPU 渲染硬件限制问题。 |

**差异分析:**人类接受架构风险以追求新模型;AI 通过寻找现有数据和解决基础设施障碍优化了资源使用,但用户确保了严格的基准匹配要求得到满足。

AI 局限性

关键局限性

  • 对抗性审查脚本的首次运行失败,因为 AI 错误地将 Promise 对象传递给并行执行助手,而非 Thunk 函数,导致验证阶段出现静默失败。
  • 在 PyPI 探索过程中对版本号的字符串排序过于简单,导致无法检测到 vllm 0.19.1 版本。

一般局限性

  • 通过 scp 修补的脚本偶尔因 SSH 隧道间歇性中断而无法落地或执行,导致“无输出”状态,难以通过直接状态检查进行调试。
  • 无法独立解决网络瓶颈(本地 Clash 代理);需要用户在家中干预以恢复下载大模型权重的上传速度。
  • Claude Code 自动生成符号链接存在字符串格式错误(%/),需要手动调查并修正 bash 逻辑。
  • 初始 PDF 解析无法提取 QueST 的特定实验设置;AI 必须手动检查文本流和元数据,而非依赖直接 PDF 渲染。

经验教训

关键经验

  • 基础模型(scGPT/TEDDY)在跨样本小众检索方面表现优异,但在单切片聚类方面不如原始 HVG 优秀,这是空间转录组分析的关键发现。
  • 当使用钩子系统支持多个 LLM 客户端时,应依赖官方 SDK 文档来验证 tool_input 结构,因为它们的命名约定和数据格式往往存在显著差异。
  • Tianhe-2 A800 节点可以通过 minor-version 兼容性在 535 驱动程序(CUDA 12.2)上运行 CUDA 12.8 版本,这一点通过成功的 Torch matmul 测试得到确认。
  • 容器化 HPC 环境通常分离 computegraphics 驱动程序;可以在无需 root 权限的情况下通过本地安装 NVIDIA GL 用户空间库,在仅计算型的节点中启用 GPU 渲染。
  • 对抗性审查脚本在其编排逻辑中的 async/await 模式需要强大的错误处理;未能将异步调用封装为 thunk 可能导致看似“成功”或静默失败的报告。
  • QueST 的对抗性批量移除需要一定数量的批次/捐赠者才能正确运行;仅使用来自同一捐赠者的 2 张切片会导致因硬编码形状导致代码崩溃。
  • 语义版本字符串在处理主要版本变更时需要数值比较逻辑而非字典序(例如,0.9 与 0.19)。

实际经验

  • 始终使用非交互式标志(例如 vitest run)用于自动化测试脚本,以防止 CI/AI 环境中的进程挂起。
  • ARI 指标聚类对随机种子非常敏感(mclust EM);结果必须作为多个种子的分布进行评估,而非单个点。

对话总结

AI 开发辅助工具 / 小工具

✅ 双代理钩子兼容性和初始化指南 02:26:31 | claude_code/codex 通过实现 TypeScript 适配器层来统一 Hook 负载与 Claude Code 标准,解决了 Codex 上的关键 PostToolUse 故障。修复了 Windows 特定的 stdin 处理(BOM/TTY)并更新了跨代理支持的安装脚本。还提供了使用框架的 slash 命令工作流初始化新项目的指导。

桌面视频

✅ 七项新功能的对抗性审查与bug修复 20:43:55 | claude_code 完成了七项新功能的对抗性安全和稳定性审查。修复了 10 个关键错误,包括 SlideshowController 中的观察器泄漏、安全范围处理不当以及播放控制器问题。所有修复均经过 xcodebuild 测试并记录文档。

MIHD - QueST 查询结果与复现

• 基础模型分析与 QueST 设置 00:18:31 | claude_code 分析了 MIHD 的 QueST 风格检索结果,确认了“FM Paradox”现象:FMs 在检索方面优于基线,但在聚类方面并非如此。使用修正后的种子/标签绘制了 ARI 指标。还通过修补小数据集的批量大小限制,开始在 DLPFC 切片上复现 QueST 模型。

RoboCasa Min 基准测试 / wm_detect

🔄 Tianhe-2 部署与 Cosmos3-Nano 环境设置 00:41:00 | claude_code 将 wm_detect 代码库部署到 Tianhe-2 A800 集群。通过分阶段安装 NVIDIA GL 库在仅计算型的节点上启用 GPU 渲染,并验证了 CUDA 12.8 的兼容性。安装了 vllm==0.19.1 配合 Cosmos 插件。发现了现有的 pi0.5 评估数据,无需重新生成。模型权重的下载目前因代理问题被阻止。

Token 使用

AI Usage · 2026-06-22 Claude Code + Codex
Total cost
$141.31
Total tokens
156M
Output tokens
1M
Cache read
91.9%
Cost split Claude Code $128 · Codex $13
Token character Cache reads 91.9% · Active 8.1%

Most token volume came from cache reads; Claude Code drove nearly all cost.