每日报告 — 2026-07-18
日常概述
- 已完成工作: 执行了全面的量化实验(SeqMSE、SpinQuant),证明 W8A8 是 GR00T 部署的最佳方案;将 LiveCaption 移植到 Windows 平台,支持原生音频捕获与流式 ASR;为 RoboTwin 2.0 定义了新的基于 3D 世界模型引导的 VLA 架构;解决了 Gadget 自动化报告流程中的依赖冲突问题。
- 实现方式: 使用 SLURM 在多节点 GPU 集群上安排作业进行并行推理与评估;实现了 WASAPI 回环及 WSL 桥接功能以处理跨平台音频;通过文献分析识别研究空白;重构了 Python CLI 脚本,采用延迟构建机制并增强日志功能。
- 影响: 在保持 98.5% 准确度的同时,将 GR00T 部署的延迟目标降低至 410ms;实现了具有真实流式功能的 Windows LiveCaption;明确了所提出的 VLA 方法(反事实路径评估)相对于现有方法的创新点;确保了 Gadget 项目每日构建流程的稳健性与可审计性。
在 Qualcomm 硬件上完成了 GR00T 的关键量化基准测试,将 LiveCaption 移植到 Windows 平台并通过 vLLM 流式传输,定义了基于 3D 世界模型引导的 VLA 系统研究架构,并改进了 Gadget 项目的内部自动化流程。
任务
架构与策略
- ✅ 定义基于 3D 世界模型引导的 VLA 架构 — 通过文献分析设计了一种 VLA 系统,该系统中世界模型在执行前反事实地评估候选 3D 路径,从而区别于 Action-Sketcher 及其他竞争对手。
- ✅ GR00T-N1.7-3B 量化与延迟基准测试 — 在 GR00T-N1.7-3B 上使用 LIBERO 评估了 SeqMSE 和 SpinQuant 量化方法(W8A16/W8A8/W4A16/W4A4);通过 AI Hub 将模型导出到 Qualcomm IQ-9075 EVK 进行延迟分析。
- ✅ LiveCaption Windows 平台移植 — 使用 Python、WASAPI 回环实现音频捕获以及 Tkinter 覆盖层将 LiveCaption 移植到 Windows 平台;整合了 Qwen3 ASR 和 ForcedAligner 模型。
- ✅ WSL+vLLM 流式集成用于 LiveCaption — 通过 NDJSON 管道将 Windows 音频捕获与基于 WSL 的 vLLM 推理结合,实现真正的逐词流式字幕生成。
实施与修复
- ✅ Action-Sketcher 在 Tianhe3 上的部署与分析 — 在 Tianhe3 集群上部署 Action-Sketcher,在 8 台 GPU 上运行 100 条轨迹;分析日志以确认开环行为并识别故障情况。
- ✅ LiveCaption 配置系统实现 — 用
config.json文件替代命令行默认设置,包含本地机密示例和 gitignore 规则。 - ✅ DeepWiki 本地部署与批量自动化 — 使用 Ollama 在 Windows 上部署 DeepWiki;创建
batch_wiki.py用于自动仓库索引;解决了 SSL 和 WebSocket 超时问题。 - ✅ Gadget 管道修复:双重部署与日志 — 修复
summarize auto管道以避免重复 Hugo 构建;改进每周/每月目标的日志格式以匹配每日日志格式。 - ✅ Gadget 项目 PR 与分支审核 — 审查
fix/audit-consolidated-bugs分支,合并审计修复,添加 Cursor 转录解析功能,并创建 Pull Request #1。
问题与解决方案
关键问题
1. SpinQuant W4A16 因反旋转实现错误导致成功率为 0%;DeepWiki 后端在 Windows 上因 SSL 路径错误和 WebSocket 超时崩溃。
解决方案: 修复代码以验证真实指标;手动配置SSL_CERT_FILE适用于 Miniconda/Windows,并禁用长 LLM 生成过程中的客户端 ping 间隔。
关键洞察: 量化原语需要严格的锚点测试来检测整体故障;本地 LLM 管道需调整心跳/ping 间隔以适应生成延迟。
2. SLURM 作业因 GPU/CPU 资源竞争停滞;尽管拥有 CUDA 支持,Qwen3-ASR 模型仍默认使用 CPU 推理。
解决方案: 更新sbatch脚本以请求灵活分区并降低 CPU 需求;在 HF 管道中明确设置device_map='cuda:0'。
关键洞察: 集群调度需要多维资源检查(CPU+GPU);支持 GPU 的 PyTorch 不会自动将模型加载路由到 GPU。
3. WSL 无法通过 WASAPI 回环捕获 Windows 扬声器音频;LiveCaption 在 Python 3.12 上存在依赖冲突。
解决方案: 设计分拆部署(Windows 主机用于捕获,WSL 用于推理);在要求中固定numba和llvmlite的版本上限。
关键洞察: 跨操作系统虚拟化通常限制硬件访问;现代依赖解析器需要明确的版本上限以避免不兼容的传递依赖。
一般问题
4. Gadget summarize auto因代码路径重叠导致重复 Hugo 构建。
解决方案: 通过中间步骤传递单构建标志以确保最终只进行一次 Hugo 更新。
关键洞察: 具有多个入口点的自动化脚本需要明确的范围限制以避免重复操作。
5. 尽管已安装,vllm 模块在 WSL 中无法找到;Shell 脚本在不同平台上的行尾格式错误。
解决方案: 修正 Conda 环境路径解析以使用 vLLM;将脚本转换为 LF 格式并添加.gitattributes以强制一致的行尾格式。
关键洞察: 从不同上下文执行时 Conda 环境一致性至关重要;跨平台开发需要严格的文件格式政策。
人类与人工智能方法
战略层面
基于 3D 世界模型引导的 VLA 研究方向
| 角色 | 方法 |
|---|---|
| 人类 | 用户强调区分“3D 表示”和“3D 引导/控制”,识别 Any3D-VLA 等现有工作中的空白,提出新的贡献(反事实路径评估)。 |
| 人工智能 | 人工智能通过文献分析识别竞争对手,帮助构建技术提案,重点在于规划与评估而非仅输入模态形式。 |
差异分析: 人类提供战略约束和创新要求;人工智能执行技术架构构建和差距分析。
量化策略选择
| 角色 | 方法 |
|---|---|
| 人类 | 用户对特定位宽进行对比测试,明确要求基于硬件延迟的测试而非纯准确性指标。 |
| 人工智能 | 人工智能设计实验矩阵,管理 SLURM 提交,并编制准确性与延迟权衡表。 |
差异分析: 人类定义战略部署约束;人工智能执行复杂的编排和数据合成。
跨平台音频捕获策略
| 角色 | 方法 |
|---|---|
| 人类 | 用户要求区分“3D 表示”和“3D 引导/控制”,识别现有工作中的空白以提出新贡献(反事实路径评估)。 |
| 人工智能 | 人工智能通过文献分析识别竞争对手,帮助构建技术提案,重点在于规划与评估而非仅输入模态形式。 |
差异分析: 人类提供战略约束和创新要求;人工智能通过文献分析识别竞争对手,帮助构建技术提案,重点在于规划与评估而非仅输入模态形式。| 角色 | 方法 |
|——|——|
| 人类 | 认识到 Swift 在 Windows 上的限制;要求利用原生硬件(WASAPI)而非虚拟驱动。 |
| AI | 使用 pyaudiowpatch 生成 win_host.py,并提出使用 Tkinter,同时遵守最小的依赖约束。 |
差异分析: 用户提供了架构约束;AI 选择了合适的库来满足这些约束。
AI 限制
一般限制
- 尝试使用被阻止的外部二进制源来编译 ffmpeg;在 Windows 进程管理调试方面存在困难。
- 未能在 SLURM 调度中检测到被隐藏的 CPU 密集型 GPU 节点,最初也忽略了 HF 管道中明确的
device_map需求。
学习成果
关键收获
- 单通道 W4 量化不足以满足 GR00T 的 LLM 核心架构;W8A8 在速度与准确率(98.5%)之间提供了最佳平衡。
- VLA 研究的创新点在于规划接口和错误处理(闭环修正),而非简单的点云集成。
- WSLg 音频桥接支持麦克风输入,但不支持扬声器输出,需要混合架构来实现跨平台音频应用。
实际收获
- 本地 LLM 管道和自动化工具需要调整心跳间隔和明确的“无操作”日志功能,以确保稳定运行并提升操作员信心。
对话总结
GR00T 量化
✅ 在 Qualcomm 硬件上的量化基准测试与延迟分析 15:39:57.484 | claude_code 在 GR00T-N1.7-3B 上评估了多种位宽下的 SeqMSE 和 SpinQuant 方法。管理 SLURM 任务,解决 ffmpeg 依赖问题以进行评估,并导出到 Qualcomm IQ-9075 EVK。确定 W8A8 为最佳方案,准确率为 98.5%,且延迟显著降低。
LiveCaption
✅ Windows 端口、Qwen3 ASR 集成以及 WSL+vLLM 流传输
18:15:14.636 | claude_code
使用 Python/WASAPI 将 LiveCaption 移植到 Windows,用于音频捕获。集成 Qwen3-ASR/ForcedAligner 模型,通过 WSL+vLLM 桥接实现真正的流传输。解决了环境依赖冲突,并实现了集中的 config.json 系统。
WorldModel3DVisualPrompt
✅ 定义以世界模型为引导的 VLA 研究方向 00:38:40.394 | codex 为 RoboTwin 2.0 制定了宏观计划,使用 3D 世界模型进行反事实路径评估,优于 Action-Sketcher。识别了 Any3D-VLA 和 SERF 中的空白点,明确了以规划与闭环修正为核心的研究贡献。
gadget
✅ 管道修复、日志增强及审计整合
20:25:00-04:00 | codex/cursor
诊断并修复了 summarize auto 管道中的双重部署问题,通过推迟 Hugo 构建实现。增强了每周/每月目标的日志功能。审查了 fix/audit-consolidated-bugs 分支,合并修复项,并在每日总结器中添加了 Cursor 文本解析功能。
DeepWiki
✅ 本地部署及 Windows 上的批处理自动化 04:10:25.248 | claude_code 使用 Ollama 在本地部署 DeepWiki。解决了 Miniconda 中的 SSL_CERT_FILE 路径不匹配问题。编写了 Python 批处理脚本,用于自动生成多个仓库的 wiki,解决了 WebSocket 保持活动超时问题。
Action-Sketcher
✅ 在 Tianhe3 集群上的部署与分析 01:25:48.479 | codex 在 Tianhe3 上使用 8 台 GPU 部署了 100 条轨迹。分析日志以确认开环行为,并识别出特定的成功/失败案例以供进一步研究。