每周报告 — 2026-W35(2026-08-24 ~ 2026-08-30)

本周致力于确定VLA模型在Qualcomm NPU上的部署策略,明确将W4A8定为最佳配置,并证明由于硬件和编译器限制,W4A4不可行。同时,通过实施硬门约束和共享的“真相来源”机制来稳定AI Companion多智能体工作流方面取得了显著架构进展。在RoboMemory领域,‘segsum’ VLM编写器已实现并验证,发现感知是成功率的主要瓶颈。此外,博士申请策略和关键基础设施修复的基础工作也已完成,包括磁盘取证和驱动程序更新,为持续研究提供了稳定环境。

每周概述

指标 数值
日期范围 2026-08-24 ~ 2026-08-30
活跃天数 7 / 7
总对话数 38
项目数 33
已完成任务数 37
进行中任务数 8
总token数 1,520,174,554
总成本 $1,790.15
Claude代码token数 1,484,541,967
Claude代码成本 $1,764.29
Codex token数 35,632,587
Codex成本 $25.86
每日平均成本 $255.74

项目进展

Qualcomm VLA/PI0.5量化(6天活跃) — ✅ 完成

成果:

  • 确定W4A8为最佳“无损”部署点(成功率为100%,比基线快41%)。
  • 通过GeGLU/残差流和QAIRT编译器约束的消融研究证明W4A4不可行。
  • 生成了包含代码级根本原因分析的全面技术报告(QUANT_SURFACE_GRID.md)。

阻碍因素:

  • ⚠️ 硬件限制:缺乏用于非矩阵运算的原生int4激活核,导致速度降低2.9倍。

AI Companion与多智能体基础设施(6天活跃) — 🔄 活跃

成果:

  • 使用CLI状态机和预工具钩子实现硬门约束,防止幻觉发生。
  • 为idea图实施“共享真相来源”机制,统一Claude、Codex和Cursor工作流。
  • 通过原子追加日志和有效的字段投影哈希解决并发问题以完成审批。

阻碍因素:

  • ⚠️ 文档更新需要人工重新批准,导致临时工作流程暂停。

RoboMemory与VLM流程(5天活跃) — 🔄 活跃

成果:

  • 实现并验证了‘segsum’基于片段的编写器,推理token数减少一个数量级。
  • 设计E-MemER通道交换实验以分离视觉与文本记忆效应。
  • 发现VLM“方向运动盲视”问题,提出几何跟踪(TAPIR)作为可靠替代方案。

阻碍因素:

  • ⚠️ 感知层面错误(缠绕/方向)仍是任务成功率的瓶颈。

PhD/MS申请策略(2天活跃) — 🔄 活跃

成果:

  • 验证了76个官方项目链接,使用并行代理提取关键截止日期(如杜克大学、斯坦福大学)。
  • 生成了包含具体任务和目标推荐信策略的主计划表。

阻碍因素:

  • ⚠️ 无报告;等待用户选择最终项目列表。

Amber macOS应用(3天活跃) — 🔄 活跃

成果:

  • 使用IORegistry工厂校准数据(600尼特)修正亮度模型。
  • 实现基于向量的清晰SVG缩放功能以可视化idea图。
  • 修复构建流程退出码掩码并启动环境光记录。

阻碍因素:

  • ⚠️ 初始校准数据因macOS待机减光而失效。需要严格使用 caffeinate

TokenMonitor & Gadget(活跃3天) — 🔄 活跃

成就:

  • 实现了统一的货币格式化模块(money.rs)并审计了依赖项。
  • 运用“自夸文档”和“密度链”原则优化了总结工具提示。
  • 对15多种LLM进行了创意写作和文档准确性测试。

阻碍:

  • ⚠️ 状态栏中的货币显示错误需要进一步调试。

MIHD与生物信息学(活跃1天) — ✅ 完成

成就:

  • 修复了scGPT评估流程并恢复了缺失模块。
  • 通过严格的协议(均值+标准差)验证了统计显著性,并发现了方法排名中的临时反转情况。

阻碍:

  • ⚠️ 无报告。

关键任务

  • Qualcomm VLA与π0.5量化验证(2026-08-24)— 执行了严格的W4A8与W4A4基准测试。确认W4A8为最优方案,而W4A4因QAIRT 8/16位激活约束和精度下降而不适用。
  • AI伴侣与多智能体管理基础设施(2026-08-24)— 设计了具有CLI状态机和预工具钩子的硬门控执行系统。实现了防冲突的文件后缀机制以防止状态损坏。
  • PI0.5量化网格完成与报告最终定稿(2026-08-28)— 对‘projin’和‘sqvla’单元进行了基准测试。更新了文档,包含5行网格表格和技术附录关于4位编译器限制的内容。
  • AI伴侣统一规范与安全审计(2026-08-29)— 将智能体工作流整合为共享基础框架。解决了34个设计冲突,优先选择“最强保障”,并进行了P0安全风险审计。
  • 博士/硕士项目研究与行动计划(2026-08-29)— 搜索机器人学习项目,验证了76个链接,确定了关键截止日期,并制定了总体行动计划。
  • 🔄 W4A4与W4A8性能下降研究(2026-08-26)— 执行了激活位宽降低的消融研究。发现GeGLU和残差层对W4A4精度有单独致命影响。
  • RoboMemory ‘Segsum’写入器实现与评估(2026-08-29)— 实现了LoVi风格的分段总结写入器。在GPU集群上进行了测试,确认可解决结构截断错误。
  • 🔄 安全网络编辑与审批逻辑设计(2026-08-29)— 设计了“提交->审核->批准”的工作流,通过实质性字段投影哈希功能通过浏览器编辑概念图。
  • 🔄 总结工具提示优化与模型基准测试(2026-08-26)— 运用“自夸文档”原则重新设计提示结构。对15多种模型进行了创意写作和README理解能力的基准测试。

问题与解决方案

1. W4A4量化导致0/50成功率,与文献矛盾。[Qualcomm VLA/PI0.5](2026-08-27)

解决方案: 进行了控制性损伤研究,表明全图量化会触及QAIRT禁止与高位层混合的敏感张量,因此量化范围是主要瓶颈。

2. AI智能体绕过了软约束(提示/技能),导致幻觉。[AI Companion](2026-08-24)

解决方案: 转向使用CLI状态机和预工具钩子的“硬管理”架构,物理上阻止无效转换。

3. 同时运行AI会话导致共享YAML图文件中的ID冲突和竞态条件。[AI Companion](2026-08-25)解决方案: 实现了文件锁定和任务列表原子重命名功能,并使用基于哈希的审批机制处理概念图,以确保状态变化具有线性性。

4. FP16 Pi0.5 主干模型因内存分配错误无法在设备上进行性能分析。[Qualcomm VLA/PI0.5] (2026-08-29)

解决方案: 采用 fp_chunked 方法将主干模型分割为块,分别进行性能分析后汇总延迟以评估性能。

5. AI伴侣保护钩子存在安全漏洞:AI可通过Bash绕过保护机制。[AI Companion] (2026-08-29)

解决方案: 提出一种设计方案,使保护钩子拦截所有敏感文件操作。实现“实质性字段投影哈希”机制,防止因简单修改导致审批失效。

6. VLM在RoboMemory任务中表现出“方向运动盲视”问题。[RoboMemory] (2026-08-30)

解决方案: 提出混合方案,使用VLM进行定位,使用TAPIR进行方向计算。

7. Amber亮度模型使用了错误的586 nit 度量标准。[Amber] (2026-08-24)

解决方案: 从IORegistry中解码backlight-marketing-table,发现实际最大亮度为600 nit,并与线性亮度API进行交叉验证。

8. DCC集群任务处于PENDING状态。[Infrastructure] (2026-08-27)

解决方案: 发现用户MaxJobs限制被设置为0,原因是违反政策。起草了恢复邮件。

经验教训

架构方面

  • 硬门控执行(钩子/状态机)优于软提示,有助于确保AI代理可靠性并防止工作流绕过。
  • 在多智能体系统中,共享状态应被视为分布式系统,需要锁定、原子CAS操作或基于哈希的审批来防止损坏。
  • 原子仅追加操作比读-修改-写循环更安全且性能更好,尤其是在多进程钩子环境中。

领域知识方面

  • 对于Qualcomm NPU,W4A8是最佳部署点;W4A4不可行,因为QAIRT有方向性“岛屿”规则(8<->16支持,4->16不支持)且缺乏原生int4内核。
  • VLM存在“方向运动盲视”问题;混合方案使用几何跟踪计算方向,使用VLM进行定位,更适合VLA控制。
  • 对大型模型主干进行评估时,分块性能分析是克服设备内存限制的有效方法,可提供具体的延迟数据。

调试方面

  • 嵌入式设备的延迟分布通常呈双峰态;始终报告均值±标准差+下限,以准确捕捉变异性。

工具方面

  • .companion目录中的文档模板和少量示例对AI行为具有强约束作用;更新这些模板对提升输出质量至关重要。

AI使用注意事项

有效模式:

  • ✓ 使用“硬框架”(状态机/钩子)来确保工作流完整性,而非依赖提示工程。
  • ✓ 实施“实质性字段投影哈希”以保持审批状态稳定,同时允许运行时更新。
  • ✓ 使用多智能体验证流程对外部数据进行验证(如博士项目链接),以确保准确性。
  • ✓ 使用“分块性能分析”来突破硬件内存限制,获得实证性能数据。

限制:

  • ✗ AI在共享状态文件中处理复杂并发问题时初期表现不佳,需要特定的架构模式(锁定/原子性)来解决。
  • ✗ 在没有明确人类提示的情况下,难以区分VLM评估中的“结构稳定性”和“任务成功”。
  • ✗ 无法自行纠正写作风格(术语与普通语言混合),除非明确指示更新文档模板。

下周计划

下周将重点完成在远程GPU集群上RoboMemory E-MemER实验的执行,并分析结果以验证“几何跟踪”假设。对于AI伴侣,优先任务是实现“基于Web的概念图编辑”功能,并将安全审批流程集成到主应用中。此外,博士申请流程将进入起草阶段,从推荐信和个人陈述开始,针对顶级项目进行申请。Qualcomm部署管道的持续维护将涉及将W4A8模型打包到目标硬件上进行生产测试。

令牌使用统计

AI Usage · 2026-W35 Claude Code + Codex
Total cost
$1,790.15
Total tokens
1.52B
Output tokens
8M
Cache read
95.1%
Cost split Claude Code $1,764 · Codex $26
Token character Cache reads 95.1% · Active 4.9%

Most token volume came from cache reads; Claude Code drove nearly all cost.

高峰日: 2026-08-24 — $732.37 / 757.5M 令牌

每日平均: $255.74