每日报告 — 2026-08-26
日常概述
- 已完成工作: 当日主要聚焦于两个核心方面:验证 π0.5 在 Qualcomm NPU 上的推理性能正确性(纠正延迟错误并隔离 W4A4 精度问题),以及提升 Gadget 项目的 AI 报告能力(优化提示工程、对创意/技术任务进行模型基准测试,并规划统一模型配置系统)。
- 实施方法: 对 NPU 流水线采用精细的位宽降低实验和源代码审计;对于 Gadget 项目则利用多智能体研究工作流(Explore + WebSearch)、自定义 Python 基准测试框架以及架构思想图工具。
- 影响: 为 π0.5 建立了准确的性能基准(纠正了 1.85 倍的误差),并明确识别出 GeGLU/残差层是 W4A4 部署的瓶颈。对于 Gadget,通过整合“自夸文档”和“密度链”原则,制定了高质量报告的实施路线图,对 15 多种 LLM 的模型能力进行了验证,并设计了统一的配置解决策略以消除无声故障。
MacOS
- 已完成工作: 进行常规监控和少量账户使用检查;该设备没有重大开发工作。
- 实施方法: 互动极少,仅通过本地命令调用获取使用指标。
- 影响: 无显著影响。
TzJsDesktop
- 已完成工作: 对 Gadget 总结工具进行了深入架构分析,对本地和云端模型进行了全面的 LLM 基准测试(创意写作和文档处理),并管理项目思想图以规划统一模型切换功能。
- 实施方法: 使用
claude_code进行研究,使用 Python 进行基准测试(zhbench.py、docbench.py),使用 Bash 进行环境检查,通过多智能体工作流综合最佳实践并解决共享状态文件中同时出现的 ID 冲突问题。 - 影响: 揭示了破坏性能的默认设置(
reasoning_effort: none),生成了可发布的双语基准报告,并提供了清晰无冲突的实施计划(I-051 至 I-053)以提升报告质量和模型稳定性。
lighthouse
- 已完成工作: 对 Qualcomm Dragonwing NPU 对 π0.5 的限制进行了深度分析,包括隔离 W4A4 与 W4A8 的故障,计算真正的端到端延迟,同时大幅回收磁盘空间以支持这些实验。
- 实施方法: 使用
tmux进行序列实验评估,手动操作model.encodings以隔离激活家族(GeGLU、残差层),通过归档大型数据集和清理缓存来释放 150GB 以上的空间以管理硬件限制。 - 影响: 证明 GeGLU 和残差流对 W4A4 精度是独立的致命因素(W4A4 成功率为 0/50),而 W4A8 为 50/50;同时建立了正确的端到端延迟基准,将之前的项目估计修正了高达 1.85 倍。
审核并修正了 π0.5 的延迟基准,通过针对 GeGLU/残差流进行消融实验证明了 W4A4 量化问题;同时优化了 Gadget 的总结工具架构,并对中文创意写作和文档处理准确性进行了全面的 LLM 基准测试,过程中解决了硬件和并发冲突问题。
任务
架构与策略
- 🔄 W4A4 与 W4A8 性能退化研究(I-078) — 进行消融实验,将特定家族的激活位宽从 8 位降低至 4 位(GeGLU、残差层、注意力、其他)。发现 GeGLU 和残差层单独对 W4A4 精度造成致命影响,证明其在无重构的情况下与 4 位精度在结构上不兼容。
- ✅ 重新评估 π0.5 端到端延迟 — 修正了
RESULTS.md中的延迟估计,该估计因未考虑action_expert的 10 步欧拉循环而低估了性能。更新计算逻辑为 2xVE + 1xBB + 10xAE,发现 W4A16 的延迟约为 923 毫秒(之前为约 555 毫秒)。 - ✅ 研究 W4A4 的“死锁”问题(精度与可部署性) — 分析为何 W4A4 无法修复:精度要求 16 位“岛屿”(softmax),但 QAIRT 编译器规则禁止从 4 位到 16 位的转换。即使处于最佳精度状态,累积的 4 位损伤也会导致故障。
- 🔄 总结工具提示优化与模型基准测试 — 基于“自夸文档”和“密度链”原则重新设计日常/周报提示架构。对 15 多种模型(Gemma4、Qwen、GPT、Claude)进行中文创意写作和 README 理解能力的基准测试,以选择最佳基准并生成双语报告。
- 🔄 统一模型切换架构规划 — 设计将分散的模型默认设置整合为单一解决功能的方案(I-051-I-053)。识别了因未拉取模型导致的无声故障,并解决了思想图中同时出现的 ID 冲突问题。
实施与修复
- ✅ 磁盘空间管理(lighthouse) — 通过删除 AI Hub 临时文件、uv/pip 缓存以及归档 RoboMemory 数据集,解决了“设备上无空间”错误,从而释放了 150GB 以上的空间以容纳大型
aimet_onnx临时文件。
问题与解决方案
关键问题
1. W4A4 的 성공率为 0/50,而 W4A8 为 50/50,导致关于这是调整问题还是结构不兼容的假设不明确。
解决方案: 通过手动编辑 model.encodings 将特定张量家族的位宽降低至 4 位,进行“降级”实验。发现 GeGLU 和残差层单独与 4 位精度不兼容,确认其在结构上不可行。
2. π0.5 的延迟估计不准确(低估了),原因是 app.py 中的调用循环错误,其中 action_expert 被计为 1 步而非 10 步。
解决方案: 审核源代码以识别 10 步欧拉循环,更新计算逻辑为 2xVE + 1xBB + 10xAE,从而修正了基准性能指标。
3. Gadget 中的每日报告缓存仅按日期键入,导致旧的低质量结果在提示优化后仍然保留。
解决方案: 提出新的缓存机制,在键中包含模式/版本哈希,以确保数据生成的新鲜性并防止输出陈旧。
4. Windows .cmd shims 对 CLI 代理的修改导致包含新行的命令行参数被截断,导致基准测试期间提示被切断。
解决方案: 修改基准测试脚本,通过 stdin 而非 argv 传递长提示给 CLI 代理,确保提示完整且结果准确。
5. 同时运行的 AI 会话编辑共享思想图(ideas/graph.claude.yaml)导致 ID 重复错误(I-046 至 I-050 冲突)。
解决方案: 实施手动重新编号策略,识别冲突 ID 的“所有者”,并将当前会话的新节点移动到更高未使用的 ID 中(I-051+),以保持图结构完整。
一般问题
6. lighthouse 上的磁盘空间不足由于aimet_onnx占用资源较大,导致在模型加载过程中耗尽了π0.5实验的运行次数。解决方案: 积极清理可再生缓存(uv、pip、AI Hub),并将大型静态数据集(RoboMemory)归档至 /archive,为性能分析实验腾出足够空间。
人类与人工智能方法对比
战略层面
技术文档准确性
| 角色 | 方法 |
|---|---|
| 人类 | 明确要求严格遵循提供的README,禁止编造源代码中不存在的命令或参数。 |
| 人工智能 | 通过抑制用通用知识填补空白的倾向来遵守规定,确保教程完全基于验证过的源代码内容,避免幻觉产生。 |
差异分析: 无
W4A4失败的解释
| 角色 | 方法 |
|---|---|
| 人类 | 无 |
| 人工智能 | 最初将W4A4失败视为独立的“精度错误”和“编译限制”。 |
差异分析: 用户将其调整为层次化视角:精度损伤是结构性的(4位精度对于GeGLU/残差层来说太粗糙),而编译器规则(QAIRT 4->16禁止)则作为约束条件阻止了改进。用户将“部署限制与精度限制”视为一个整体比“两个错误”更优。
提示词优化策略与报告质量
| 角色 | 方法 |
|---|---|
| 人类 | 寻求更深入、更有洞察力的总结用于个人回顾,避免“购物清单”式的报告。 |
| 人工智能 | 提出使用“自夸文档”(什么/为什么/影响)和“密度链”等成熟框架来结构化LLM输出,为用户的“个人实用”目标提供理论支撑。 |
差异分析: 无
实施层面
文学细微之处与创意限制
| 角色 | 方法 |
|---|---|
| 人类 | 要求“侧面体现”挣扎过程,而非直接陈述,注重微妙性和主题深度(例如战后舞蹈演员)。 |
| 人工智能 | 通过感官细节(松脂气味、坏音乐盒)和日常惯例生成变体,以突出缺失身体部位的缺失,展示出“展示而非讲述”技术的熟练度。 |
差异分析: 无
人工智能局限性
关键局限
- 对π0.5的初始延迟计算依赖于文档,但未验证调用图(Euler步骤),导致1.85倍的误差,需要源代码审查才能修正。
- 在总结规划阶段,人工智能必须被明确指导在代码库中寻找“先例”,避免创造新模式,这表明如果不基于现有代码风格,就有过度设计倾向。
- 基准测试的初始CLI执行因Windows路径解析问题及无扩展的npm shims而失败,需要动态调整使用完整的.cmd路径或stdin来绕过CreateProcess限制。
一般局限
- 在某些创意写作过程中,人工智能无意中在输出中包含了内部“思考过程”或“策略笔记”,打断沉浸感并违反隐式的“直接输出”指令。
学习成果
关键学习点
- Qualcomm QAIRT的“岛屿”规则具有方向性:8<->16转换被支持,但4->16则不支持。这使得混合精度(例如在4位图中使用16位Softmax)无法在此NPU上部署。
- GeGLU和残差层激活对4位量化非常敏感。对于此NPU,激活必须至少保持8位才能成功;W4A4从根本上无法实现,除非重新架构模型。
- 在结构化LLM输出中,JSON模式中
description字段充当“嵌入式微提示”,显著影响字段内容的丰富度。 - “自夸文档”风格(结果+行动+重要性)比时间日志更适合日常工程报告,提供更好的洞察密度。
- 在基准测试本地模型时,使用
ollama stop确保冷启动条件下的VRAM和加载时间指标一致;如果其他进程活跃,nvidia-smi中的基线VRAM不可靠。 - 共享状态文件(如想法图)需要锁定机制或顺序协调协议,以防止多会话AI环境中ID冲突。
对话总结
Qualcomm VLA
✅ π0.5延迟审计与W4A4失败分析 深入探究Qualcomm Dragonwing NPU的限制。审查源代码以修正π0.5中1.85倍的延迟低估。执行D1-D4消融研究证明,由于QAIRT位转换规则和固有的量化敏感性,GeGLU和残差层与W4A4精度在结构上不兼容。
Gadget
✅ 总结工具优化与模型基准测试 使用“自夸文档”和“密度链”原则重新设计总结工具的提示词架构。对15多种模型(本地Ollama+云API)进行中文创意写作和README理解基准测试。识别表现最佳的模型,解决Windows CLI参数截断问题,并为网站生成双语基准报告。
✅ 统一模型切换架构与想法图同步 计划重构以集中模型选择(I-051到I-053)。识别由未拉取默认模型引起的静默故障。通过手动重新编号节点解决共享想法图中的并发ID冲突,防止平行AI会话之间的状态冲突。
创意写作基准测试
✅ 战后舞蹈演员与科幻故事 执行多轮创意写作提示(装有假肢的芭蕾舞者、远程站观察员)。展示出对情感基调和感官细节的强控制能力,以间接方式描绘挣扎。验证了在严格技术准确性与富有表现力的文学风格之间切换的能力。