模型中文能力大比拼
同一条 prompt,4 个本地 Ollama 模型 + 三家 Agent CLI 的 12 个云端模型,各写一遍。 下面是全部原始输出,以及每次运行记录到的速度、显存、延迟和 token 数据。 英文版不是这一页的翻译,而是同样设置下换成英文 prompt、要求写英文小说开头的另一次实验。 题目 请用中文写一个约500字的小说开头,以一位在战争爆炸中失去一条腿的芭蕾舞演员为主角,通过描写她在战后生活来侧面体现出她的挣扎。 运行条件 16 个模型收到的是完全相同的一句 prompt,没有任何前缀或 system prompt。 本地(Ollama) — RTX 5090 / 32 GB。POST 127.0.0.1:11434/api/chat,stream: false。 不指定任何采样参数,temperature、num_predict、context 全部走模型 Modelfile 和 ollama 的默认值 (ollama ps 显示四个模型的 context 都是 65536,显存里的 KV cache 按这个尺寸分配)。 每个模型跑之前先 ollama stop 清空显存,所以加载时间是冷启动。 显存取 nvidia-smi 峰值减去桌面基线(2.5–3.3 GB)。 速度直接读响应体的 eval_count / eval_duration,不含 HTTP 和 Python 开销。 云端(Agent CLI) — codex exec、claude -p、cursor-agent --print, 全部串行、--output-format json,工作目录是一个空的临时文件夹。 总耗时用 perf_counter 掐整个进程,token 数和 API 耗时从各家 JSON 的 usage 字段读。 ...