1193 words
6 minutes
Kimi K3 与 Qwen 3.8 Max 开发者反馈报告
Kimi K3 与 Qwen 3.8 Max 开发者反馈报告
综合自 EESEL、Hacker News、Dev.to、JavaGuide、SegmentFault、AvenChat 等一手来源与开发者亲测反馈(截至 2026 年 8 月初)。
月之暗面在 7 月 16 日把 Kimi K3 推上 GA,三天后阿里 Qwen 就端出了 3.8 Max 的 preview,并在 8 月 2 日转正。这两款旗舰国产模型几乎同时进入开发者视野,但__一个”发布即差异”的对照组__已经成立——K3 有真实可测试的 track record,Qwen 早期则是 preview、缺独立验证数据。本文把开发者们的一手反馈整理成一份中立报告。
一、模型背景速览
| 维度 | Kimi K3 | Qwen 3.8 Max |
|---|---|---|
| 厂商 | 月之暗面 Moonshot AI | 阿里 Qwen 团队 |
| 发布 | 2026-07-16(GA) | 2026-07-19 预览,08-02 GA |
| 总参数 | 2.8T(896 个专家中激活 16 个) | 2.4T MoE,激活 95B |
| 上下文 | 1,048,576(~1M) | 1,000,000 |
| 输入/输出(每 1M token) | 15.00 | 6.00 |
| 推理控制 | 仅 max(无低档) | low/medium/xhigh,默认 xhigh |
| 开源权重 | 已发布(07-27,Hugging Face 获 83 万+下载) | 承诺但尚未发布 |
| 多模态 | 文本/图像/视频 | 文本/图像/视频 |
二、开发者反馈亮点
👍 Kimi K3 的正面反馈
- 指令遵循与 Opus 同级:设定边界后严格遵循,不自由发挥,长会话中持续一致(chenchen.guru)。
- 长程 Agent 编程是最大惊喜:多文件、跨几十个文件保持架构一致,能”读需求→拆模块→改代码→跑测试→修报错→交可验证结果”。有开发者用它跑完整全栈 MVP、Java 项目改造、3A 质感游戏 Demo,案例几乎无 bug。
- 数据/统计分析达到 Fable 同级:不只是”复述统计”,能做支撑决策的观察。
- 前端能力顶级:LMArena Frontend Code Arena 发布数小时从 #18 升至 #1,超越 Claude Fable 5。
- 性价比口碑好:“接近 Sonnet 的价格,复杂任务里 Opus 级的体验”;综合评测 cost-per-task 约 $0.94。
⚠️ Kimi K3 的痛点(社区公认)
- “Token 饥饿”慢体验:GLM 5.2 / K3 这类国产大模型”极其 token 消耗、体感慢”。
- 超时/卡死:长任务会因 overload 中断(需重试回退);偶发”只输出思考 token 无内容然后停止”。
- 工具调用进入死循环:烧 token 却不推进,需 harness 检测空输出、打断循环。
- Cache 匹配难:缓存 key 管理不当则命中率低、成本优势丢失;订阅积分消耗明显快于 Claude/Codex。
- 容量受限:发布 48 小时 GPU 吃紧,07-19 暂停新订阅。
- 没有推理档位:只能 max,无法为省钱降档。
👍 Qwen 3.8 Max 的正面反馈
- 多模态强项:图像/视频/文档处理,CharXiv 榜单(图表解读)在可比 harness 上领先。
- 推理档位可调:
low/medium/xhigh可降成本,这是 K3 没有的。 - 价格表全面更低:输入便宜 1/3、输出便宜 60%,缓存命中 0.30。
- 官方宣称 10+ 天自主编码跑通 oh-my-cli 项目(vendor 口径,未独立验证)。
⚠️ Qwen 3.8 Max 的痛点
- “benchmark princess”:有开发者直言”Qwen 感觉像是榜单公主”——benchmark 好看,实战一般。
- 二次猜疑循环:有反馈称”一执行任务就陷入无进展的自我怀疑循环”,“灾难性差”(单一场景,仅供参考)。
- token 效率低:同任务输入 token 是 K3 的 ~1.9 倍(18.02M vs 9.53M),抵消了价格优势。
- 开源是”承诺”:权重、license、repo 均未落地,本地部署 claim 存疑;且 2.8T 级权重本就是数据中心物件,非桌面可跑。
- 缺系统卡/安全评估/知识截止,独立第三方验证几乎为零。
三、核心结论与选型建议
- 动手实测/选型:K3 是唯一可今天评估部署的(有独立 benchmark + 真实定价 + 已发布权重)。
- 长 Agent 循环(token 效率决定账单):选 Kimi K3——同任务约一半输入 token,抵消其更高的价格表。
- 图表/文档/视频密集任务:选 Qwen 3.8 Max。
- 需要自托管/审计:选 Kimi K3(权重已发布且参数可从 checkpoint 验证);Qwen 仍是承诺。
- 需要可调推理档位降成本:选 Qwen 3.8 Max。
- 严格按 token 单价:选 Qwen,但实际成本按”单任务完成成本”衡量(两者几乎打平,5.5)。
一句话:K3 是”能今天用”的模型,Qwen 3.8 是”值得关注、但尚无真实数字可 commit”的模型。 两家发布相隔 3 天,Qwen 明显是应对 K3 势头的直接回应;唯一可靠的横向对比只有 3 行(TerminalBench K3 胜 1.7 分、CharXiv Qwen 胜 2.2 分、JobBench 平局)。
来源:EESEL 深度对比、Hacker News 讨论、chenchen.guru 与 Dev.to 开发者实测、JavaGuide《Kimi K3 实战》全栈/Java/游戏三案例、AvenChat 中立对比。
Kimi K3 与 Qwen 3.8 Max 开发者反馈报告
https://sgjki547.top/posts/2026-08-04-kimi-k3-与-qwen-38-开发者反馈报告/