1193 words
6 minutes
Kimi K3 与 Qwen 3.8 Max 开发者反馈报告

Kimi K3 与 Qwen 3.8 Max 开发者反馈报告#

综合自 EESEL、Hacker News、Dev.to、JavaGuide、SegmentFault、AvenChat 等一手来源与开发者亲测反馈(截至 2026 年 8 月初)。

月之暗面在 7 月 16 日把 Kimi K3 推上 GA,三天后阿里 Qwen 就端出了 3.8 Max 的 preview,并在 8 月 2 日转正。这两款旗舰国产模型几乎同时进入开发者视野,但__一个”发布即差异”的对照组__已经成立——K3 有真实可测试的 track record,Qwen 早期则是 preview、缺独立验证数据。本文把开发者们的一手反馈整理成一份中立报告。

一、模型背景速览#

维度Kimi K3Qwen 3.8 Max
厂商月之暗面 Moonshot AI阿里 Qwen 团队
发布2026-07-16(GA)2026-07-19 预览,08-02 GA
总参数2.8T(896 个专家中激活 16 个)2.4T MoE,激活 95B
上下文1,048,576(~1M)1,000,000
输入/输出(每 1M token)3.00/3.00 / 15.002.00/2.00 / 6.00
推理控制max(无低档)low/medium/xhigh,默认 xhigh
开源权重已发布(07-27,Hugging Face 获 83 万+下载)承诺但尚未发布
多模态文本/图像/视频文本/图像/视频

二、开发者反馈亮点#

👍 Kimi K3 的正面反馈#

  • 指令遵循与 Opus 同级:设定边界后严格遵循,不自由发挥,长会话中持续一致(chenchen.guru)。
  • 长程 Agent 编程是最大惊喜:多文件、跨几十个文件保持架构一致,能”读需求→拆模块→改代码→跑测试→修报错→交可验证结果”。有开发者用它跑完整全栈 MVP、Java 项目改造、3A 质感游戏 Demo,案例几乎无 bug。
  • 数据/统计分析达到 Fable 同级:不只是”复述统计”,能做支撑决策的观察。
  • 前端能力顶级:LMArena Frontend Code Arena 发布数小时从 #18 升至 #1,超越 Claude Fable 5。
  • 性价比口碑好:“接近 Sonnet 的价格,复杂任务里 Opus 级的体验”;综合评测 cost-per-task 约 $0.94。

⚠️ Kimi K3 的痛点(社区公认)#

  • “Token 饥饿”慢体验:GLM 5.2 / K3 这类国产大模型”极其 token 消耗、体感慢”。
  • 超时/卡死:长任务会因 overload 中断(需重试回退);偶发”只输出思考 token 无内容然后停止”。
  • 工具调用进入死循环:烧 token 却不推进,需 harness 检测空输出、打断循环。
  • Cache 匹配难:缓存 key 管理不当则命中率低、成本优势丢失;订阅积分消耗明显快于 Claude/Codex。
  • 容量受限:发布 48 小时 GPU 吃紧,07-19 暂停新订阅。
  • 没有推理档位:只能 max,无法为省钱降档。

👍 Qwen 3.8 Max 的正面反馈#

  • 多模态强项:图像/视频/文档处理,CharXiv 榜单(图表解读)在可比 harness 上领先。
  • 推理档位可调low/medium/xhigh 可降成本,这是 K3 没有的。
  • 价格表全面更低:输入便宜 1/3、输出便宜 60%,缓存命中 0.25vs0.25 vs 0.30。
  • 官方宣称 10+ 天自主编码跑通 oh-my-cli 项目(vendor 口径,未独立验证)。

⚠️ Qwen 3.8 Max 的痛点#

  • “benchmark princess”:有开发者直言”Qwen 感觉像是榜单公主”——benchmark 好看,实战一般。
  • 二次猜疑循环:有反馈称”一执行任务就陷入无进展的自我怀疑循环”,“灾难性差”(单一场景,仅供参考)。
  • token 效率低:同任务输入 token 是 K3 的 ~1.9 倍(18.02M vs 9.53M),抵消了价格优势。
  • 开源是”承诺”:权重、license、repo 均未落地,本地部署 claim 存疑;且 2.8T 级权重本就是数据中心物件,非桌面可跑。
  • 缺系统卡/安全评估/知识截止,独立第三方验证几乎为零。

三、核心结论与选型建议#

  1. 动手实测/选型:K3 是唯一可今天评估部署的(有独立 benchmark + 真实定价 + 已发布权重)。
  2. 长 Agent 循环(token 效率决定账单):选 Kimi K3——同任务约一半输入 token,抵消其更高的价格表。
  3. 图表/文档/视频密集任务:选 Qwen 3.8 Max
  4. 需要自托管/审计:选 Kimi K3(权重已发布且参数可从 checkpoint 验证);Qwen 仍是承诺。
  5. 需要可调推理档位降成本:选 Qwen 3.8 Max
  6. 严格按 token 单价:选 Qwen,但实际成本按”单任务完成成本”衡量(两者几乎打平,5.5vs5.5 vs 5.5)。

一句话:K3 是”能今天用”的模型,Qwen 3.8 是”值得关注、但尚无真实数字可 commit”的模型。 两家发布相隔 3 天,Qwen 明显是应对 K3 势头的直接回应;唯一可靠的横向对比只有 3 行(TerminalBench K3 胜 1.7 分、CharXiv Qwen 胜 2.2 分、JobBench 平局)。


来源:EESEL 深度对比、Hacker News 讨论、chenchen.guru 与 Dev.to 开发者实测、JavaGuide《Kimi K3 实战》全栈/Java/游戏三案例、AvenChat 中立对比。

Kimi K3 与 Qwen 3.8 Max 开发者反馈报告
https://sgjki547.top/posts/2026-08-04-kimi-k3-与-qwen-38-开发者反馈报告/
Author
SGJki
Published at
2026-08-04
License
CC BY-NC-SA 4.0