7月16日凌晨,Moonshot AI 正式发布 Kimi K3。这不是一次常规迭代,而是直接把中国大模型推到了「2.8万亿参数、100万 token 上下文、开放 MoE 架构」的级别。更关键的是,它部分 benchmark 已经超过了 Claude Fable 5 和 GPT-5.6 Sol。
作为一个在海外用惯了 ChatGPT 和 Claude 的人,我的第一反应是:这东西我在国外能直接用吗?注册要不要中国手机号?价格跟 GPT-5.6 比怎么样?中文写作能力如何?
我翻完了 Moonshot 官方博客、MarkTechPost 的技术拆解,以及 LM Market Cap 的更新数据,这篇文章把 Kimi K3 的海外可用性、性能、价格、适用场景一次性说清楚。
目录
- Kimi K3 到底是什么?三个数字讲清楚
- Kimi Delta Attention 和 AttnRes:为什么能跑得快
- 实测成绩:跟 GPT-5.6 Sol、Claude Fable 5 谁更强
- 海外华人最关心的:能不能直接用、要不要中国手机号
- 价格对比:比 GPT-5.6 和 Claude 便宜多少
- 五种真实使用场景,Kimi K3 适合谁
- WAICO 联盟背后:这件事对海外华人意味着什么
- 结论:海外华人现在该不该用 Kimi K3
Kimi K3 到底是什么?三个数字讲清楚
如果你不想看技术细节,记住这三个数字就够了:
- 2.8 万亿参数:目前全球最大的开放 MoE(混合专家)模型,Moonshot 称其为「首个开放 3T 级模型」。
- 100 万 token 上下文:一次能塞进去大约 150 万字中文文档,或者几百页 PDF。
- 激活 16/896 个专家:每次前向传播只调用 16 个专家,稀疏架构让推理成本大幅下降。
简单来说,Kimi K3 是一个为长文档、复杂代码和深度研究设计的旗舰模型。它不是聊天机器人里那种「随便问问」的工具,而是冲着专业工作流去的。
官方把它定位为 Opus-class 级别的模型,也就是说直接对标 Claude Opus 4.8、GPT-5.6 Sol 这种顶尖闭源模型。虽然 Moonshot 自己也承认整体性能仍略逊于 Claude Fable 5 和 GPT-5.6 Sol,但在多个具体任务上已经开始反超。
Kimi Delta Attention 和 AttnRes:为什么能跑得快
参数多不等于好用。很多大模型参数堆上去之后,推理速度会断崖式下跌。Kimi K3 这次在两个地方做了关键创新:
Kimi Delta Attention(KDA):一种混合线性注意力机制。官方说在百万 token 上下文中,解码速度能提升最多 6.3 倍。这意味着你扔一本电子书进去,它总结起来不会像传统模型那样卡成 PPT。
Attention Residuals(AttnRes):跨模型深度有选择地复用表征,而不是每一层都重新计算。训练效率提升了约 25%,额外成本不到 2%。
另外还有 Stable LatentMoE、Quantile Balancing、Per-Head Muon 等一系列工程优化。对于普通用户来说,这些名词不重要,重要的是结果:K3 的扩展效率比上一代 Kimi K2 高了约 2.5 倍。
更实际的一点是,K3 从 SFT 阶段就做了量化感知训练,使用 MXFP4 权重和 MXFP8 激活。这意味着它对硬件更友好,企业部署时不用专门买最贵的那批卡。Moonshot 还专门为 KDA 给 vLLM 贡献了实现,说明它真的想让开源社区能跑起来。
实测成绩:跟 GPT-5.6 Sol、Claude Fable 5 谁更强
直接看表。以下数据来自 Moonshot 官方评估,所有 K3 结果都使用 reasoning_effort=max。
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GLM-5.2 |
|---|---|---|---|---|---|
| DeepSWE | 67.5 | 70.0 | 73.0 | 59.0 | 46.2 |
| Program Bench | 77.8 | 76.8 | 77.6 | 71.9 | 63.7 |
| Terminal Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 | 82.7 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 66.7 | 67.3 |
| SWE Marathon | 42.0 | 35.0 | 39.0 | 40.0 | 13.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 | — |
| Automation Bench | 30.8 | 29.1 | 29.7 | 27.2 | 12.9 |
| GPQA-Diamond | 93.5 | 92.6 | 94.1 | 91.0 | 91.2 |
| MMMU-Pro | 81.6 | 81.2 | 83.0 | 78.9 | — |
| OmniDocBench | 91.1 | 89.8 | 85.8 | 87.9 | — |
从这张表能看出几个趋势:
- K3 在代码和 Agent 类任务上占优:Program Bench、SWE Marathon、Automation Bench 都领先。
- 浏览器信息检索能力突出:BrowseComp 91.2,超过 Fable 5 的 88.0 和 GPT-5.6 Sol 的 90.4。
- 文档理解是杀手锏:OmniDocBench 91.1,比 Fable 5 高 1.3 分,比 GPT-5.6 Sol 高 5.3 分。
- 纯推理和深度科研仍落后:FrontierSWE 和 HLE-Full 不如 Fable 5,DeepSWE 不如 GPT-5.6 Sol。
所以结论很明确:如果你是程序员、研究员、律师、投行分析师这类需要处理大量长文档和代码的人,K3 非常值得一试;但如果你要的是最顶尖的纯推理能力,Fable 5 和 GPT-5.6 Sol 仍然领先。
海外华人最关心的:能不能直接用、要不要中国手机号
这是我在国外最烦的问题。很多中国 AI 工具看着便宜好用,结果注册时弹出「请输入中国大陆手机号」,直接劝退。
Kimi K3 的好消息是:海外用户可以直接访问。它目前通过三个渠道提供服务:
- Kimi.com:网页端,支持邮箱注册。
- Kimi Work / Kimi Code:面向工作流和编程的客户端/插件。
- API:OpenAI SDK 兼容,base_url 是 https://api.moonshot.ai/v1。
根据目前的信息,Kimi 的注册不强制要求中国手机号。海外用户用 Gmail 或常用邮箱即可注册,API 也可以直接申请 key。这一点比豆包、文心一言等产品对海外用户友好得多。
不过需要注意两点:
- API 稳定性:高峰期可能出现延迟,尤其是用 1M 长上下文时。
- 内容审核:作为中国公司,Kimi 在政治、敏感历史话题上会有内容过滤。如果你主要用它写代码、读论文、做翻译,影响不大。
对比之下,GPT-5.6 和 Claude 对海外用户更无感,但价格更高,而且对中文语料的细腻程度可能不如 Kimi。具体价格差异看下一节。
价格对比:比 GPT-5.6 和 Claude 便宜多少
Kimi K3 的定价非常直接,没有按上下文长度分档:
| 计费项 | Kimi K3 | GPT-5.6 Sol(参考) | Claude Fable 5(参考) |
|---|---|---|---|
| 输入(cache hit) | $0.30 / MTok | 约 $2.50–$5.00 / MTok | 约 $3.00 / MTok |
| 输入(cache miss) | $3.00 / MTok | 约 $5.00–$10.00 / MTok | 约 $3.00 / MTok |
| 输出 | $15.00 / MTok | 约 $15.00–$25.00 / MTok | 约 $15.00 / MTok |
| 上下文窗口 | 1M tokens | 约 256K–1M | 约 200K |
注意 Kimi 的 cache hit 价格极低,只有 $0.30/MTok。如果你做代码助手、客服机器人这种重复调用同一上下文的任务,实际成本会远低于表观价格。Moonshot 官方说 coding workload 的 cache hit 率能到 90% 以上。
以同样处理一本 50 万字的中文技术文档为例,K3 的总成本大约只有 GPT-5.6 Sol 的 1/5 到 1/3。这对经常要读长篇论文、合同、财报的海外华人用户来说,是非常有吸引力的。
关于 GPT-5.6 的具体版本和定价,可以参考我们之前的 2026年7月AI模型价格战横评。
五种真实使用场景,Kimi K3 适合谁
光看 benchmark 不够,下面按真实场景给建议:
1. 海外程序员:代码补全和仓库级重构
K3 在 Program Bench、SWE Marathon 上领先,加上 1M 上下文,可以直接把整个代码库塞进去做跨文件重构。如果你用 Kimi Code 或者 API 接 Cursor,体验会非常接近 Grok 4.5。关于 Grok 4.5 的编程体验,可以看 Grok 4.5 海外华人上手指南。
2. 留学生/研究员:读论文和写文献综述
把几十篇 PDF 一起丢进去,让 K3 总结差异、找引用、写综述。OmniDocBench 91.1 的分数不是虚的,对中文和英文混排文档的识别能力尤其强。
3. 海外华人创业者:市场研究和竞品分析
BrowseComp 91.2 说明它的联网检索和总结能力已经到第一梯队。你可以让它连续抓取几十个网页,汇总成一份中文或英文的竞品报告。
4. 律师/投行/咨询:长文档审阅
合同、招股说明书、尽调材料动辄几百页。K3 的 1M 上下文让它可以一次性处理,不需要你手动切片。输出稳定,不易漏细节。
5. 普通用户:日常问答和翻译
说实话,这种场景用 K3 有点浪费。如果你只是聊聊天、写个邮件,GPT-5.6 Luna 或 Kimi 自己的轻量版更划算。K3 是给重度用户准备的。
WAICO 联盟背后:这件事对海外华人意味着什么
7 月 17 日,习近平在 2026 世界人工智能大会(WAIC)上宣布成立世界人工智能合作组织(WAICO),创始成员包括印尼、巴西、马来西亚、南非、塞内加尔、俄罗斯、巴基斯坦等 29 个国家。
这个组织表面上是推动 AI 国际合作和监管,但本质上是中国在全球 AI 治理话语权的布局。对海外华人来说,实际影响有两个:
- 中国 AI 工具的国际化会加速:为了争取更多国家加入 WAICO,中国公司会更积极地让产品出海、支持多语言、改善海外访问体验。Kimi K3 这种「海外可用、API 兼容」的路线可能会成为模板。
- 中外 AI 生态会进一步分化:美国芯片出口管制和中国反制措施都在升级。海外华人未来可能需要同时配置「美国工具链」和「中国工具链」,根据任务切换。
这不是政治站队,而是实用选择。对我们内容创作者、程序员、研究者来说,手里多一个能用的中国模型,不是坏事。
结论:海外华人现在该不该用 Kimi K3
我的判断是:值得认真试用,但不必急着替代 GPT-5.6 或 Claude。
如果你符合以下任意一条,建议现在就去申请 Kimi K3 API:
- 经常处理 10 万字以上的中文长文档;
- 需要便宜的代码助手 API,且能接受中国公司的服务条款;
- 做跨境业务,需要同时用中英文输出内容;
- 想降低 AI 使用成本,愿意尝试非美国模型。
但如果你主要依赖 Claude 的创意写作、Fable 5 的复杂推理,或者对数据隐私极其敏感,建议再观望一到两个月,看看 K3 的实际社区反馈和海外访问稳定性。
最后给一个简单的对照表:
| 你的需求 | 推荐选择 | 理由 |
|---|---|---|
| 代码 + 长上下文 | Kimi K3 / Grok 4.5 | 代码 benchmark 强,上下文长 |
| 纯推理 + 科研 | GPT-5.6 Sol / Claude Fable 5 | FrontierSWE、HLE-Full 仍领先 |
| 日常聊天 + 性价比 | GPT-5.6 Luna / Kimi 轻量版 | 速度快、价格低 |
| 海外华人中文工作流 | Kimi K3 | 中文原生、海外可注册、价格香 |
下一步行动:
- 打开 Kimi.com 用邮箱注册;
- 进入 Kimi 开放平台 申请 API Key;
- 用 OpenAI SDK 改 base_url 跑一段你的真实任务,对比 GPT-5.6 的输出质量;
- 如果你也试过 Kimi K3,欢迎在评论区分享你的使用场景和遇到的问题。
本文发布于2026年7月18日,基于 Moonshot AI 官方博客、MarkTechPost 技术解析及 LM Market Cap 公开数据整理。AI 行业发展迅速,价格与可用性可能随时变化,请以官方最新信息为准。