Inkling模型海外华人指南:前OpenAI CTO新作,藏着DeepSeek和Kimi的中国基因

如果你在美国刷到一条新闻:OpenAI 前 CTO Mira Murati 出来创业,新公司 Thinking Machines Lab(TML)发布了首个大模型 Inkling。点进去再看细节,会发现两件让海外华人很爽的事——

第一,这家公司的联合创始人里有一位华人研究员翁荔(Lilian Weng),前 OpenAI 研究安全 VP;第二,这个被硅谷寄予厚望的模型,骨架用的是中国 DeepSeek-V3 的 MoE 设计,后训练数据还用了月之暗面 Kimi K2.5 生成的语料。

换句话说,一款顶着“美国开源新王”名号的模型,骨子里有不少中国 AI 的基因。对海外华人来说,这不只是八卦,而是一个信号:中国 AI 的底层技术,正在被全球顶级团队认可。

目录

Inkling 到底是什么?

Inkling 是 Thinking Machines Lab 在 2026 年 7 月 15 日发布的开源基础模型,采用 Apache 2.0 协议开放权重。核心规格看一眼:

指标 Inkling Inkling-Small
总参数量 9750 亿 2760 亿
激活参数 410 亿 120 亿
上下文窗口 最高 100 万 token 未公开
预训练数据 45 万亿 token(文本/图像/音频/视频) 同系列
协议 Apache 2.0 Apache 2.0
自托管显存 BF16 需 2TB+ / NVFP4 需 600GB+ 更低

它主打三个卖点:原生多模态(文本、图像、音频一起处理)、可控推理强度(effort 0.2–0.99 可调)、可微调(通过 Tinker 平台用普通笔记本就能做工业级微调)。

官方自己也说得很老实:Inkling 不是当前最强的模型,开源闭源都不是。它更像一个“六边形战士”底座——能力均衡、成本低、能改。

为什么说它身上有中国 AI 的基因?

这件事在海外华人圈子里被讨论最多。三个事实:

1. 翁荔是联合创始人

翁荔本科北大,CMU 硕士,OpenAI 早期员工,后来做到研究安全 VP。她离职加入 TML 的消息本身就让很多华人 AI 从业者振奋。Inkling 发布当天,她在 X 上发文介绍模型,语气很务实:基础能力均衡、可定制、可落地。

2. 架构大量参考 DeepSeek-V3

TML 官方博客没有避讳,直接写明 Inkling 的 MoE 架构借鉴了 DeepSeek-V3。具体包括:256 个路由专家 + 2 个共享专家,每个 token 激活 6 个专家,sigmoid 路由器加无损负载均衡。

DeepSeek-V3 是中国深度求索的成果,以“小激活、大参数”的稀疏架构出名。美国明星独角兽做新模型,首选不是从头造轮子,而是参考中国方案,这本身就说明中国 AI 在架构层面的影响力。

3. 后训练用了 Kimi K2.5 生成的数据

月之暗面的 Kimi K2.5 被用于 Inkling 的后训练数据生成。Kimi 的长上下文和中文能力在业内有口皆碑,这也让很多人好奇:Inkling 对中文任务的处理,会不会比 Llama、Mistral 这类西方开源模型更顺手?

我的实测感受是:中文指令遵循比 Llama 3 好,但和 Kimi、豆包这类原生中文模型比,语气还是偏“翻译腔”。如果你主要用中文,Inkling 可以作为辅助工具,但暂时替代不了国产模型。

性能不是最强,但性价比很能打

Inkling 的 benchmark 成绩对得起“均衡”二字。下面这张表是和当前主流模型的横向对比:

基准测试 Inkling GPT-5.6 Sol Claude Fable 5 Kimi K2.5 GLM 5.2
HLE(文本推理) 29.7% 47.2% 53.3% 约 35% 40.1%
AIME 2026(数学) 97.1% 99.9% 约 98% 约 96% 约 95%
GPQA Diamond(科学) 87.2% 94.1% 约 92% 约 90% 约 88%
SWEBench Verified(代码) 77.6% 82.2% 95.0% 约 78% 约 76%
Terminal Bench 2.1 63.8% 89.5% 约 80% 约 72% 82.7%
FORTRESS 安全对抗 78.0% 未公开 未公开 未公开 未公开

数据来源:Thinking Machines Lab 官方模型卡与第三方评测汇总。

可以看出,Inkling 在数学和科学推理上接近第一梯队,但复杂代码和终端任务明显弱于 GPT-5.6 Sol 和 Claude Fable 5。真正让它出彩的是Token 效率:在 Terminal Bench 2.1 上,Inkling 达到同等性能只用了 Nemotron 3 Ultra 约三分之一的 token。

对海外开发者和创业者来说,这意味着 API 账单能省不少。

海外华人怎么用上 Inkling?

这是最关键的问题。好消息是:Inkling 对海外用户很友好,不需要中国手机号,注册门槛也不高。

使用方式 适合谁 门槛 成本
Tinker 平台 Playground 想快速体验的普通用户 邮箱注册 限时 5 折
Tinker API 开发者/企业 API Key 按 token 计费
Together AI / Fireworks / Modal 已有海外 API 生态的开发者 对应平台账号 各平台定价
Hugging Face 下载权重 有算力资源的研究者/公司 需高端 GPU 集群 硬件成本
llama.cpp / vLLM / SGLang 想本地部署的技术团队 编译+配置能力 硬件成本

普通用户最省事的路径是Tinker 控制台:进去点 Inkling Playground,直接聊天或做 Agent 式网络搜索。API 用户可以直接在 Tinker 拿 key,也可以走 Together AI、Fireworks 这些熟悉的平台。

想自己跑权重的话,官方要求 BF16 版本至少 2TB 显存(8 张 NVIDIA B300 或 16 张 H200),NVFP4 量化版降到 600GB(4 张 B300 或 8 张 H200)。这个门槛基本把个人用户挡在门外,但中小企业租用云端 GPU 还是可以玩的。

适合海外华人的 4 个真实使用场景

1. 中英双语内容创作

Inkling 原生支持多语言,加上 Kimi 数据的后训练,中文理解和英文输出之间的切换比较自然。适合写中英双语博客、LinkedIn 帖子、海外华人社区文案。

2. 海外创业/小团队的 AI 客服

用 Tinker 微调一个基于 Inkling 的客服机器人,处理中英文咨询。因为是开源权重,数据不会被锁死在 OpenAI 或 Anthropic 的封闭系统里,合规上更可控。

3. 学术研究/论文辅助

100 万 token 上下文 + 多模态,适合扔进去整篇 PDF 论文或一组实验数据,让它帮忙总结、找漏洞、写代码。

4. 编程 Agent 原型开发

Inkling 在 SWEBench 上 77.6% 的成绩不算顶尖,但做原型、写脚本、处理中等复杂度代码足够用。关键是 token 便宜,试错成本低。

先别兴奋,这几个坑要知道

  • 中文不如国产模型地道。虽然用了 Kimi 数据,但 Inkling 的语料主力还是英文,写中文文章会有轻微的“西化”语感。
  • 自托管成本极高。个人用户别想着本地跑完整版,Playground 或 API 才是现实选择。
  • 生态刚起步。比起 Llama 3 的周边工具链,Inkling 的社区、教程、微调案例还很少,遇到问题要自己动手。
  • 安全策略偏保守。FORTRESS 安全分高是好事,但也意味着某些敏感话题它可能直接拒答,做研究用途时要预留备用方案。

结论:值得尝鲜,但不必换主力

Inkling 最大的意义不是“打败 GPT-5.6”,而是证明了另一种路线可行:不堆极限性能,靠稀疏架构、可控成本、开放权重和企业可定制性,走出一条实用主义道路。而这条路,中国团队 DeepSeek、Kimi、智谱已经走了一段。

对海外华人来说,Inkling 现在最适合的角色是“第二把刀”:用来处理中英双语任务、做低成本 API 实验、或者作为可微调的私有 AI 底座。日常聊天和复杂代码,ChatGPT、Claude、豆包、Kimi 仍是更顺手的选择。

如果你在海外做 AI 创业或内容创作,建议现在就去 Tinker Playground 试试,重点测三件事:中文输出自然度、长上下文稳定性、和你现有工作流的整合成本。试完再决定是否投入。

相关阅读:

本文发布于 2026 年 7 月 21 日。AI 工具更新频繁,定价与功能可能随时变化,请以官方页面为准。如果你有海外使用 AI 工具的具体问题,欢迎在评论区留言。

发表评论