Mira Murati 的实验室预览 Inkling-Small:为预算有限的开发者打造的精简开源模型

新闻摘要
由前 OpenAI 首席技术官 Mira Murati 创立的 AI 研究公司 Thinking Machines Lab,于太平洋时间 2026 年 7 月 15 日上午 9 点发布了其首个开放权重模型家族。旗舰版本名为 Inkling,是一个拥有 9750 亿参数的多模态混合专家模型,与之同步发布的还有更轻量级的版本 Inkling-Small,旨在为那些无法使用大型 GPU 集群的团队提供强大的推理性能。该公司并未追求在排行榜上拔得头筹,而是将这两款模型定位为灵活的起点,供希望为自身产品定制和微调 AI 系统的开发者使用。
Inkling 与 Inkling-Small 是什么
Inkling 基于混合专家 Transformer 架构构建,每层包含 256 个路由专家和 2 个共享专家,其中对于任意给定的 token 会激活 6 个路由专家。这种设计使得完整模型拥有 9750 亿总参数,但在推理过程中仅有约 410 亿参数处于活跃状态,从而将计算成本控制在可管理的范围内。Inkling-Small 采用了相同的架构,但规模有所缩减:总参数量为 2760 亿,每个 token 约有 120 亿活跃参数。这两款模型均支持最高 100 万 token 的上下文窗口,并在总计 45 万亿涵盖文本、图像、音频和视频的 token 上进行了训练。
值得注意的是,Inkling-Small 在发布时仅作为技术预览版共享。其完整的可下载权重因需要额外的安全性和质量测试而暂缓发布,不过开发者已经可以通过 Thinking Machines 的定制平台 Tinker 对其进行微调。
用于控制成本的“思考努力”调节器
Inkling 家族中一项较为独特的功能是可控的“思考努力”设置,该设置可通过系统消息进行调整,允许开发者在推理深度与速度及 token 成本之间进行权衡。该公司研究人员报告称,这种方式使 Inkling 在 Terminal Bench 2.1 等 Agentic 编程基准测试中能够匹敌竞争对手的系统,同时消耗的 token 数量大约仅为 Nvidia Nemotron 3 Ultra 模型的三分之一。具体到 Inkling-Small,其高效推理设计直指对延迟敏感且注重预算的工作负载,包括编程助手、自动评分系统,以及为较小的下游模型生成合成训练数据。
基准测试性能
在最高推理努力设置下,Inkling 在 GPQA Diamond 上取得了 87.2% 的得分,在 AIME 2026 上取得了 97.1% 的得分,在 SWE-Bench Verified(一项广泛使用的真实世界编程能力衡量标准)上取得了 77.6% 的得分。在多模态评估中,该模型在视觉任务的 MMMU Pro 上达到了 73.5%,在音频理解的 VoiceBench 上达到了 91.4%。Thinking Machines 报告称,Inkling-Small 在许多相同评估中仅略微落后于其更大版本的模型,其视觉和音频得分通常与完整尺寸模型相差一到三个百分点,尽管其使用的活跃参数不到三分之一。
训练方法与安全工作
Inkling 家族使用混合优化方法进行训练,将 Muon 优化器应用于大型权重矩阵,将 Adam 应用于其余参数,随后进行了监督微调以及涉及超过 3000 万次 rollout 的大规模强化学习。该公司表示,其特别强调了校准工作,使用具有明确结果的真实世界问题来训练模型,以便它们能够表达适当的置信度,而不是盲目自信地猜测。安全评估包括对抗性红队基准测试,其中 Inkling 在 StrongREJECT 测试中得分 98.6%,在 FORTRESS 对抗性安全套件中得分 78.0%,此外还接受了独立测试人员的外部审查。
可用性与定价
Inkling 的完整权重现在可通过 Hugging Face 下载,包括针对 Nvidia Blackwell 芯片优化的压缩 NVFP4 检查点,该模型还可通过 Together AI、Fireworks、Modal、Databricks 和 Baseten 等托管合作伙伴访问。Thinking Machines 为通过 Tinker 进行微调的开发者提供限时 50% 的折扣,并在 Tinker 控制台内提供免费且时间有限的 Inkling 操场访问权限。一旦额外测试结束,Inkling-Small 的完整权重预计将随后发布。
行业背景
此次发布为 Thinking Machines 的公开产品阵容增添了第二名成员,此前该公司已首次推出了 Tinker 微调平台。公司研究人员坦言,Inkling 并不旨在成为现有最强模型(无论是开源还是闭源);相反,其重点在于为开发者、大学和研究实验室提供一个全面且高效的基础,使他们能够将其调整用于专业的科学、编程和推理应用。早期企业的兴趣通过与投资公司 Bridgewater Associates 的合作得以突显,据报道,该公司将 Inkling 应用于金融推理基准测试取得了强劲成果,而计算成本仅为同类专有模型的一小部分。