由英伟达投资的美国初创公司 Reflection AI 于当地时间 2026 年 10 月 5 日(IT 之家报道时间为 10 月 6 日)正式推出首款开放权重大模型 Beam。这家总部位于纽约布鲁克林、成立仅两年的公司明确表示,希望在代码编写与智能体(agent)任务领域,与 DeepSeek、Kimi 等成本较低的中国开放权重模型展开正面竞争。按照官方口径,Beam 在性能上可对标智谱 AI(Z.ai)的 GLM‑5.2,并在代码与智能体任务方面逐步逼近千问 3.8‑Max(Qwen3.8‑Max)。需要提醒的是,这些性能表述目前均来自厂商自述,尚未经过独立第三方验证。

稀疏激活:用更少的活跃参数去对标对手
Beam 最受关注的设计,是它的参数规模与激活方式之间的反差。根据多家媒体援引的公开信息,Beam 采用稀疏混合专家(Mixture‑of‑Experts,MoE)架构,总参数量达到 5010 亿,但在处理每一项任务时只会激活约 230 亿参数,激活比例不到 5%。参数量决定了 AI 系统如何处理信息,而稀疏激活意味着模型每次只调用网络中的一部分,从而在保持规模优势的同时,提高推理速度、降低运行成本。
作为对照,智谱 AI 的 GLM‑5.2 总参数量约为 7440 亿,激活参数量约为 400 亿。也就是说,Beam 试图用更少的活跃参数去追平体量更大的对手。公司给出的说法是,Beam 在部分先进推理测试中的表现与 GLM‑5.2 相当,但推理所需的运算量仅约为后者的三分之一到四分之一;若与总参数超过 2 万亿的 Qwen3.8‑Max 相比,其推理效率优势会更加明显。Reflection AI 据此将 Beam 定位为适合企业程序开发与智能体工作负载的高效率模型,并强调其核心卖点并非单纯追求最高能力,而是在维持竞争力的同时压低企业的部署成本。
面向代码与智能体任务的定位
从公开资料看,Beam 的能力定位相当聚焦。它是一款纯文本模型,暂不支持图像等多模态输入,主攻方向被明确描述为推理、编程与智能体任务。公司给出的其它规格包括:预训练数据规模约 23.8 万亿 token,上下文窗口达到 100 万 token,可一次性处理长篇文档或大型代码库。按照厂商说法,Beam 用更少的活跃参数追平对手,依靠的是高算力强化学习(RL)训练路线。
在厂商自测的基准成绩方面,有媒体援引 Reflection AI 的数据称,Beam 在 Terminal Bench v2.1 取得 80.1 分,SWE Bench Pro v2‑Hard 为 77.2 分,SWE Bench Pro v1 为 65.5 分,SWEBench Verified 达到约 80 分。这些数字同样属于厂商公布的测试结果,尚无独立评测佐证,读者宜将其作为参考而非定论。
Reflection AI 由前 DeepMind 研究人员米沙·拉斯金(Misha Laskin)与约安尼斯·安东诺格鲁(Ioannis Antonoglou)于 2024 年创立,主营软件开发自动化工具——这也是当前增长迅速的 AI 落地场景之一。在算力层面,有报道提到 Beam 使用约 1.05 万张 GB300 GPU 训练约 4 周;此前该公司还与 SpaceX 达成合作,可在其 Colossus 2 数据中心获取额外算力资源。按照公司计划,Beam 的模型权重与技术资料预计将于 10 月稍后开放。
竞争背景:美国开放权重阵营的一次反攻
Beam 的发布正值一个敏感节点。当下,中国的开放权重模型凭借更低成本、更强可定制性,在代码生成等能力上几乎追上了 OpenAI 与 Anthropic 的头部闭源模型,而美国科技企业正试图在开放权重这一赛道上重新组织应对。Reflection AI 把 DeepSeek、Kimi、GLM、Qwen 等明确列为对标对象,被外界解读为西方开发者社区期待已久的一个"开源答案"。
不过,有几个关键问题目前仍无公开答案:Beam 将采用何种开放许可条款、是否附带商用限制、具体部署成本与硬件门槛如何,以及权重开放后的实际可用性,这些在现有报道中均未明确披露。在模型权重真正放出、第三方独立评测跟进之前,上述厂商表述仍需保持审慎看待。
软盟资讯观察
从趋势看,Beam 的意义不只是又多了一款大模型,而是把"稀疏激活换低成本"这条路线摆到了开放权重竞争的台面上。当总参数继续膨胀而企业更在意单位任务的推理开销时,激活参数占比、而非总参数的绝对值,正越来越成为衡量一款模型是否"好用、用得起"的现实指标,这对下游编程与智能体创业公司是实打实的成本信号。
从机会与风险看,开放权重若如期放出,中小团队有望以更低门槛搭建自有代码与智能体能力,减少对闭源 API 的依赖;但真正的变量在于许可条款与部署成本是否友好,以及厂商自测成绩能否经受独立评测检验。
需要冷思考的是,本篇所引的性能、效率与基准数据几乎全部来自厂商口径,"追平 GLM‑5.2""逼近 Qwen3.8‑Max"目前仍是宣称而非结论。建议开发者与企业管理者先把 Beam 列入观察名单,待权重开放、第三方跑分与真实部署反馈出炉后再做选型判断。
