德国 Soofi S 30B 开源模型发布:全栈本土训练,英德双语 benchmark 领先
7 月 13 日,德国研究联盟 Soofi Project 正式发布 Soofi S 30B-A3B,并随后在 Hugging Face 上开放 beta 权重。这是少数完全在欧洲本土训练完成的大规模语言模型:全部 27 万亿 token 的训练跑在慕尼黑 Deutsche Telekom 工业 AI 云上,硬件、数据与算力链均留在德国境内。
Soofi S 采用 MoE(Mixture-of-Experts)架构,总参数量 316 亿,但每 token 仅激活约 32 亿参数,实际推理成本接近 3B 级模型。其架构直接复用 Nvidia Nemotron 3 Nano 的混合设计(Mamba-2 层 + 标准注意力层),并训练了长达 100 万 token 的长上下文能力。训练数据分三阶段:第一阶段约 20 万亿 token 学习语言基础;第二阶段 6 万亿高质量 token 精炼;第三阶段用超长文档扩展上下文。德语比例被刻意提高——第一阶段占 7.2%,第二阶段升至 15.3%,显著高于常见开源配方。
官方与 The Decoder 报道均强调,Soofi S 在英德双语开源基准上领先同尺寸全开放模型。不过发布后也有争议:批评者认为其参数/数据比例远高于经典 Chinchilla 定律的「甜点」,质疑是否过度训练;项目方回应称传统 dense 模型缩放律并不直接适用于 MoE 架构,并引用了新的 MoE 缩放研究作为反驳。
对中文用户而言,Soofi S 的意义更多在于「开源模型的地域多样性」:它证明了欧洲本土算力与数据可以支撑一线开源模型训练,也为德语区企业和研究者提供了一个可私有化部署的旗舰选择。当前 beta 权重与预训练技术报告已在 Hugging Face 发布,稳定版与 API 服务时间表尚待官方公布。


