英伟达支持的Reflection发布5010亿参数开放权重模型Beam,主打高效率
在高效开放权重模型领域,西方AI实验室正试图与中国的深度求索和智谱展开竞争。获英伟达支持的Reflection推出了名为Beam的稀疏混合专家模型,总参数量5010亿,每次仅激活230亿参数。据报道,Reflection使用10500块GB300 GPU、每天运行4640万个沙盒,历时4周训练该模型。Reflection称,Beam的效率是GLM 5.2的3至4倍,比领先的西方开放模型高出4倍以上,在编程和智能体任务上推进了西方开放模型前沿,模型从零开始端到端训练,完整权重将于本月发布。混合专家架构可比作一个拥有大量专业厨师的大厨房,模型只在需要时调用相应的专家,例如制作舒芙蕾时只启用甜点专家。AI模型由一系列Transformer模块构成,其中注意力层负责分析句中词语之间的关联,并以KV缓存形式保存这些信息,上下文越长,KV缓存越大;前馈网络则以权重形式存储模型知识,用于理解每个词的含义。为控制KV缓存规模并提升效率,Beam采用了多项技术。一是均衡使用专家,让各专家承担大致相同的工作量,据Reflection介绍,Beam最繁忙的专家负载仅为平均水平的1.04倍。二是基于深度的残差缩放与受控残差流:模型处理token时需经过数十个连续层,各子层输出不断累加,模型规模很大时容易导致激活值急剧增长和数值异常,造成信号失真或训练不稳定;Beam通过缩放因子,随token深入网络逐步减弱各子层输出的幅度,使信息流动更加稳定可控。
