GLM-5.3-Flash与Qwen3.8-Flash-Next:两家中国AI实验室独立研发出相似架构模型
近日,Z.ai公司发布了GLM-5.3-Flash,这是一个具有180亿活跃参数的多模态MoE模型。同一天,阿里巴巴Qwen团队推出了Qwen3.8-Flash-Next,该模型拥有60亿活跃参数,并预览了即将推出的Qwen4架构。尽管两家公司独立设计这些系统,但它们的设计方案非常相似:都采用了线性与全注意力相结合的混合模式,使用压缩索引器选择上下文并限制在2048个令牌内,同时将残差流扩展为四个门控分支,并且均采用Muon优化器进行训练。GLM-5.3-Flash是GLM-5系列中的首个原生多模态模型,在Hugging Face上以MIT许可证发布。Qwen3.8-Flash-Next则是一个早期的公开预览版本,展示了下一代架构家族的设计理念、效率和训练稳定性。
