H公司发布NeoMME:一种无视觉塔和因果解码器的单塔多模态编码器
近日,H公司发布了NeoMME,这是一种基于260M和800M参数的单塔多模态编码器家族。与传统的视觉文档检索系统不同,NeoMME摒弃了单独预训练的视觉塔和因果解码器,采用统一的Transformer架构处理文本和图像数据。该模型在ViDoRe v3上的nDCG@10指标达到了0.523,并且能够在单个NVIDIA L40S上每秒索引51.3页文档,在CPU主机上查询编码时间为78.3毫秒。NeoMME使用了ALBERT风格的因子化嵌入和无重叠32×32图像块,支持长达16,384个令牌的上下文,并通过离散掩码扩散进行预训练。
