高效多模态和多语言编码器 NeoMME
我们介绍了NeoMME,这是一种260M和800M参数的高效多模态和多语言编码器。与许多生成式视觉语言模型不同,NeoMME不依赖于单独预训练的视觉塔或因果语言模型。一个双向Transformer同时处理文本标记和原始图像补丁,并且整个模型从头开始训练,采用掩码离散扩散目标函数。在ColPali的页面图像方法下,我们对NeoMME进行了微调以实现视觉文档检索。NeoMME-Retriever可以在一次前向传递中返回密集和后期交互嵌入。两种模型大小都在ViDoRe v3 Pareto前沿上,在nDCG@10和模型大小方面表现优异。在NVIDIA L40S GPU上的2048×2048图像输入尺寸下,260M模型每秒可以编码大约51页,约为ColModernVBERT的吞吐量两倍。通过分层令牌池化和非对称量化,后期交互索引存储从约1.5MB减少到每页6kB(缩小了255倍),同时保留超过95%的基础nDCG@10。
