Hugging Face Blog · EUA
NeoMME é um codificador multimodal nativo e multilíngue eficiente
A Hugging Face apresentou o NeoMME, uma família de encoders multimodais e multilíngues com versões de 260M e 800M de parâmetros. Treinado do zero, o modelo usa um único Transformer bidirecional para processar tokens de texto e patches de imagem, sem torre de visão ou decoder de linguagem pré-treinados. O pré-treinamento combina texto, código, matemática, imagens naturais e documentos, com um objetivo de difusão discreta e mascaramento de texto. Os modelos têm contexto de 16.384 tokens e suportam resolução dinâmica de imagens.
A versão NeoMME-Retriever foi ajustada para busca visual de documentos e produz embeddings densos e de late interaction em uma única passagem. No ViDoRe v3, os modelos de 260M e 800M alcançaram nDCG@10 de 0,523 e 0,556, respectivamente, com desempenho de ponta em relação ao tamanho. A publicação também descreve técnicas de pooling hierárquico e quantização assimétrica que reduziram o armazenamento por página de cerca de 1,5 MB para 6 kB, mantendo mais de 95% da qualidade de recuperação. O NeoMME está disponível no Hugging Face Transformers, com checkpoints sob a licença Apache 2.0.
Compartilhar esta notícia