[모델]H사, 단일 타워 멀티모달 인코더 'NeoMME' 공개
H사가 별도의 비전 타워와 인과적 디코더를 없앤 멀티모달 양방향 인코더 'NeoMME' 제품군을 공개했습니다. 260M과 800M 크기로 제공되며, 단일 트랜스포머 구조로 다국어 텍스트와 원본 이미지 패치를 함께 처리합니다. 높은 인덱스 압축률과 빠른 색인 속도를 확보하면서도 준수한 검색 성능을 보여줍니다.
전문 읽기접기
무슨 일이야
H사가 260M과 800M 파라미터 크기의 양방향 인코더 제품군인 'NeoMME'를 선보였습니다. ColPali 스타일의 검색 모델과 달리, 사전 학습된 비전 타워나 인과적(Causal) 디코더를 전혀 사용하지 않는 단일 트랜스포머(Single-Tower) 아키텍처를 채택했습니다. 다국어 텍스트 토큰과 원본 32×32 이미지 패치를 한 모델 안에서 바로 처리하는 방식입니다.
학습에는 마스크 기반 이산 확산(masked discrete-diffusion) 사전 학습 목적 함수를 활용했습니다. 검색을 위해 조밀(dense) 검색 헤드와 후기 상호작용(late-interaction) 검색 헤드를 모두 갖춘 듀얼 구조로 설계되었습니다.
성능 면에서는 260M 모델이 ViDoRe v3 벤치마크에서 nDCG@10 기준 0.523을 기록했습니다. 효율성 측면에서도 255배의 인덱스 압축률을 보였으며, 단일 L40S GPU 환경에서 초당 51.3페이지의 색인 처리량을 달성했습니다.
왜 중요해
멀티모달 문서 검색(VQA, 멀티모달 RAG 등) 파이프라인에서 비전 타워와 LLM 디코더를 모두 얹는 무거운 구성 대신, 가벼운 단일 인코더로도 실용적인 성능을 낼 수 있음을 보여줍니다. 인덱스 크기를 대폭 줄이고 단일 GPU에서 높은 색인 속도를 낼 수 있어, 대규모 멀티모달 검색 시스템의 인프라 구축 및 운영 비용을 크게 낮출 가능성이 있습니다.
짚고 넘어갈 점
연구진은 이번 모델이 멀티모달 검색에서는 효율적인 성과를 냈으나, 순수 텍스트 검색 영역에서는 여전히 성능 격차가 존재한다는 점을 인정했습니다. 텍스트 중심 검색 작업까지 완전히 대체할 수 있을지는 향후 개선 여부를 지켜봐야 합니다.
참고: MarkTechPost
댓글 0
첫 댓글을 남겨보세요.