[모델]Jina AI, 문서 파싱용 3.4B MoE 모델 jina-ocr-v1 공개
Jina AI가 PDF와 스캔본, 표, 차트 등을 마크다운으로 변환해 주는 비주얼 문서 파서 'jina-ocr-v1'을 출시했습니다. 총 3.4B 파라미터 규모의 MoE 구조로 토큰당 활성 파라미터는 약 570M에 불과하며, 투기적 디코딩을 내장해 처리 효율을 끌어올렸습니다.
전문 읽기접기
무슨 일이야
Jina AI가 문서 파싱에 특화된 비주얼 언어 모델 'jina-ocr-v1'을 선보였습니다. 이 모델은 PDF나 스캔 문서, 표, 차트, 영수증 같은 다양한 시각 자료를 구조화된 마크다운 형태로 변환해 주는 역할을 합니다.
기반 모델은 DeepSeek-OCR이며, 총 3.4B 파라미터 중 토큰당 약 570M만 활성화되는 MoE(혼합 전문가) 구조를 채택했습니다. 여기에 내장된 FastMTP 투기적 디코딩(speculative decoding) 헤드가 스텝당 3개의 토큰을 생성해 품질 손실 없이 빠른 속도를 냅니다. A100 GPU 1대 기준 초당 2.57페이지를 파싱할 수 있습니다.
성능 평가에서는 OmniDocBench v1.6에서 91.14점, olmOCR-Bench에서 83.4점을 기록했습니다. 현재 모델 가중치는 허깅페이스에 공개되었으며, Jina Reader 서비스를 통해서도 바로 사용할 수 있습니다.
왜 중요해
저사양 GPU 환경에서도 문서 파싱 파이프라인을 효율적으로 돌릴 수 있는 선택지가 생겼습니다. 토큰당 활성 파라미터가 570M 수준으로 작고 투기적 디코딩까지 내장되어 있어, RAG 시스템 구축 시 대량의 비정형 문서를 마크다운으로 전처리하는 비용을 크게 줄일 수 있을 것으로 보입니다.
짚고 넘어갈 점
허깅페이스에 공개된 모델 가중치의 라이선스가 CC BY-NC 4.0으로 지정되어 있어, 상업적 용도로 모델을 자체 호스팅해 활용하려는 기업이나 개발자는 사용 제한을 확인해야 합니다.
참고: MarkTechPost
댓글 0
첫 댓글을 남겨보세요.