코히어, 문서 구조화 추출 모델 'Parse 5' 정식 출시

2분 CohereParse 5멀티모달문서추출
최근 30일 조회수 — 좋아요 —

핵심 요약

코히어가 표·이미지 혼재 문서를 좌표 정보와 함께 마크다운으로 변환하는 23억 파라미터 비전언어모델 Parse 5를 공개했다.

코히어(Cohere)가 복합 문서에서 구조화 데이터를 추출하는 멀티모달 파운데이션 모델 ‘Parse 5’(parse-v5.0)를 8월 27일 정식 출시했다. InfoQ에 따르면 이 모델은 재무보고서나 논문처럼 표와 이미지가 뒤섞인 PDF를 깔끔한 마크다운으로 변환하면서, 각 요소의 좌표값(bounding box)까지 함께 제공해 원본 문서와 추출 결과를 시각적으로 대조할 수 있게 한다.

Parse 5는 23억 개 매개변수를 가진 비전 언어 모델(VLM)로, 코히어 랩스의 오픈 웨이트 아키텍처 ‘North-Micro-Vision-Instruct’를 기반으로 만들어졌다. 문서 이미지를 처리하는 부분은 SigLIP 2 SO400M에서 초기화한 4억 매개변수급 비전 인코더가 맡는데, 2D RoPE(회전 위치 임베딩)와 1D 위치 임베딩을 함께 써서 문서의 공간 구조를 유지한다. 여기서 뽑아낸 시각 특징은 별도의 프로젝터를 거쳐 언어 모델의 임베딩 공간으로 전달된다.

추론을 담당하는 언어 모델은 코히어의 Command A+ 아키텍처를 기반으로 한 20억 매개변수급 자체 모델 ‘North Micro LLM’이다. 두 모델을 잇는 방식으로는 ‘DeepStack’이라 부르는 통합 기법을 쓰는데, 비전 인코더 여러 층에서 나온 패치 임베딩을 언어 모델의 초기 층에 주입해 다양한 추상화 수준의 시각 정보를 함께 활용하도록 했다. 컨텍스트 윈도우는 8K 토큰으로, 텍스트와 이미지 입력을 동시에 받아들인다. 코히어는 이런 구조로 마크다운을 직접 출력하게 함으로써, 규칙 기반 OCR 파이프라인 특유의 취약함을 없앨 수 있다고 설명한다.

성능은 자체 벤치마크인 ParseBench로 검증했다. 보험·금융·정부 문서 2000여 페이지를 사람이 직접 검증해 만든 이 벤치마크는 표 추출, 내용 충실도, 형식의 의미적 정합성 등 실제 운영 환경에서 파서가 자주 실패하는 지점을 테스트한다. Parse 5는 이 세 항목 평균 79.2점을 기록했다. 같은 벤치마크에서 프리미엄 구성인 LlamaParse Agentic Plus가 90.20점으로 1위를 지키고 있어 격차가 있지만, Mistral OCR이나 구글 Gemini 3 Flash(Thinking High, 75.05점) 같은 다른 경쟁 모델은 앞섰다.

바운딩 박스 좌표를 마크다운과 함께 제공하는 점은 규제 산업에서 특히 의미가 있다. 추출된 데이터를 원본 문서의 정확한 위치로 되짚을 수 있어야 감사 추적이 가능한데, Parse 5는 이 요구를 API 응답 자체에 담아낸다. API는 cohere.ClientV2를 통한 Python SDK나 REST 엔드포인트로 호출할 수 있고, 코히어 자체 플랫폼 외에 마이크로소프트 애저 AI 파운드리, AWS 세이지메이커에서도 제공돼 RAG(검색증강생성)나 에이전트 시스템을 구축하는 팀이 별도 인프라 전환 없이 통합할 수 있다.

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. Cohere’s Parse 5 Promises Efficient Multi-Modal Information Extraction from Complex Documents — InfoQ

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.