NVIDIA, 3D CT 판독 오픈소스 VLM 'NV-Reason-CT' 공개
최근 30일 조회수 — 좋아요 —핵심 요약
NVIDIA가 흉부·복부 3D CT 영상을 3차원 그대로 처리해 구조화 보고서와 단계별 추론을 제공하는 오픈소스 시각언어모델 NV-Reason-CT를 공개했다.
NVIDIA가 3D CT(전산화단층촬영) 영상을 대상으로 방사선과 전문의의 판독 과정을 따라 하는 오픈소스 시각언어모델(VLM) NV-Reason-CT를 9월 23일 공개했다. NVIDIA 테크니컬 블로그에 따르면 이 모델은 흉부와 복부 CT를 대상으로 구조화된 판독 보고서를 만들고, 단계별 사고 과정(chain-of-thought)을 재현하며, 소견을 두고 후속 질문을 주고받는 다중 대화까지 지원한다.
이번 공개는 흉부 X선, 병리 슬라이드 등 2D 영상 판독 AI가 빠르게 발전한 것과 달리 3D CT가 상대적으로 소외돼 왔다는 문제의식에서 출발한다. 복부 CT 한 건은 300~600장의 축상면(axial) 슬라이스로 구성되는데, 기존 범용 VLM은 이를 독립된 2D 이미지 묶음으로 처리해 슬라이스 간 공간적 연속성을 놓친다. 종양이나 흉수, 침윤 같은 소견은 3차원에서 형태와 범위, 밀도가 함께 드러나야 임상적 의미를 가지는데, 2D 인코더 방식으로는 이런 구조를 온전히 복원할 수 없다는 것이다.
NVIDIA는 이 문제를 슬라이스별 처리가 아닌 진짜 3D 입력을 다루는 방식으로 풀었다. NV-Reason-CT는 전용 3D 비전 트랜스포머(ViT) 인코더와 언어모델을 결합해, CT 볼륨을 하나의 3차원 입력으로 처리한다. 이를 통해 슬라이스 사이의 해부학적 연속성을 유지하고, 방사선과 의사가 스크롤하며 판독하듯 구조물을 전체적으로 파악하도록 설계했다.
모델의 핵심 기능은 크게 두 가지다. 하나는 구조화된 보고서 생성으로, NVIDIA 연구팀이 흉부 30종·복부 29종의 이상 소견을 정리한 CT 온톨로지를 만들어 모델 학습과 평가에 활용했다. 폐결절, 기흉, 간 병변, 신장 낭종 등이 이 목록에 포함되며, 결과물은 임상 문서화 작업 흐름에 바로 들어맞는 형식으로 출력된다. 다른 하나는 방사선과 의사의 사고를 흉내 낸 단계별 추론이다. 모델은 해부학적 영역을 체계적으로 훑으며 관련 소견을 짚어내고, 감별 진단을 검토하고, 불확실성을 언어로 표현하는 과정을 거친다.
NVIDIA는 이 방법론이 앞서 내놓은 흉부 X선용 모델 NV-Reason-CXR의 추론 방식을 확장한 것이라고 설명한다. NV-Reason-CXR은 다수 판독의가 참여한 임상 연구에서 진단 정확도를 유지하면서 판독 시간을 줄인 것으로 확인됐고, 이 결과는 2026년 북미영상의학회(RSNA) 학술대회 발표로 채택됐다고 밝혔다.
다만 NVIDIA는 NV-Reason-CT를 자율 진단 시스템이나 임상 승인을 받은 제품이 아니라고 명확히 선을 그었다. 연구자와 개발자가 특정 용도에 맞춰 추가 학습(post-train)해 사용하는 오픈 연구·개발용 기반 모델로 제공한다는 것이다. 실제 임상 현장에 적용되기까지는 규제 승인과 별도의 검증 절차가 필요하다는 뜻으로 읽힌다.
읽기 목록은 이 브라우저에 저장됩니다.
출처
- Introducing NV-Reason-CT Open 3D CT VLM for Radiologist Chain-of-Thought Reasoning | NVIDIA Technical Blog — NVIDIA Technical Blog
이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.