톰슨로이터, 자체 대형언어모델 '톰슨' 공개
최근 30일 조회수 — 좋아요 —핵심 요약
톰슨로이터가 4천만 달러를 투자해 자체 개발한 법률 특화 대형언어모델 '톰슨'을 공개하고 코카운슬 리걸에 우선 적용한다고 밝혔다.
톰슨로이터가 자체 개발한 대형언어모델 ‘톰슨(Thomson)‘을 공개했다. 8월 24일(현지시간) 캐나다 토론토에서 낸 보도자료에 따르면, 톰슨은 오픈소스 기반 모델에서 출발해 톰슨로이터가 인재와 컴퓨팅 자원을 포함해 4천만 달러를 투자해 훈련한 결과물이다. 회사는 이 모델의 소유권과 통제권을 전적으로 갖고 있으며, 일반적인 프론티어 모델 대비 추론 비용도 크게 낮췄다고 밝혔다.1
톰슨로이터는 로펌·회계·세무 전문가를 대상으로 한 콘텐츠 기업으로, 웨스트로(Westlaw), 프랙티컬 로(Practical Law), 체크포인트(Checkpoint), 로이터(Reuters) 등 수십 년간 축적한 독점 콘텐츠를 미드트레이닝·포스트트레이닝 단계에 투입했다. 여기에 수백 명의 도메인 전문가가 훈련 목표 설계부터 최종 평가까지 참여했다고 회사 측은 설명했다. 조엘 흐론(Joel Hron) 최고기술책임자는 “AI 업계는 그동안 규모를 답으로 여겨왔지만, 톰슨은 강력한 기반 모델에서 출발해 중요한 업무에 깊이 특화시키는 다른 경로를 보여준다”고 말했다.
스티브 하스커(Steve Hasker) 최고경영자는 초기 평가에서 톰슨이 여러 과제에서 최신 프론티어 모델과 대등한 수준을 보였다고 밝혔다. 톰슨은 우선 법률 AI 서비스 ‘코카운슬 리걸(CoCounsel Legal)‘에 투입되며, 이후 주권형 AI(sovereign AI) 옵션을 포함한 기능을 확대할 계획이다. 다만 현재까지 이 모델을 훈련한 데이터는 톰슨로이터가 보유한 전체 콘텐츠의 10%에도 못 미친다. 회사는 다음 단계가 단순히 데이터를 더 넣는 것이 아니라, 독점 콘텐츠와 편집 전문성을 바탕으로 한 새로운 형태의 특화와 이해를 발굴하는 작업이라고 설명했다.
AI 주권 문제
보도자료는 이번 발표를 AI 주권 논의와 연결짓는다. 어떻게 훈련됐는지, 모델 안에 어떤 편향이 있는지, 어디서 구동되는지, 정보 프라이버시는 어떻게 보호되는지를 전문가들이 점점 더 따져 묻고 있다는 것이다. 톰슨은 이런 질문에 제3자를 거치지 않고 직접 답하는 쪽으로 톰슨로이터가 방향을 튼 것이라고 회사는 밝혔다.
회사에 따르면 톰슨은 기반 모델 대비 복잡한 다단계 지시를 정확히 수행하는 능력(instruction following)에서 향상을 보였고, 밀도 높은 도메인 특화 콘텐츠를 다루는 추론 능력에서는 더 큰 향상을 보였다. 또 웨스트로, 프랙티컬 로 같은 자체 도구와 함께 훈련해 정교함을 더했다고 설명했다. 톰슨로이터는 이 결과가 “적절한 콘텐츠에 대한 접근권만 있으면 범용 모델도 전문가 수준 성능을 낼 수 있다”는 통념에 반한다고 주장했다. 다만 이 같은 성능 비교 수치나 평가 방법의 세부 내용은 보도자료에 공개되지 않았다.
Footnotes
-
Hacker News(원문: 톰슨로이터 보도자료), “Thomson Reuters Leverages its World-Class Data Assets to Launch Its Own Frontier Model” ↩
읽기 목록은 이 브라우저에 저장됩니다.
출처
- Thomson Reuters Leverages its World-Class Data Assets to Launch Its Own Frontier Model — Hacker News
이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.