인셉션랩스, 확산 LLM '머큐리 2.5' 공개…지능 40% 향상
최근 30일 조회수 — 좋아요 —핵심 요약
인셉션랩스가 확산 방식 LLM 머큐리 2.5를 출시해 전작 대비 지능 40% 향상과 초당 1,107토큰 처리 속도를 달성했다고 밝혔다.
인셉션랩스(Inception Labs)가 확산(diffusion) 방식 대규모 언어모델 ‘머큐리 2.5(Mercury 2.5)‘를 공개했다. 회사가 자체 발표한 내용에 따르면 지금까지 학습된 확산 언어모델 중 최대 규모로, 전작 ‘머큐리 2’ 대비 지능 지표가 40% 올랐다. 인셉션랩스는 이 수치가 GPT-5.6 루나(Low), 제미나이 3.5 플래시-라이트, 클로드 하이쿠 4.5 같은 비용 최적화형 프런티어 모델과 비슷한 수준이라고 밝혔다.
확산 LLM은 기존 트랜스포머 기반 모델이 토큰을 순서대로 하나씩 생성하는 것과 달리 여러 토큰을 병렬로 다듬어가며 문장을 완성하는 방식이다. 인셉션랩스는 이 구조 덕분에 머큐리 2.5가 널리 쓰이는 엔비디아 GPU에서 초당 1,107토큰을 처리한다고 설명했다. 컨텍스트 길이는 26만 토큰이며, 가격은 입력 100만 토큰당 0.20달러, 출력 100만 토큰당 0.75달러로 책정됐다. 출시 시점에는 80% 할인가로 입력 0.04달러, 출력 0.15달러에 제공된다. 튜닝 가능한 추론 강도, 병렬 도구 호출, 스키마 정렬 JSON 출력 기능도 함께 지원한다.
이번 발표에서 눈에 띄는 대목은 벤치마크가 아니라 실제 운영 사례다. 인셉션랩스는 머큐리 2 출시 이후 개발자 수천 명, 기업 수십 곳이 이 모델을 프로덕션에 적용했고 사용량이 10배 이상 늘었다고 밝혔다. 회사는 고객 피드백과 실제 장애 사례를 평가 기준에 반영해 머큐리 2.5 학습을 다듬었다고 설명했다.
전화 상담 AI 에이전트를 만드는 오픈콜(OpenCall)은 머큐리 도입 후 P99 응답 시간이 수 분에서 1초로, P50 응답 시간은 0.4초에서 0.2초 미만으로 줄었다고 밝혔다. 오픈콜 공동창업자이자 CEO인 올리버 실버스틴(Oliver Silverstein)은 “추론을 포함해도 우리가 본 어떤 공급사보다 훨씬 빠르다”고 말했다. 코딩 어시스턴트 업체 오그먼트 코드(Augment Code)는 컨텍스트 압축 작업에 머큐리를 적용해 지연 시간을 150초에서 27초로, 82% 줄였고 비용은 90% 절감했다고 밝혔다. 도구 검색 요약은 1초 안에 반환된다고 덧붙였다. 엔비디아 가속 컴퓨팅 그룹의 슈루티 코파카(Shruti Koparkar) 수석 프로덕트 매니저는 머큐리 2.5가 새로운 아키텍처가 얼마나 빠르게 프로덕션급 시스템으로 성숙할 수 있는지 보여준다고 말했다.
인셉션랩스는 머큐리 2.5와 함께 음성 특화 모델 ‘머큐리 보이스(Mercury Voice)‘와 프롬프트 라우팅 모델 ‘머큐리 라우터(Mercury Router)‘의 프리뷰도 공개했다. 머큐리 보이스는 첫 토큰 생성까지 걸리는 시간(TTFT)이 170밀리초 미만이라고 밝혔고, 머큐리 라우터는 확산 LLM으로 들어오는 프롬프트를 분석해 품질·속도·비용을 고려한 최적의 모델(오픈소스·상용 모델 포함)로 요청을 분배한다. 머큐리 모델군은 인셉션 API와 베이스텐(Baseten), 오픈라우터(OpenRouter)를 통해 이용할 수 있으며, 기업용으로는 전용 용량 할당과 자동 확장, 컴플라이언스 통제, 데이터 보관 설정 기능을 제공한다.
읽기 목록은 이 브라우저에 저장됩니다.
출처
- Introducing Mercury 2.5 – Inception — Hacker News
이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.