샤오미, MiMo-V2.6 RL 훈련 과정 실시간 공개

1분 XiaomiMiMo-V2.6오픈소스강화학습
최근 30일 조회수 — 좋아요 —

핵심 요약

샤오미가 MiMo-V2.6 모델의 강화학습 비용과 훈련 과정을 대시보드로 공개하며 개방성을 강조했다.

MiMo-V2.6 벤치마크나 파라미터 숫자보다 눈에 띄는 대목은 샤오미가 학습 과정 자체를 공개했다는 점이다.

샤오미는 9월 15일부터 닷새간 강화학습(RL) 훈련 과정을 대시보드를 통해 실시간으로 공개했다. 대시보드에는 소형 모델인 MiMo-V2.6-Flash의 RL 비용 85만 4044달러, 대형 모델 MiMo-V2.6-Pro의 RL 비용 262만 670달러가 표시됐으며, 합산하면 약 350만 달러다. 더뉴스택에 따르면 이 수치는 RL 단계 비용만 포함하며, 사전학습(pretraining) 비용은 공개되지 않았다.

RL 비용을 공개한 선례는 있지만 드물다. 2025년 미니맥스(MiniMax)는 4560억 파라미터 모델 MiniMax-M1의 RL 비용을 53만 4700달러로 밝혔고, 딥시크(DeepSeek)는 6710억 파라미터 R1의 RL 훈련 비용을 29만 4000달러로 공개한 바 있다. 다만 MiMo-V2.6-Pro는 두 모델보다 규모가 크고, RL 훈련이 더 길고 에이전트형(agentic)인 과제를 겨냥했다는 점에서 단순 비교에는 한계가 있다고 매체는 짚었다.

MiMo-V2.6은 두 가지 버전으로 나온다. 플래그십인 MiMo-V2.6-Pro는 총 파라미터 1조 개에 활성 파라미터 420억 개, 컨텍스트 윈도우 100만 토큰 규모이며 텍스트·이미지·오디오·비디오를 함께 처리하는 멀티모달 모델이다. 같은 날 공개된 GPT-6 Sol의 컨텍스트 윈도우는 105만 토큰, Claude Opus 5.5는 100만 토큰으로, 규모 면에서는 최상위권 모델들과 비슷한 선상에 있다. 다만 OpenAI와 Anthropic 모두 파라미터 수를 공개하지 않아 직접 비교는 어렵다.

성능 면에서 샤오미는 코딩, 에이전트 작업, 사이버보안, 멀티모달, 연구 영역에서 프런티어급 성능을 낸다고 주장한다. 독립 평가기관 Artificial Analysis는 MiMo-V2.6-Pro의 인텔리전스 지수를 46점으로 매기고, 자사가 추적하는 오픈웨이트 대형 모델 114개 중 1위로 평가했다.

딥시크 출신으로 샤오미 MiMo팀을 이끄는 푸리 루오(Fuli Luo)는 X를 통해, 팀이 약 6개월간 RL을 얼마나 밀어붙일 수 있는지 탐구했다고 밝혔다. 훈련량과 훈련 환경의 다양성, 에이전트 설정, 모델의 시도를 채점하는 데 들어간 자원을 계속 늘려온 과정이라는 설명이다. 루오는 "앞으로 몇 주에 걸쳐 세부 내용을 단계적으로 오픈소스로 공개하겠다"고 덧붙였다. 허깅페이스(Hugging Face) 공동창업자 겸 최고과학책임자 토마스 울프(Thomas Wolf)는 이에 "이 정도 규모의 훈련에서 보여준 개방성 수준이 인상적"이라고 X에 반응했다.

공개 범위도 넓다. 샤오미는 모델 가중치를 MIT 라이선스로 공개했고, 기술 보고서와 함께 추가 에이전트형 RL 연구의 출발점으로 삼을 수 있는 Qwen 기반 90억 파라미터 모델도 함께 내놓았다. 여기에 소프트웨어 엔지니어링, 취약점 재현, 지식 작업, 웹 개발 등에 걸친 7000개 이상의 과제 환경, 환경 상호작용부터 보상 평가·정책 최적화까지 아우르는 엔드투엔드 훈련 프레임워크, 경량 에이전트 도구까지 "완전히 오픈소스화"했다고 밝혔다.

[^1]: The New Stack, "Impressive level of openness": Xiaomi goes way beyond the usual open-weight playbook with MiMo-V2.6

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. "Impressive level of openness": Xiaomi goes way beyond the usual open-weight playbook with MiMo-V2.6 — The New Stack

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.