MoE
4건
기사 통계를 확인하고 있습니다.
-
SageMaker AI, 동시성 스윕으로 GPU 인스턴스 규모 자동 산출
AWS가 SageMaker AI에 동시 요청 부하를 단계적으로 늘려 처리량·지연 시간의 포화점을 찾는 동시성 스윕 기능을 추가했다.
-
NVIDIA, JAX용 Transformer Engine으로 드롭리스 MoE 학습 10배 가속
NVIDIA가 JAX Transformer Engine 커널 최적화로 DeepSeek-V3 MoE 학습의 GPU당 처리량을 10.4배 높였다고 밝혔다.
-
Qwen, 오픈웨이트 최대 모델 Qwen3.8-2.4T-A95B 공개
Qwen 팀이 2.4조 파라미터에 활성 파라미터 950억 개인 하이브리드 MoE 모델을 오픈웨이트로 공개했다.
-
버클리·MIT, 소비자 GPU용 MoE 추론 엔진 FreeToken 공개
UC버클리·MIT 연구진이 동적 스케줄링으로 소비자 하드웨어에서 프런티어급 MoE 모델을 구동하는 오픈소스 추론 엔진 FreeToken을 발표했다.