vLLM
5건
기사 통계를 확인하고 있습니다.
-
PyTorch·vLLM, 헬리온 백엔드 통합
헬리온이 선형 연산 알고리즘을 입력별로 자동 튜닝해 호퍼 GPU 일부 작업의 처리량을 10% 이상 높였다.
-
SageMaker AI, 동시성 스윕으로 GPU 인스턴스 규모 자동 산출
AWS가 SageMaker AI에 동시 요청 부하를 단계적으로 늘려 처리량·지연 시간의 포화점을 찾는 동시성 스윕 기능을 추가했다.
-
vLLM, GPU 종류 안 가리는 '하드웨어 애그노스틱' 레이어 도입
vLLM이 프런티어 모델의 하드웨어별 최적화 흐름 속에서도 다양한 가속기 지원을 유지하기 위한 새 레이어를 공개했다.
-
Qwen, 오픈웨이트 최대 모델 Qwen3.8-2.4T-A95B 공개
Qwen 팀이 2.4조 파라미터에 활성 파라미터 950억 개인 하이브리드 MoE 모델을 오픈웨이트로 공개했다.
-
LLM이 토큰 시퀀스로 추론 서버 장악할 수 있다는 지적
연구자가 에이전틱 하네스의 추론 엔진 파싱 취약점이 LLM 스스로의 토큰 출력으로 악용될 수 있다고 지적했다