삼성전자, LPDDR5X에 연산 유닛 내장한 PIM 칩 공개
최근 30일 조회수 — 좋아요 —핵심 요약
삼성전자가 Hot Chips 2026에서 LPDDR5X 메모리 뱅크마다 MAC 연산 블록을 붙여 대역폭을 8배로 늘린 PIM 칩을 선보였다.
삼성전자가 Hot Chips 2026에서 LPDDR5X 메모리 내부에 연산 유닛을 심은 프로세싱-인-메모리(PIM, Processing-in-Memory) 칩을 공개했다. 칩스앤치즈(Chips and Cheese)에 따르면 이 칩은 겉보기에는 일반 LPDDR5X-9600과 다르지 않고 표준 메모리 컨트롤러와도 호환되지만, 내부의 16개 뱅크마다 곱셈누산(MAC) 연산 블록을 붙여 메모리 대역폭을 그대로 연산에 활용하도록 설계됐다.1
메모리 내부 연산이라는 발상 자체는 새롭지 않다. D램은 내부적으로 여러 뱅크로 나뉘어 각자 읽기·쓰기 로직을 갖고 있지만, 외부로 나가는 데이터는 결국 하나의 인터페이스를 거치기 때문에 대역폭이 그 병목에 갇힌다. 일반적인 D램 접근은 최대 두 개 뱅크를 병렬로 쓸 수 있어 76.8GB/s에 그치는 반면, 삼성이 각 뱅크에 붙인 PIM 블록은 외부 버스를 거치지 않고 자신이 담당하는 뱅크에 직접 접근한다. 16개 뱅크의 PIM 블록을 모두 가동하면 614GB/s를 낼 수 있다는 게 삼성 측 설명이다. 같은 칩에서 대역폭이 8배가량 커지는 셈이다.
PIM 블록 내부는 MAC 트리와 레지스터 파일, 제어 로직으로 구성된다. 64개의 16비트 명령을 담는 1024비트 명령 레지스터 파일, 활성화 벡터를 위한 4킬로비트 소스 레지스터 파일, 스케일 팩터를 담는 2킬로비트 레지스터가 있다. 모델 가중치는 소프트웨어가 미리 D램에 적재해 두고, MAC 연산의 두 번째 피연산자로 이 D램 블록이 값을 공급하는 구조다.
연산 성능은 정밀도에 따라 달라진다. 각 PIM 블록의 MAC 배열은 데이터 클록당 4회, 즉 더블데이터레이트를 빼면 사이클당 8회의 INT8 또는 FP8 MAC 연산을 처리할 수 있고, 4비트 가중치를 쓰면 처리량이 두 배로 늘어 패키지 전체로는 2.4TOPS에 이른다. 칩 하나의 수치로는 크지 않지만, 여러 칩을 묶으면 합산 성능이 늘어난다. 예컨대 LPDDR5X 칩 8개를 묶으면 9.6 INT8 TOPS로 인텔 미티어레이크(Meteor Lake) NPU와 비슷한 수준이 되는데, 이 경우 16GB 칩 8개가 필요해 시스템 메모리 용량이 128GB에 달하는 만큼 비용 부담도 커진다.
이 칩의 특징은 표준 LPDDR5X 프로토콜을 벗어나지 않으면서 규격에 없는 연산 기능을 노출한다는 점이다. 삼성은 특정 로우(row) 주소를 일종의 MMIO 주소처럼 예약해 이를 구현했다. 각 채널에는 모드 제어용으로 정해진 로우 한 쌍이 있어, 하나를 활성화하면 단일 뱅크 모드로, 다른 하나를 활성화하면 16개 뱅크를 모두 쓰는 멀티 뱅크 모드로 전환된다. 뱅크별로 지정된 특수 로우를 활성화하면 읽기·쓰기 명령이 일반 D램 뱅크 내용이 아니라 PIM 레지스터에 접근하는 방식으로 바뀐다.
삼성이 그리는 사용 흐름은 이렇다. 먼저 단일 뱅크 모드에서 모델 가중치를 D램에 적재한 뒤, 멀티 뱅크 모드로 전환하고 PIM 레지스터 활성화 모드로 들어간다. 이 상태에서 소프트웨어가 활성화 값을 소스 레지스터에, 스케일 팩터를 스케일 레지스터에 쓰고 연산 종류를 명령 레지스터에 채워 넣으면, 멀티 뱅크 모드 특성상 이 레지스터 쓰기가 16개 뱅크 전체에 동시에 전파돼 병렬 연산이 이뤄진다.
Footnotes
-
Hacker News(원문 Chips and Cheese), “Hot Chips 2026: Samsung’s Processing-in-Memory (PIM)” ↩
읽기 목록은 이 브라우저에 저장됩니다.
출처
- Hot Chips 2026: Samsung’s Processing-in-Memory (PIM) — Hacker News
이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.