검증 가능한 프라이버시 보장 LLM 위임추론 기법 'Maverick' 공개

2분 LLM프라이버시암호학적 검증오픈소스
최근 30일 조회수 — 좋아요 —

핵심 요약

오픈소스 LLM 추론을 외부 서버에 맡기면서도 입력을 숨기고 결과 정확성까지 암호학적으로 검증하는 기법 Maverick이 공개됐다.

오픈소스 대규모언어모델(LLM)을 외부 서버에 맡겨 추론시키면서도 입력값을 노출하지 않고, 결과가 정확하다는 것까지 암호학적으로 증명받을 수 있는 새로운 기법이 공개됐다. 연구진은 이 기법을 ‘Maverick’이라 이름 붙이고, 지난 9일 arXiv에 논문을 게재했다1.

오픈소스 LLM은 폐쇄형 모델과 견줄 만한 성능을 내면서도 입력을 서비스 제공자에게 노출하지 않고 로컬에서 돌릴 수 있다는 장점이 있다. 문제는 대규모 모델을 로컬에서 구동하려면 상당한 연산 자원이 필요하다는 점이다. 결국 사용자는 제3자 서버에 추론을 위탁하게 되는데, 이 과정에서 입력 데이터가 노출될 위험과 서버가 결과를 제대로 계산했는지 검증할 수 없다는 문제가 함께 생긴다. 논문에 따르면 기존에 이런 문제를 풀려던 방식들은 서버에 과도한 연산 부담을 지우거나, 추가적인 신뢰 가정을 요구하는 한계가 있었다.

Maverick은 LLM 연산의 대부분을 차지하는 행렬-벡터 곱셈(matrix-vector multiplication) 위임 프로토콜을 핵심으로 삼는다. 연구진은 이 프로토콜이 투명한 사전처리(transparent preprocessing)와 효율적인 배치 검증(batch verification)을 지원하면서도 서버 측 추가 연산 부담이 사실상 없는, 정보이론적으로 안전한(information-theoretically sound) 검증 방식으로는 처음이라고 설명한다. 여기에 LPN(Learning Parity with Noise) 기반의 의사난수 마스킹(pseudorandom masking)을 결합해 입력값 프라이버시를 보장한다.

연구진은 이 위임 프로토콜을 실제로 구현하고, Qwen3-4B 모델에서 초당 토큰 처리량(throughput)을 측정해 end-to-end 프로토타입을 평가했다. 클라이언트 스레드는 1개에서 8개까지, 서버는 CPU 128스레드까지 구성해 실험했다. 클라이언트 스레드 1개 기준으로 로컬 추론 대비 처리량 향상 폭은 프라이버시 마스크를 온라인으로 생성할 때 최대 17배, 마스크를 미리 계산해둘 때 최대 45배, 검증만 수행할 때 최대 44배로 나타났다. 클라이언트 스레드를 4개로 늘리면 같은 세 조건에서 각각 13배, 18배, 17배로 향상 폭이 줄었다. 서버 연산이 병목이 아닌 상황을 가정해 네트워크 지연을 시뮬레이션한 클라이언트 측 마이크로벤치마크에서는 각각 1220배, 34135배, 38~157배의 속도 향상이 관측됐다.

이는 Maverick이 저사양 클라이언트 환경에서 특히 유효한 기법임을 시사하지만, 논문 초록에는 실제 서비스 환경에서의 비용이나 네트워크 조건에 따른 변동성에 대한 언급은 없다. 코드 공개 여부나 다른 모델군에 대한 검증 결과도 초록만으로는 확인되지 않는다.

Footnotes

  1. arXiv, “Maverick: Private and Verifiable LLM Inference Made Practical via Matrix-Vector Multiplication Delegation” ↩

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. Maverick: Private and Verifiable LLM Inference Made Practical via Matrix-Vector Multiplication Delegation — arXiv (cs.AI/cs.CL/cs.LG)

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.