최신 LLM도 코드 기능·보안 격차 지속

2분 LLM코드 보안CWEval생성형 AI
최근 30일 조회수 — 좋아요 —

핵심 요약

32개 LLM을 비교한 결과 최신 모델은 대체로 안전해졌지만 기능 향상이 보안 향상을 보장하지는 않았다.

대규모 언어 모델(LLM)이 만든 코드의 기능과 보안을 장기간 비교한 연구가 공개됐다. 연구진이 7개 모델 계열의 LLM 32종을 분석한 결과, 최신 모델은 전반적으로 이전 모델보다 안전해졌지만 기능 테스트 통과율과 보안 테스트 통과율의 격차를 없앤 계열은 없었다. 모델을 바꿀 때 기능 향상이 곧 보안 향상으로 이어진다고 가정해서는 안 된다는 결론이다.1

연구진은 각 계열에서 3세대에 걸친 플래그십·경량 모델을 골랐다. 7개 계열 가운데 5개는 가중치를 공개한 오픈웨이트 모델이다. 평가는 코드 보안 벤치마크 CWEval의 119개 과제로 진행했으며, 5개 프로그래밍 언어와 31개 CWE(Common Weakness Enumeration·소프트웨어 취약점 유형)를 다뤘다. 여기서 ‘기능-보안 격차’는 기능 테스트는 통과하지만 보안 테스트에는 실패하는 코드를 뜻한다.1

결과는 앞선 연구와 일부 달랐다. 기존 종단 연구는 세 모델 계열을 분석해 “LLM은 더 똑똑해지지만 더 안전해지지는 않는다”고 결론 내렸고, 당시 포함된 유일한 오픈웨이트 계열은 보안 개선이 정체됐다. 반면 이번 연구에서는 조사한 모든 오픈웨이트 계열이 기능-보안 격차를 유의미하게 줄였다. 공개 여부만으로 보안 수준을 구분하기 어렵다는 뜻이다. 독점 모델인 제미나이 3.1 프로(Gemini 3.1 Pro)의 격차도 라마(Llama)에서 보고된 수준만큼 컸다.1

모델 크기 역시 일관된 보안 지표가 아니었다. 경량 모델은 대체로 플래그십 모델보다 안전하지 않은 코드를 생성했지만, 제미나이 3.7 플래시(Gemini 3.7 Flash)처럼 예외도 있었다. 취약점별로는 로그 인젝션(CWE-117)과 HTTP 응답 분할(CWE-113)이 여러 세대에 걸쳐 남았다. 최신 독점 모델에서는 메모리·정수 관련 취약점이 오히려 악화된 사례도 확인됐다. 같은 CWE도 프로그래밍 언어에 따라 위험도가 크게 달랐다.1

이 결과는 신규 버전이나 독점 모델이라는 이유만으로 더 안전하다고 판단하기 어렵다는 점을 보여준다. 연구진은 개발자가 모델을 변경할 때마다 보안 검사를 다시 수행하고, 모델 입력 맥락에 안전한 API를 제공해야 한다고 제안했다. 다만 논문은 2026년 10월 6일 아카이브(arXiv)에 제출된 초고로, 제공된 자료에는 동료평가 여부가 제시되지 않았다.1

Footnotes

  1. arXiv, 「Newer and Bigger, but Safer? A Longitudinal Study of the Functionality-Security Gap in LLM-Generated Code」 ↩ ↩2 ↩3 ↩4 ↩5

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. Newer and Bigger, but Safer? A Longitudinal Study of the Functionality-Security Gap in LLM-Generated Code — arXiv (cs.CR)

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.