git.kernel.org 트래픽 98%가 AI 크롤러 스크레이핑
최근 30일 조회수 — 좋아요 —핵심 요약
리눅스 커널 저장소 git.kernel.org의 일일 요청 600만 건 중 98%가 AI 학습용 크롤러 트래픽으로 추정됐다.
“커널 개발자가 업무를 위해 접속하는 패턴과는 명백히 다르다.”는 문장은 자료의 조심스러운 추정을 단정으로 바꾼 것이므로 삭제하겠습니다.
리눅스 커널 저장소를 운영하는 git.kernel.org가 하루 600만 건에 달하는 요청에 시달리고 있다. 대부분은 실제 개발자가 아니라 AI 학습용 데이터를 긁어가는 크롤러가 보낸 것으로 추정된다. 콘스탄틴 리아비트세프(Konstantin Ryabitsev)가 집계한 수치를 블로그에 공개했고, 이를 LWN.net이 2026년 8월 29일 전했다.[^1]
리아비트세프에 따르면 git.kernel.org는 매일 약 600만 건의 요청을 받는데, 대부분 무작위로 골라낸 특정 커밋을 보여달라는 요구다. 이 요청 중 66%는 자동화 봇 차단 도구인 아누비스(Anubis)의 챌린지에 걸려 즉시 튕겨나간다. 문제는 나머지 33%다. 이 요청들은 아누비스가 요구하는 수학 연산을 실제로 풀어내고 본 사이트까지 도달한다. 단순 매크로가 아니라 연산 비용을 감수하고서라도 데이터를 가져가려는 주체가 붙어 있다는 뜻이다.
어떤 요청이 봇이고 어떤 요청이 사람인지 확실하게 구분하는 것은 불가능하다고 리아비트세프는 인정한다. 다만 정황은 뚜렷하다. 오래된 포크 저장소에 있는, 아무도 관심 두지 않을 옛날 커밋을 무작위로 요구하는 트래픽이라면 실제 개발자가 작업 중에 낼 만한 요청은 아니라는 것이다.
이런 정황을 근거로 상당히 관대한 가정을 적용해 걸러내도, 정상적인 이용으로 볼 수 있는 요청은 전체 트래픽의 약 2%에 불과하다고 그는 밝혔다. 나머지 98%는 사실상 스크레이퍼, 즉 AI 모델 학습이나 다른 목적으로 콘텐츠를 자동 수집하는 프로그램이 만들어낸 트래픽이라는 계산이다.
이 수치는 오픈소스 인프라가 AI 크롤러로 인해 겪는 부담이 추정치가 아니라 실측 데이터로 확인됐다는 점에서 의미가 있다. git.kernel.org는 전 세계 개발자가 리눅스 커널 소스 코드를 내려받고 커밋 이력을 조회하는 핵심 인프라인데, 정작 그 트래픽의 대부분이 커널 개발과 무관한 자동 수집 활동에 쓰이고 있다는 뜻이기 때문이다.
리아비트세프가 정확히 어떤 방법론으로 "관대한 가정"을 세워 2%라는 수치를 도출했는지, 원문 블로그 글의 세부 내용은 LWN.net 기사에 인용되지 않았다. 아누비스가 어떤 방식으로 챌린지를 계산하고 봇과 인간을 구분하려 시도하는지에 대한 기술적 설명도 이번 보도에는 담기지 않았다.
[^1]: LWN.net, "Ryabitsev: Creepy crawlies" 읽기 목록은 이 브라우저에 저장됩니다.
출처
- Ryabitsev: Creepy crawlies — LWN.net
이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.