DeepSeek 첫 비전 모델, 제미나이 3.7 플래시와 정확도 대등

1분 DeepSeekGemini비전 모델OpenRouter
최근 30일 조회수 — 좋아요 —

핵심 요약

DeepSeek의 첫 비전 모델 V4 Flash Vision Exp가 제미나이 3.7 플래시와 정확도는 비슷했지만 속도·비용 구조는 반대로 갈렸다

DeepSeek가 8월 21일 처음으로 이미지 입력을 지원하는 모델 'V4 Flash Vision Exp'를 공개하면서, 구글의 저가형 비전 모델 제미나이 3.7 플래시와 정면으로 겹치는 경쟁 구도가 만들어졌다. 더뉴스택에 따르면 이 모델은 8월 27일 오픈라우터(OpenRouter) 같은 API 게이트웨이에 올라왔고, 기존 저가 모델 V4 플래시에 이미지 이해 기능만 얹은 형태다. 가격은 입력 토큰 100만 개당 0.22달러, 출력 토큰 100만 개당 0.66달러로 기존과 동일하게 유지됐다. 다만 평일 피크 시간대에는 가격이 두 배로 뛴다.

비교 대상인 제미나이 3.7 플래시는 8월 13일 나온 구글의 저가형 비전 모델로, 오픈라우터 기준 입력 0.75달러, 출력 3.75달러에 과금된다. 단순 계산으로도 DeepSeek 쪽이 입력은 3배 이상, 출력은 5배 이상 저렴하다. DeepSeek는 이 모델을 문서·차트 이해와 시각적 질의응답용으로 내세웠고, 구글은 제미나이 3.7 플래시를 "가장 지능적인 워크호스 모델"이라고 설명했다. 더뉴스택은 두 모델의 주장을 검증하기 위해 실제 업무를 흉내 낸 세 가지 이미지 테스트를 직접 진행했다.

첫 번째는 차트 읽기 테스트다. 매출과 비용을 서로 다른 스케일의 이중 y축(매출 0~12, 비용 0~16)으로 그린 막대·선 혼합 차트를 주고 세 가지 질문을 던졌다. 그래프만 눈으로 보면 비용이 매출을 넘어서는 분기를 착각하게 만든 함정이었는데, 두 모델 모두 걸리지 않았다. 두 모델 다 정답인 1분기를 짚었고, 4개 분기 내내 성장한 구독(Subscriptions) 부문도 정확히 골라냈으며, 연간 총매출 추정치도 원본 데이터와 일치하는 3610만 달러로 답했다. 차이는 답변 방식뿐이었다. DeepSeek는 세 줄짜리 짧은 답을, 제미나이는 막대마다 읽은 값을 풀어서 보여주는 답을 냈다.

두 번째는 오류가 세 군데 심어진 송장을 감사하는 테스트였다. 수량×단가와 맞지 않는 항목 하나, 어디에도 맞지 않는 소계, 인보이스 발행일보다 앞선 지급 기한이 함정이었다. 두 모델 모두 세 오류를 모두 짚어냈다. 모니터 암 항목에서 10개×45.99달러가 505.89달러로 잘못 인쇄된 것을 찾아냈고, 정확한 합계인 3958.89달러도 똑같이 재계산해냈으며, 7월 28일 지급 기한이 8월 12일 발행일보다 이르다는 점도 함께 지적했다. DeepSeek는 여기서 한 걸음 더 나가, 오류를 정정하기 전 상태에서도 인쇄된 소계가 항목 합계와 애초에 맞지 않는다는 점까지 짚었다.

정확도에서는 우열이 갈리지 않았지만, 속도와 비용 구조에서는 뚜렷한 차이가 났다. 같은 송장 테스트에서 DeepSeek는 답변에 30.5초가 걸렸고 완료 토큰을 3467개나 청구했는데, 답변 자체는 몇 문단에 불과해 상당 부분이 내부 추론 과정을 출력 토큰으로 과금한 것으로 보인다고 더뉴스택은 분석했다. 반면 제미나이는 7.9초 만에 944개 완료 토큰으로 답을 냈다. 입력 토큰 계산 방식은 반대로 갈렸다. 같은 이미지 한 장을 DeepSeek는 약 500토큰으로, 제미나이는 약 1150토큰으로 잡았다.

정리하면 두 모델은 차트 읽기와 송장 감사 두 테스트에서는 답의 정확도에서 거의 차이가 없었다. 대신 DeepSeek는 토큰 단가가 훨씬 낮은 대신 추론 시간과 출력 토큰 소모가 크고, 제미나이는 단가는 비싸지만 응답이 빠르고 출력이 간결하다는 대비가 뚜렷하게 드러났다. 지출을 우선할지 응답 속도를 우선할지에 따라 선택이 갈리는 구도인 셈이다.

[^1]: The New Stack, "DeepSeek's first vision model vs. Gemini 3.7 Flash: It comes down to spend vs. speed"

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. DeepSeek's first vision model vs. Gemini 3.7 Flash: It comes down to spend vs. speed — The New Stack

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.