본문 바로가기

AI/AI

DeepSeek V4 정식 출시, 개발자가 알아야 할 가격 전략

추천캐릭터 2026. 7. 20. 08:00
728x90

DeepSeek V4 정식 출시, 개발자가 알아야 할 가격 전략

최종 업데이트: 2026년 7월 26일

중요 정정: DeepSeek 공식 문서는 2026년 7월 26일 현재 V4를 여전히 Preview로 표기합니다. 공식 자료에서 7월 15일 정식 상용 전환피크 시간 2배 할증 정책은 확인되지 않습니다. 이 글은 현재 공식 발표와 가격표를 기준으로 전체 내용을 바로잡았습니다.

DeepSeek V4는 낮은 가격과 100만 토큰 컨텍스트로 관심을 받고 있습니다. 그러나 비공식 정보로 비용 구조를 설계하면 잘못된 스케줄러와 모델 라우팅을 만들 수 있습니다. 확인된 사실과 운영 해석을 분리해 Flash·Pro의 차이, 공식 가격과 마이그레이션을 정리합니다.

사실과 해석 구분

  • 공식 사실: DeepSeek는 2026년 4월 24일 DeepSeek V4 Preview를 공개했습니다.
  • 공식 사실: V4-Pro와 V4-Flash 모두 API와 오픈 웨이트로 제공됩니다.
  • 공식 사실: 공식 가격표는 모델과 캐시 적중 여부로 가격을 구분합니다.
  • 확인되지 않음: 2026년 7월 15일 정식 버전으로 전환됐다는 발표
  • 확인되지 않음: 평일 특정 시간에 2배를 받는 피크·오프피크 과금
  • 운영 해석: 비용 절감의 핵심은 실행 시간 변경보다 모델 라우팅과 프롬프트 캐시 적중률입니다.

DeepSeek V4란

V4는 필요한 일부 전문가 네트워크만 활성화하는 MoE(Mixture-of-Experts) 모델 계열입니다.

항목 DeepSeek V4-Flash DeepSeek V4-Pro
전체 파라미터 2,840억 1.6조
활성 파라미터 130억 490억
컨텍스트 길이 100만 토큰 100만 토큰
최대 출력 38만 4천 토큰 38만 4천 토큰
주요 용도 빠른 응답, 분류·요약, 단순 에이전트 작업 복잡한 추론, 코딩, 장기 에이전트 작업
도구 호출·JSON 출력 지원 지원

Flash는 단순 에이전트 작업과 비용, Pro는 복잡한 추론과 코딩에 초점을 둡니다. 실제 선택은 자체 데이터의 정확도와 실패율로 판단해야 합니다.

2026년 7월 26일 공식 API 가격

가격 단위는 모두 100만 토큰당 미국 달러입니다.

구분 V4-Flash V4-Pro
캐시 적중 입력 $0.0028 $0.003625
캐시 미적중 입력 $0.14 $0.435
출력 $0.28 $0.87
계정당 동시 요청 한도 2,500 500

공식 페이지에는 시간대별 할증 표가 없습니다. “야간 배치면 60% 할인”이라는 가정으로 설계하면 안 됩니다. 핵심 변수는 캐시 적중률입니다.

쉬운 비용 계산 예시

한 달에 캐시 미적중 입력 1,000만 토큰과 출력 200만 토큰을 사용한다고 가정하겠습니다.

V4-Flash = 10 × $0.14 + 2 × $0.28 = $1.96
V4-Pro   = 10 × $0.435 + 2 × $0.87 = $6.09

입력 800만 토큰이 캐시에 적중하고 200만 토큰만 미스라면 Flash는 $0.8624, Pro는 $2.639로 줄어듭니다. 환율·부가세·재시도를 제외한 예시이므로 실제 대시보드에는 모델별 토큰과 재시도를 따로 기록해야 합니다.

API 호출 예제

DeepSeek는 OpenAI 형식과 Anthropic 형식의 API 엔드포인트를 제공합니다. OpenAI 형식으로 V4-Pro의 사고 모드를 호출하는 기본 예시는 다음과 같습니다.

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
  -d '{
    "model": "deepseek-v4-pro",
    "messages": [
      {
        "role": "system",
        "content": "당신은 Java 코드 리뷰어입니다."
      },
      {
        "role": "user",
        "content": "이 서비스 계층의 트랜잭션 경계를 검토해 주세요."
      }
    ],
    "thinking": {
      "type": "enabled"
    },
    "reasoning_effort": "high"
  }'

단순 분류·요약은 deepseek-v4-flash, 품질 기준을 통과하지 못한 요청만 Pro로 보내는 방식이 유리합니다.

요청
 └─ Flash 실행
     ├─ 품질 기준 통과 → 결과 반환
     └─ 실패·낮은 신뢰도 → Pro 재실행

기존 모델 이름 마이그레이션

공식 문서에는 deepseek-chatdeepseek-reasoner의 폐기 예정 시각이 2026년 7월 24일 15:59 UTC로 표시되어 있습니다. 이 날짜는 이미 지났습니다.

기존 이름은 V4-Flash의 비사고·사고 모드에 대응하지만 신규 코드가 과거 별칭에 계속 의존하는 것은 안전하지 않습니다.

기존 이름 권장 전환
deepseek-chat deepseek-v4-flash + 비사고 모드
deepseek-reasoner deepseek-v4-flash 또는 deepseek-v4-pro + 사고 모드

모델 이름은 코드에 직접 흩어놓지 말고 환경변수나 설정 파일로 분리합니다.

ai:
  deepseek:
    base-url: https://api.deepseek.com
    default-model: deepseek-v4-flash
    reasoning-model: deepseek-v4-pro

실무에서 사용하는 비용 절감 방식

  1. 공통 프롬프트를 요청 앞부분에 같은 형태로 배치해 캐시 적중률을 높입니다.
  2. Flash를 기본으로 두고 복잡한 추론이나 실패 요청만 Pro로 올립니다.
  3. 출력 토큰 상한을 업무별로 제한합니다.
  4. 토큰 단가가 아니라 재시도와 사람 수정을 포함한 성공당 비용을 측정합니다.

자주 하는 실수

  • Preview를 정식 안정 버전으로 단정하거나 공식 표에 없는 시간대별 요금제를 전제로 설계합니다.
  • 캐시 적중 가격을 모든 입력 토큰에 적용해 비용을 과소 계산합니다.
  • 과거 모델 별칭이 영원히 유지된다고 가정합니다.
  • 벤치마크만 보고 자체 정확도·지연·실패율을 측정하지 않습니다.
  • 오픈 웨이트라는 이유만으로 자체 호스팅이 무조건 저렴하다고 판단합니다.

자체 호스팅에는 GPU, 서빙 프레임워크, 장애 대응, 모니터링과 보안 비용이 추가됩니다. 데이터 반출 제한이나 매우 큰 고정 트래픽처럼 분명한 이유가 있을 때 비교해야 합니다.

핵심 요약

  • 2026년 7월 26일 현재 공식 명칭은 DeepSeek V4 Preview입니다.
  • V4-Flash는 비용과 처리량, V4-Pro는 복잡한 추론과 코딩에 초점이 있습니다.
  • 공식 가격표에는 시간대별 피크·오프피크 할증이 없습니다.
  • 비용 절감의 핵심은 캐시 적중률, 출력 제한과 모델 라우팅입니다.
  • 폐기 일정이 지난 기존 모델 별칭 대신 V4 모델 ID를 명시적으로 사용해야 합니다.
  • Preview 모델이므로 품질 평가와 폴백 경로를 준비한 뒤 운영에 적용해야 합니다.

마무리

DeepSeek V4에서 개발자가 봐야 할 핵심은 “정식 출시됐는가”라는 자극적인 문구가 아니라, 현재 공식 상태와 실제 청구 방식입니다. 가격이 매우 낮아 보여도 캐시 미스·출력·재시도 비율에 따라 비용은 달라집니다.

Flash를 기본으로 사용하고 필요한 작업만 Pro로 올리며, 모델 이름과 가격을 설정으로 외부화하면 정책 변경에 더 안전하게 대응할 수 있습니다. 특히 Preview 기간에는 성능뿐 아니라 응답 형식, 도구 호출 성공률과 장애 시 폴백을 함께 검증해야 합니다.

함께 보면 좋은 글:

공식 자료:

728x90