9월 초에 미국 밖 연구소 모델 소식이 한 주에 몰려서 나왔다. DeepSeek는 MIT 라이선스 텍스트·비전 모델을, Sakana AI는 오픈 모델 여러 개를 묶어 쓰는 오케스트레이션 모델을 냈고, 동영상 쪽에서는 MiniMax가 공개한 가중치를 미국 추론 업체 fal이 재학습한 H3 Max가 리더보드 상위권에 올라왔다.
전부 "새 오픈 모델"로 묶여서 돌아다니는데, 막상 들여다보니 가중치를 받아 직접 돌릴 수 있는지, 라이선스가 뭔지, 누가 만든 건지가 제각각이었다. 헷갈려서 확인되는 사실 위주로 한 번 정리해 봤다.
DeepSeek V4.1 Flash, 이름은 Flash인데 이번 발표의 주인공
DeepSeek가 9월 10일 공개한 DeepSeek-V4.1-Flash는 총 552B 파라미터 MoE 모델이다. 새로 넣은 Causal Encoder-Decoder 구조 덕에 토큰당 활성 파라미터가 입력(prefill) 8B, 출력(decode) 16B 수준이라고 한다. Hugging Face 모델 카드 기준으로 최대 1M 토큰 컨텍스트에 이미지 입력을 네이티브로 받고, 추론 강도(reasoning effort)를 1~100 사이에서 연속으로 조절할 수 있다.
개인적으로 제일 눈이 간 건 KV 캐시다. DeepSeek는 KV 캐시 요구량이 이전 대비 HBM 기준 약 1/4로 줄었다고 했고, SiliconANGLE은 이걸 토큰당 약 890바이트로 전했다. 컨텍스트 긴 에이전트 워크로드를 돌려본 사람이라면 이게 서빙 비용에 바로 꽂힌다는 걸 알 거다.
라이선스는 MIT이고 가중치는 Hugging Face(deepseek-ai/DeepSeek-V4.1-Flash)에 올라와 있다. 모델 카드에 vLLM, SGLang 실행 예시도 있다.
성능은 좀 걸러 들어야 한다. DeepSeek는 여러 외부 테스트에서 이 모델이 더 큰 V4-Pro보다 성능·비용·속도 모두 앞선다고 주장하고, SiliconANGLE이 인용한 수치로는 Terminal-Bench 2.1에서 90.6점이다. 어디까지나 회사 측 발표라 실제로 쓰려면 자체 평가는 따로 해봐야 한다.
솔직히 가격부터 봤다. SiliconANGLE 보도 기준으로 오프피크에 입력(캐시 미적용) 100만 토큰당 $0.15, 출력 $0.60이고, 평일 피크에는 두 배다. DeepSeek는 8월부터 피크/오프피크 요금제(오프피크는 피크의 50%)를 운영 중이다.
API 쓰는 입장이면 라우팅 변경은 꼭 챙겨야 한다. 공식 changelog에 따르면 새 모델 ID는 deepseek-flash이고, 기존 deepseek-v4-flash와 deepseek-v4-flash-vision-exp 호출은 호환을 위해 V4.1 Flash로 연결된다. V4-Pro 요청도 9월 14일부터 처리 방식이 바뀐다고 공지됐는데, 뉴스 페이지와 changelog 표현이 조금 다르다. 운영에서 V4-Pro를 쓰고 있다면 최신 공식 문서를 직접 확인하는 게 맞다.
MiniMax H3와 H3 Max는 만든 곳이 다르다
H3 Max는 이름만 보면 MiniMax의 상위 모델 같은데, 아니다. 이게 제일 헷갈렸다.
원본 MiniMax H3는 MiniMax가 만든 범용 동영상 생성 모델이다. 7월 말 API로 먼저 나왔고 8월 3일 Hugging Face에 가중치가 올라왔다. 약 33B 파라미터 Transformer 기반이고, 텍스트·이미지·영상·오디오를 참조 입력으로 받아 4~15초, 최대 2K, 24fps 영상을 스테레오 오디오와 함께 만든다. 라이선스는 MIT나 Apache 같은 범용 라이선스가 아니라 MiniMax H3 Community License다. 모델 카드에 미국·EU·영국·한국 사용자용 신청 양식이 따로 안내되어 있으니, 상업적으로 쓸 생각이면 약관부터 읽어봐야 한다.
H3 Max는 MiniMax가 아니라 fal이 H3 공개 가중치를 재학습(post-training)해서 자기 추론 스택에 올린 버전이다. fal 블로그 공지는 8월 27일에 올라왔다. 품질보다 속도 쪽에 무게를 둔 모델이라 해상도는 768p까지고, fal은 5초 영상을 약 3초 안에 만들며 공식 MiniMax H3 엔드포인트보다 처리량이 약 35배 높다고 밝혔다. Design Arena와 Artificial Analysis(오디오 포함 이미지→영상) 영상 리더보드에서 1위라고도 소개한다.
하나 짚고 가면, 5초 768p 생성 시간 같은 속도 수치는 fal이 9월 8일에 자체 측정한 값이다. 여기저기서 보이는 "9월 8일"은 출시일이 아니라 이 측정 날짜다.
결국 H3 Max는 오픈 가중치로 만든 파생 모델을 호스팅 서비스로 파는 사례로 보면 된다. H3 Max 자체 가중치가 공개됐는지는 확인되지 않았다. 직접 운영하고 싶으면 원본 H3를 받아야 하고, 속도가 중요하면 fal API를 쓰는 식으로 갈릴 것 같다.
Sakana Fugu Max는 모델이라기보다 "모델 고르는 모델"
Sakana AI는 9월 11일 Fugu Max와 Fugu Ultra v2를 같이 공개했다. Fugu는 6월에 처음 나온 시스템인데, 단일 파운데이션 모델이 아니라 여러 모델로 된 에이전트 풀에 작업을 나눠 맡기고 필요하면 자기 자신도 재귀적으로 호출하는 오케스트레이터다.
Fugu Max는 이 풀을 오픈 가중치 모델과 특화 모델 위주로 크게 늘렸고, NVIDIA와 협업해 Nemotron 계열도 넣었다고 한다. 가격은 이렇다.
- Fugu Max: 100만 토큰당 입력 $2, 출력 $6, 캐시 입력 $0.25
- 웹 검색·fetch 도구: 호출당 별도 요금
- Fugu Ultra v2: 입력 $5, 출력 $30부터
Sakana는 비슷한 가격대 비교에서 10개 벤치마크 중 6개(Terminal Bench 2.1 등)에서 최고점이라고 발표했다. 이것도 자체 수치고, AI Weekly는 제3자 검증이 인용되지 않았다는 점을 한계로 짚었다.
OpenAI 호환 API로 제공되고 OpenRouter, Vercel 등에서도 쓸 수 있다. 다만 가중치는 공개되지 않았고, 공식 페이지 기준 EU/EEA에서는 쓸 수 없다.
그러니까 Fugu Max는 오픈 모델을 직접 돌리는 게 아니라, 여러 오픈 모델을 조합하는 일을 서비스로 사는 쪽에 가깝다. 오픈 모델이 많아지니 그 위에 라우팅 계층을 얹는 비즈니스가 생기는 건 생각해보면 자연스러운 흐름 같다.
네 개를 나란히 놓고 보면
| 항목 | DeepSeek V4.1 Flash | MiniMax H3 (원본) | H3 Max (fal) | Sakana Fugu Max |
|---|---|---|---|---|
| 유형 | 텍스트+비전 LLM (MoE) | 동영상+오디오 생성 | H3 파생 동영상 모델 | 멀티 모델 오케스트레이터 |
| 공개 시점 | 2026-09-10 | 가중치 2026-08-03 | 2026-08-27 공지 | 2026-09-11 |
| 가중치 | 공개 (HF) | 공개 (HF) | 공개 확인 안 됨 (호스팅) | 비공개 (API) |
| 라이선스 | MIT | H3 Community License | fal 서비스 약관 | Sakana API 약관 |
| 비용 포인트 | 오프피크 $0.15 / $0.60 (1M 토큰) | 셀프호스팅 시 GPU 비용 | 호출당 과금 | $2 / $6 (1M 토큰) |
가격은 발표 시점 기준이고, 피크 시간대·캐시 여부·지역에 따라 달라질 수 있다.
같은 시기 주변 상황도 같이 봐둘 만하다. 9월 3일 NVIDIA가 Hugging Face를 약 129억 3천만 달러에 인수한다고 발표했다. Tech Wire Asia는 Hugging Face 다운로드 순위 상위를 Alibaba, Moonshot, MiniMax 같은 중국 모델이 차지하고 있다는 점을 짚었다. NVIDIA는 모든 모델 개발사에 계속 열려 있겠다고 했지만, 나중에 정책이 바뀌면 호스팅 결정권이 어떻게 될지는 아직 명확하지 않다.
그리고 DeepSeek V4.1 Flash가 나온 바로 그날, Anthropic은 중국 AI 기업들이 Claude 출력을 무단으로 수집해 학습에 썼다고 주장하는 위협 인텔리전스 보고서를 냈다. TechCrunch는 이 보고서가 Alibaba, Moonshot AI, DeepSeek 등을 지목했다고 보도했다. 아직은 한쪽의 주장이지만, 회사에서 모델 도입을 검토할 때 법무·평판 리스크 항목으로 올라올 수는 있을 것 같다.
실제로 가져다 쓴다면 따져볼 것들
우선 "오픈"이라는 말의 수준부터 나눠 보는 게 좋겠다. DeepSeek V4.1 Flash처럼 가중치 공개에 MIT면 수정, 파인튜닝, 상업적 이용이 가장 자유롭다. MiniMax H3는 받을 수는 있지만 커뮤니티 라이선스라 용도 제한과 신청 절차를 봐야 한다. H3 Max나 Fugu Max 같은 호스팅 서비스는 결국 API 벤더를 하나 더 늘리는 거라 SLA, 약관, 데이터 처리 정책을 검토해야 한다.
셀프호스팅 비용은 활성 파라미터가 아니라 총 파라미터로 계산해야 한다. V4.1 Flash는 토큰당 활성이 8~16B라 연산은 가볍지만 552B 전체 가중치를 메모리에 올려야 하고, 양자화를 해도 멀티 GPU 노드가 필요하다. KV 캐시가 줄어든 만큼 긴 컨텍스트 동시 처리량은 좋아질 수 있어도, 소규모 팀이면 DeepSeek API나 서드파티 호스팅과 셀프호스팅 TCO를 먼저 비교해보는 게 현실적이다. H3도 모델 카드 예시가 4 GPU 기준이라 동영상 파이프라인을 직접 돌리려면 GPU 예산을 따로 잡아야 한다.
데이터 쪽도 갈린다. 가중치를 받아 사내 인프라에서 돌리면 프롬프트와 데이터가 밖으로 안 나가니까, 중국 모델 얘기만 나오면 따라붙는 우려는 이 방식으로 상당 부분 풀린다. 반대로 중국 업체 호스팅 API를 직접 호출하면 데이터가 어느 관할권에서 처리되는지 확인해야 하고, 개인정보나 고객 데이터가 걸려 있으면 사내 보안·법무 검토를 거치는 게 안전하다. Fugu Max처럼 EU/EEA에서 제공되지 않는 서비스도 있으니 글로벌 서비스라면 지역별 대체 경로도 필요하다.
벤더를 여러 개 쓸 생각이면 추상화 계층부터 만들어 두는 게 편하다. 이번 모델들은 대부분 OpenAI 호환 API나 vLLM/SGLang 서빙을 지원하니까, 모델 호출부를 게이트웨이나 라우터 뒤로 빼두면 교체나 폴백을 설정만으로 처리할 수 있다. DeepSeek처럼 모델 ID와 라우팅이 짧은 공지 하나로 바뀌기도 하니, 우리 팀이라면 모델 버전 고정, 변경 감지, 회귀 테스트를 운영 체크리스트에 넣어둘 것 같다.
벤치마크는 세 회사 모두 우위를 내세우지만 대부분 자체 발표 수치다. 결국 자기 도메인 데이터로 작은 eval 세트를 만들어 품질, 지연 시간, 비용을 같이 재보는 게 제일 확실하다.
개인적인 생각
이번 달을 보면서 든 생각은, "오픈 모델"을 쓰는 방식 자체가 꽤 여러 갈래로 나뉘고 있다는 거다. DeepSeek는 MIT 대형 MoE를 싼 API와 같이 풀고, MiniMax H3 위에는 서드파티가 파생 서비스를 얹고, Sakana는 오픈 모델들을 묶어서 하나의 API처럼 판다.
선택지가 늘어난 건 반갑지만 그만큼 따질 것도 많아졌다. 나는 앞으로 새 모델이 나오면 가중치 공개 여부, 라이선스, 데이터가 처리되는 위치, 총소유비용 이 네 가지로 먼저 분류해 볼 생각이다. 다음 달에도 또 뭔가 나올 텐데, 그때 덜 헤매려고.
참고한 글
- Introducing DeepSeek-V4.1-Flash (DeepSeek) — V4.1 Flash 공식 발표. 구조, KV 캐시 절감, 라우팅 공지
- DeepSeek API Change Log — 새 모델 ID, 기존 모델 라우팅, 피크/오프피크 요금제 변경 이력
- deepseek-ai/DeepSeek-V4.1-Flash (Hugging Face) — MIT 라이선스, 1M 컨텍스트, vLLM/SGLang 실행 방법
- DeepSeek releases V4.1-Flash, says it outperforms flagship V4-Pro (SiliconANGLE) — API 가격, 벤치마크 수치 보도
- Open General Intelligence: MiniMax H3 Is Now Open Source (MiniMax) — H3 오픈소스 공개 발표와 사양
- MiniMaxAI/MiniMax-H3 (Hugging Face) — H3 Community License, 배포 요구 사항
- Introducing H3 Max by fal (fal blog) — fal이 재학습한 H3 Max 소개와 속도 수치
- MiniMax H3 Max (Morphic) — H3 Max가 MiniMax 공식이 아닌 파생 모델이라는 설명, 768p 해상도
- MiniMax H3 Max (fal) — 리더보드 순위와 9월 8일 자체 측정 생성 속도
- Sakana Fugu (Sakana AI) — Fugu Max / Ultra v2 가격, 모델 풀, EU/EEA 제공 제한
- Sakana Fugu: One Model to Command Them All (Sakana AI) — Fugu 첫 공개와 오케스트레이션 개념
- Sakana AI ships Fugu Max, cheaper routing over open models (AI Weekly) — 9월 11일 출시, 벤치마크 검증 한계 지적
- Nvidia's Hugging Face acquisition (Tech Wire Asia) — NVIDIA의 Hugging Face 인수와 중국 오픈 모델 유통 영향
- Anthropic details distillation campaigns from Alibaba, Moonshot AI, and DeepSeek (TechCrunch) — 9월 10일 공개된 증류 의혹 보고서 보도