한 줄 요약 — 270억 파라미터짜리 오픈웨이트 멀티모달 모델이, 고성능 PC, 워크스테이션 한 대에서 돌아가면서 컴퓨터·모바일 자동화(에이전트) 영역에서 프런티어 상용 모델을 앞질렀다. Apache 2.0. 한국의 독자 AI 파운데이션 모델(독파모) 프로젝트 중요 로드맵 코앞에 두고 벌어진 일이다.

  • 모델: Qwen/Qwen3.8-27B (알리바바 Tongyi Lab)
  • 공개일: 2026년 8월 중순 (8월 13–14일)
  • 라이선스: Apache 2.0
  • 작성 기준일: 2026년 8월 16일

1. 왜 이 모델이 중요한가? — 강점 중심 정리

1-1. 완전 개방형 상용 라이선스

Apache 2.0이다. 개인·연구기관·기업 모두 다운로드, 수정, 재배포, 상용 서비스 탑재가 무료로 가능하다. BF16 원본과 FP8 아티팩트가 모두 공식 공개되어 있고, 커뮤니티 GGUF·NVFP4 양자화가 350개 이상 파생되어 있다. "쓸 수 있는가"라는 질문이 아예 성립하지 않는다. 이것이 이 모델의 가장 큰 무기다.

개별 기업이나 보안이 중요한 격리 환경에서 자체적인 튜닝과 인공지능 플랫폼으로 만들 수 있다.

1-2. 에이전트 성능으로 경쟁자를 압살하다.

숫자를 그대로 옮기면 다음과 같다. (모두 알리바바 자체 공표치)

벤치마크 영역 Qwen3.8-27B Qwen3.6-27B(전작) Qwen3.7-Plus(자사 상위) Opus 4.6 Max
OSWorld-Verified 컴퓨터 조작 84.3 63.9 73.3 72.7
AndroidWorld 모바일 조작 81.9 70.3 81.0 62.0
WebArena-Verified 브라우저 조작 64.8 48.8 55.3
SWE-bench Pro 에이전틱 코딩 61.7 53.5 57.6 53.4
Terminal Bench 2.1 터미널 코딩 73.0 63.4 64.0 78.2
CoWorkBench 장기 사무 업무 70.7 61.0 65.1 68.2
SWE-MM 멀티모달 SWE 38.6 25.7 30.0 27.1
LiveCodeBench v6 경쟁 코딩 90.3 83.9 89.6 88.8

주목할 점은 전작 대비 상승폭이다. OSWorld 63.9 → 84.3(+20.4), WebArena 48.8 → 64.8(+16.0). 6개월 남짓한 세대 교체에서 나온 폭이다. 그리고 이 모든 것이 27B 밀집 모델에서 나왔다.

1-3. 네이티브 비전-언어 (어댑터가 아님)

비전 인코더가 어댑터 방식으로 붙은 게 아니라 아키텍처에 통합되어 있다. 이미지·비디오를 임베딩 공간으로 직접 처리한다. 시간 단위 장편 영상 이해까지 범위에 넣고 있다.

  • MathVision(시각 수학): 90.0 (CI 미사용) / 94.6 (CI 사용)
  • CharXiv RQ(차트 해석): 83.7 (CI 미사용) / 90.2 (CI 사용)
  • BabyVision(일반 시각 추론): 65.7 / 85.6
  • OmniDocBench 1.5(문서 지능): 91.1
  • ERQA(체화 지능): 65.5

⚠️ 원문 유통 자료의 오류 정정 — "MathVision에서 Opus를 29.1점 차로 앞섰다"는 서술이 돌아다니는데, 이는 Qwen의 CI 사용(94.6) 값과 Opus의 CI 미사용(65.5) 값을 비교한 것이다. 동일 조건(CI 미사용)에서는 90.0 대 65.5다. CharXiv의 "24.2점 차"도 같은 문제(90.2 vs 66.0 → 동일 조건은 83.7 vs 66.0). 격차가 여전히 크다는 결론은 유지된다.

1-4. 하이브리드 어텐션 - 원가 구조 자체가 다르다

이 모델을 단순한 "Dense 27B"로 부르면 핵심을 놓친다. 계층 구조가 다음과 같다.

16 × ( 3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN) )
= 총 64층 중 48층이 선형 어텐션, 16층만 풀 어텐션 (3:1)

전체 층의 75%가 O(n²)이 아니라 O(n)으로 돈다. 여기에 MTP(Multi-Token Prediction) 헤드가 학습되어 있어 speculative decoding이 기본 지원된다. 즉 262K 네이티브 컨텍스트(YaRN으로 최대 100만 토큰 확장)가 마케팅 숫자가 아니라 KV 캐시 예산이 실제로 감당 가능한 구조에서 나온 것이다.

1-5. 추론 예산 통제

reasoning_effortxhigh(기본) / medium / low 3단계로 조절한다. 여기에 preserve_thinking이 기본 활성화되어, 이전 턴의 사고 블록을 유지해 KV 캐시 재활용률을 높인다. 에이전트 워크로드에서 토큰 낭비를 줄이는 실전형 설계다.

1-6. 생태계 Day-0 장악

vLLM, SGLang, TokenSpeed, llama.cpp, Ollama, LM Studio, Unsloth, Docker Model Runner가 출시 당일부터 지원했다. AMD는 Ryzen AI Max+ 395 / Radeon AI PRO R9700 32GB에 대해 Day-0 블로그를 냈다(각각 24.5 tok/s, 51.8 tok/s). 공개 하루 만에 Ollama 다운로드 7.2만, HF 다운로드 9만을 넘겼다.

이 항목이 사실상 가장 위협적이다. 성능은 따라잡을 수 있어도, 출시 당일 전 세계 로컬 추론 스택이 자동으로 지원하는 배포 관성과 바이럴은 돈으로 살 수 없다.


2. 한계와 리스크

항목 내용
가중치 용량 27.78B × 2B = 약 55.6GB(BF16). FP8 약 27.8GB, Q4_K_M 약 13.9GB, Q5_K_M 약 17.4GB
실제 VRAM 양자화 수치는 가중치만이다. KV 캐시가 32K에서 8–10GB, 256K에서 60–80GB. "16GB에서 돈다"는 홍보는 짧은 컨텍스트 전제
권장 사양 BF16 = 80GB급 1장. 로컬 실용선은 24GB 초과 VRAM(RTX 4090/5090, R9700 32GB, Ryzen AI Max+ 통합메모리)
약한 축 순수 텍스트 추론. GPQA Diamond 89.2(Opus 4.6 Max 91.3), HLE 30.8(Opus 40.0), Terminal Bench 73.0(Opus 78.2). 시각·에이전트에 최적화된 대신 심층 텍스트 추론은 프런티어에 못 미친다
YaRN 부작용 100만 토큰은 정적 YaRN 스케일링 기반이며, Qwen 스스로 "짧은 프롬프트 성능을 해칠 수 있다"고 경고한다
검증 공백 출시일 기준 독립 벤치마크 재현 사례가 확인되지 않았다. 서드파티 추적 사이트도 "공개 랭킹을 매기기엔 비생성 커버리지가 부족"하다며 순위 부여를 보류 중
전작 대비 3배 느림 커뮤니티에서 도는 주장이나, 검증된 출처가 확인되지 않는다. 인용 시 주의
공급망 관점 오픈웨이트라도 학습 데이터와 정렬 정책은 통제 불가다. 공공·금융·방산 도입 시 별도 검증 체계가 전제되어야 한다

3. 독파모(독자 AI 파운데이션 모델)에 얼마나 치명적인가?

3-1. 타이밍이 최악이다

독파모 프로젝트 경과를 시간순으로 정리하면 다음과 같다.

시점 사건
2025.08 발표평가로 5개 정예팀 선정 (LG AI연구원, SKT, 네이버클라우드, 업스테이지, NC AI). 지원 규모 약 5,300억 원
2025.12.30 1차 발표회 — 중간 성능 지표 공개
2026.01.15 1차 단계평가: 3팀 진출(LG AI연구원·SKT·업스테이지). NC AI 종합 탈락, 네이버클라우드는 독자성 논란으로 탈락. LG AI연구원 90.2점 최고
2026.02.20 모티프테크놀로지스 추가 선정 → 4팀 경쟁 체제 (300B급 추론형 목표)
2026.08.11 4개 팀 모델 전원 Epoch AI Notable Model 등재. 미·중·한 3개국만 보유
2026.08 중 2차 단계평가 결과 발표 예정
2026.08.14 Qwen3.8-27B 공개

2차 평가 결과 발표를 며칠 앞두고, 평가의 준거가 되는 오픈소스 SOTA가 한 단계 올라갔다. 1차 평가에서 벤치마크 비중이 40점이었다는 점을 감안하면, 평가 기준선이 심사 도중에 움직인 셈이다.

3-2. 위협 벡터별 치명도

# 위협 벡터 내용 치명도
1 명분 잠식 독파모의 핵심 명분은 "무료 대국민 서비스 + API 배포로 산업 AX 지원"이다. Apache 2.0 27B 모델이 이미 그 자리를 무료로 채우고 있다
2 효율성 대비 정당성 5,300억 원 + 국가 GPU 인프라로 만든 대형 모델이, 27B 오픈웨이트에 에이전트·비전에서 밀리면 사업 정당성 자체가 공격받는다
3 독자성 규정의 역설 1차에서 네이버가 독자성 논란으로 탈락했다. Qwen 계열 아키텍처·가중치 활용이 가장 빠른 길인데 규정상 막혀 있다. 경쟁자는 쓰는 지름길을 국내 팀만 못 쓴다
4 패러다임 축 이동 독파모 모델 대부분이 텍스트·한국어 중심으로 설계됐다. 승부처가 컴퓨터/모바일 조작 에이전트 + 멀티모달로 이동하면 격차가 재확대된다
5 릴리스 사이클 격차 Qwen3.5 → 3.6 → 3.8이 1년 내. 독파모는 6개월 단위 단계평가. 평가 주기가 경쟁자 릴리스 주기보다 느리다
6 생태계 락인 vLLM/SGLang/Ollama/LM Studio/AMD Day-0 지원. 국산 모델은 이 경로가 없다. 개발자는 성능이 아니라 손에 잡히는 순서대로 채택한다
7 온프레미스 주권 논리 잠식 "데이터를 밖에 못 보낸다"는 요구는 그동안 국산 모델의 방어선이었다. 24GB VRAM에서 도는 오픈웨이트는 그 방어선을 우회한다

3-3. 그럼에도 치명적이지 않은 부분

균형을 위해 반대편도 명시한다.

  • 한국어·한국 법제·공공 도메인: Qwen이 대체하지 못한다. 행정·사법·의료·교육 도메인 데이터는 국내에서만 축적 가능하다.
  • 공공·방산 도입 제약: 중국계 모델의 공공부문 도입은 보안 심사에서 별도 장벽이 있다. 이 영역은 구조적으로 갈라파고스를 만들고 있다.
  • 절대 수준은 확보됐다: 4개 팀 전원 Epoch AI Notable Model 등재. 미·중·한 3개국만 보유한 지위다. "못 만든다"가 아니라 만드는 속도가 느리다가 문제다.
  • Qwen 수치도 자체 공표치다: 독립 재현이 없다. 벤치마크를 절대 척도로 받아들이는 것 자체가 오류다.

3-4. 결론적 판단

존립을 위협하는 수준은 아니다. 그러나 사업의 경제적 명분을 정면으로 잠식하는 '기회비용 위협'으로는 최상급이다.

독파모가 답해야 할 질문이 바뀌었다. 이전 질문은 *"글로벌 Top 수준 모델을 만들 수 있는가"*였고, 그 답은 이미 부분적으로 예스다. 지금의 질문은 무료로 뿌려지는 27B 오픈웨이트가 있는데, 국산 모델을 왜 써야 하는가다.

이 질문에 대한 답은 파라미터 수나 벤치마크 점수가 아니다. 한국어 도메인 깊이, 규제 대응, 감사 가능성(auditability), 데이터 출처 추적성 — 오픈웨이트가 구조적으로 제공할 수 없는 것들이다. 2차 평가가 이 축을 얼마나 반영하느냐가, 이 사업이 벤치마크 추격전으로 끝날지 아닐지를 가른다.

한 가지 덧붙이면, LLM은 엑셀이지 오라클이 아니다. 27B가 84.3점을 받았다는 사실은 도구가 좋아졌다는 뜻이지, 어떻게 사용하고 어떤 목적인가에 대한 것은 다른 문제이다. 독파모의 승부처도 결국 누가 더 큰 모델을 만드느냐가 아니라, 누가 그 도구를 한국의 문제에 더 정확히 해결하느냐가 중요한 핵심이 있다.


4. 핵심 사양 요약

항목
모델 타입 Causal LM + Vision Encoder (네이티브 멀티모달)
파라미터 27B (언어 모델) / 약 28B (비전 인코더 포함, 27.78B)
아키텍처 Qwen3.5 계열 하이브리드 어텐션 (Qwen3_5ForConditionalGeneration)
계층 구조 64층 = 16 × (3 × Gated DeltaNet + 1 × Gated Attention)
은닉 차원 5,120 / FFN 중간 차원 17,408
어휘 크기 248,320 (padded)
어텐션 헤드 Gated Attention Q 24 / KV 4, head dim 256 · DeltaNet V 48 / QK 16, head dim 128
MTP 다단계 학습 (speculative decoding 지원)
컨텍스트 262,144 네이티브 / YaRN으로 최대 1,000,000
라이선스 Apache 2.0
샘플링(Thinking) temp 1.0, top_p 0.95, top_k 20, presence_penalty 0.0
샘플링(Instruct) temp 0.7, top_p 0.80, top_k 20, presence_penalty 1.5

5. 레퍼런스

1차 자료 (모델)

  1. Qwen Team, Qwen/Qwen3.8-27B — Model Card, Hugging Face — https://huggingface.co/Qwen/Qwen3.8-27B
  2. Qwen Team, Qwen/Qwen3.8-27B-FP8, Hugging Face — https://huggingface.co/Qwen/Qwen3.8-27B-FP8
  3. Qwen Team, Qwen3.8-Max: A New Bar for Coding and Cowork (공식 블로그, 2026.08) — https://qwen.ai/blog?id=qwen3.8
  4. vLLM, Qwen/Qwen3.8-27B Recipehttps://recipes.vllm.ai/Qwen/Qwen3.8-27B
  5. Unsloth, Qwen3.8 — How to Run Locallyhttps://unsloth.ai/docs/models/qwen3.8
  6. Unsloth, Qwen3.8-27B-GGUFhttps://huggingface.co/unsloth/Qwen3.8-27B-GGUF
  7. Ollama, qwen3.8:27bhttps://ollama.com/library/qwen3.8:27b
  8. AMD, Run Qwen 3.8 27B on AMD Ryzen AI Max Agentic PCs and Radeon GPUs (Day-0, 2026.08) — https://www.amd.com/en/blogs/2026/run-qwen-3-8-27b-on-amd-ryzen-ai-max-and-radeon-graphics-cards-day-0.html

2차 자료 (독립 분석 / 검증 현황)

  1. Kingy.ai, Qwen3.8-27B: Specs, Benchmarks & Verdicthttps://kingy.ai/blog/qwen3-8-27b-specs-benchmarks-local-hardware/
  2. BenchLM.ai, Qwen3.8-27B Benchmarks & Context (August 2026)https://benchlm.ai/models/qwen3-8-27b
  3. Local AI Zone, Qwen3.8-27B: A Comprehensive Technical Analysishttps://local-ai-zone.github.io/blog/qwen3-8-27b-comprehensive-analysis.html
  4. Emergent, Qwen 3.8 Benchmark Scores: Every Number Explainedhttps://emergent.sh/learn/qwen-3-8-benchmarks

독파모(독자 AI 파운데이션 모델)

  1. 과학기술정보통신부, 「독자 AI 파운데이션 모델」 프로젝트 발표평가 결과, 5개 정예팀 선정https://www.msit.go.kr/bbs/view.do?sCode=user&mPid=208&mId=307&bbsSeqNo=94&nttSeqNo=3186073
  2. 인공지능신문, 대한민국 '독자 AI 파운데이션 모델' 1차 평가 결과 발표…LG AI연구원·SKT·업스테이지 2차 진출 (2026.01.15) — https://www.aitimes.kr/news/articleView.html?idxno=38163
  3. ZDNet Korea, 모티프테크놀로지스, 독파모 정예팀 합류…'K-AI' 독자 모델 경쟁 가속 (2026.02.20) — https://zdnet.co.kr/view/?no=20260220160826
  4. BizWatch, 더 묵직해진 독파모, 4파전에서 3파전으로 (2026.08.04) — https://news.bizwatch.co.kr/article/mobile/2026/08/04/0005
  5. 파이낸셜뉴스, 2차전 결과 앞둔 '독파모' 4개팀… AI 경쟁력 글로벌 입증 (2026.08.11) — https://www.fnnews.com/news/202608111816455621
  6. 데일리뉴스, [연속기획①] 독자 AI 파운데이션 모델, 지금 어디까지 왔나http://www.idailynews.co.kr/news/articleView.html?idxno=106367

신뢰도 고지 — 본 문서의 Qwen3.8-27B 성능 수치는 전량 알리바바 자체 공표치이며, 작성 시점 기준 독립 재현 검증이 확인되지 않았다. 하드웨어 소요량은 가중치 기준 계산치로 KV 캐시를 포함하지 않는다. 독파모 2차 단계평가 결과는 본 문서 작성 시점(2026.08.16) 기준 미발표 상태다.