
Qwen이 Qwen3.8-Flash-Next를 공개했다. 오픈 웨이트 멀티모달 MoE 모델인데, 그냥 신모델 하나 낸 게 아니라 Qwen4에 들어갈 아키텍처를 미리 풀어놓은 것이라 좀 눈여겨볼 만하더라.
예전에 Qwen3-Next가 Qwen3.5의 예고편 역할을 했었는데, 그때 나온 하이브리드 구조가 3.5부터 3.8까지 쭉 쓰였다. 이번에도 같은 식으로 정식 제품군 만들기 전에 커뮤니티가 먼저 뜯어보라고 던진 거다.
1. Qwen3.8-Flash-Next
일단 숫자부터 보면 이렇다.
| 항목 | 값 |
|---|---|
| 전체 파라미터 | 125B |
| 활성 파라미터 | 6B |
| N-gram Embedding | 별도 51B |
| 레이어 | 48층 |
| 전문가(Expert) | 512개 중 11개 활성 |
| 컨텍스트 | 262,144 (YaRN으로 1M) |
| 라이선스 | Qwen Community 1.0 |
125B짜리인데 토큰 하나 처리할 때 6B만 켜진다. 여기에 Embedding 51B가 따로 붙는데, 이건 계산에 거의 안 들어가서 호스트 메모리로 빼둘 수도 있다고 하더라.
Qwen이 이번에 내세우는 건 성능보다 비용이다. Qwen3.7-Plus랑 비교해서 학습 비용이 약 9분의 1밖에 안 들었고, 1M 컨텍스트에 캐시 적중률 90% 조건에서는 프리필 처리량이 8.6배까지 나온다고 한다.
물론 둘 다 Qwen이 자체 발표한 수치니까 걸러 들어야 한다.
2. 아키텍처 변경점
Attention, Residual, Embedding, Optimization 이렇게 네 군데를 손봤다고 한다.

Attention - GDN + QSA
네 층 중 세 층은 Gated DeltaNet이 맡아서 과거 정보를 고정 크기 상태로 계속 압축해두고, 나머지 한 층만 전역 Attention으로 전체 맥락에서 정확히 찾아오는 식이다.
여기서 그 전역 Attention 자리에 QSA(Qwen Sparse Attention)를 새로 끼워 넣은 게 이번 변경점이다.

기존 Sparse Attention은 중요한 위치를 토큰 하나하나 단위로 골랐는데, 문맥이 길어지면 그 고르는 작업 자체가 무시 못 할 부담이 되어버린다.
QSA는 시퀀스를 마이크로 블록으로 먼저 뭉친 다음 블록 단위로 중요도를 잰다. 쉽게 말해 낱개로 훑던 걸 묶음으로 훑는 거다. 그래서 Attention 비용이랑 색인 비용이 같이 줄어든다.
Residual - Gated Residual
보통 트랜스포머는 모든 층이 같은 통로 하나를 읽고 쓰는 구조라, 층이 깊어질수록 초반 정보가 계속 섞이면서 희석돼버린다.
이걸 4개 분기로 넓혀놨다. 어느 분기에서 얼마나 읽고 쓸지는 게이트가 그때그때 알아서 정해준다.
재밌는 게, 학습해놓고 보니까 한 분기가 첫 Attention 층을 중후반 층까지 그대로 잇는 통로로 자연스럽게 자리잡았다고 한다. 설계해서 그렇게 만든 게 아니라 알아서 그렇게 됐다는 거다.
덤으로 활성값 이상치도 눌려서 학습이 안정되고, Residual 상태는 FP8로 저장할 수 있다고 한다.
Embedding - N-gram
일반 Embedding은 토큰 하나로 표를 찾는데, N-gram Embedding은 앞 토큰 몇 개까지 묶어서 찾는다. 흔한 어구나 국소 패턴에 별도 표현을 주는 셈이다.
핵심은 토큰당 계산이 거의 안 늘면서 파라미터만 크게 붙는다는 거다. 찾을 위치를 미리 알 수 있으니까 호스트 메모리에 던져놓고 비동기로 당겨오면 그만이고.
Gemma 3n의 레이어별 Embedding이랑 DeepSeek Engram에서 아이디어를 가져왔다고 밝혀놨더라.
Optimization - Muon
Muon 옵티마이저를 쓰되 AdamW랑 역할을 나눠서 가중치 종류별로 붙였고, 스케일링 법칙도 새 구조에 맞춰 다시 맞췄다고 한다.
그 덕에 배치 크기 워밍업을 아예 없애고 처음부터 목표 배치로 시작할 수 있게 됐고, 총 스텝 수가 확 줄었다고 한다.
3. 벤치마크
Qwen이 공개한 표에서 눈에 띄는 것만 골라 옮겨봤다.

| 항목 | Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek-V4-Flash |
|---|---|---|---|---|
| 활성 파라미터 | 6B | 27B | 17B | 13B |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 |
| SWE-bench Multilingual | 81.0 | 73.8 | 75.8 | — |
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 |
| CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 |
| JobBench | 55.7 | 33.4 | 27.6 | 41.3 |
| Toolathlon | 73.5 | 67.1 | 50.6 | 70.3 |
| GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 |
| LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 |
활성 6B로 397B짜리 Qwen3.7-Plus를 대부분 앞선다. JobBench는 55.7 대 27.6이니까 아예 두 배 차이가 난다.
그렇다고 다 이기는 건 아니고, NL2Repo-Bench는 48.1로 DeepSeek-V4-Flash(54.2)한테 밀린다. 저장소 단위로 코드 짜는 벤치마크인데 여기선 좀 아쉽다. HLE도 35.9라 Claude Opus 4.6(40.0)한테 밀리고.
멀티모달 쪽도 같이 냈는데 AndroidWorld 84.5, OSWorld 2.0 부분점수 52.3, RealWorldQA 88.5 정도 나왔더라. 물론 전부 Qwen이 자체 측정한 수치라는 건 감안하고 봐야 한다.
4. 로컬 실행
Unsloth가 GGUF 양자화를 벌써 올려놨다. 용량 확인해보니 이렇더라.
| 양자화 | 용량 |
|---|---|
| UD-IQ1_S | 67.6GB |
| UD-IQ1_M | 69.4GB |
| UD-Q2_K_XL | 73.5GB |
| UD-IQ3_XXS | 76.3GB |
| UD-Q3_K_XL | 83.8GB |
| UD-IQ4_XS | 87.2GB |
| UD-Q4_K_XL | 103.7GB |
제일 작은 게 67.6GB다. 일반 그래픽카드로는 답이 없다. 이건 뭐 쳐다볼 수준이 아니더라.
Simon Willison은 DGX Spark에서 IQ1_S랑 Q2_K_XL을 돌려봤다고 적어놨는데, 통합 메모리 128GB급쯤 되면 Q2까지는 올라간다는 얘기인 것 같다.
서빙은 SGLang, vLLM, TokenSpeed가 공식 레시피를 냈다. 기본이 사고 모드라 끄려면 모델 카드에 적힌 대로 따로 설정해줘야 하고, 권장 샘플링 값도 사고 모드는 temperature 1.0, 일반 모드는 0.7로 다르다.
지난번에 정리한 Qwen3.8-27B는 24GB 카드에서도 돌았는데, 이건 체급이 아예 다르다.
5. 가격과 서빙
오픈 웨이트는 Hugging Face랑 ModelScope에 올라와 있고, 상용 버전은 Qwen3.8-Flash라는 이름으로 QwenCloud에서 돌아간다. 이쪽은 기본 컨텍스트가 1M이고 내장 도구도 붙어 있더라.
| 구분 | 가격 |
|---|---|
| 입력 | 100만 토큰당 0.16달러 |
| 출력 | 100만 토큰당 0.47달러 |
활성 파라미터가 6B밖에 안 되니까 이런 가격이 나오는 거다. 이 정도면 꽤 싼 편이다.
마무리
정리하면 이렇다.
- Qwen4에 들어갈 아키텍처를 미리 공개한 오픈 웨이트 모델
- 125B 중 6B만 활성, 계산이 거의 없는 51B Embedding이 별도
- Attention · Residual · Embedding · Optimization 네 군데를 손봄
- 학습 비용 1/9, 프리필 8.6배는 Qwen 자체 발표 수치
- GGUF 최소 67.6GB — 로컬은 사실상 워크스테이션급
솔직히 개인이 집에서 돌리기엔 무리다. 나도 아직 못 돌려봤고, 당분간은 API로나 만져볼 것 같다.
그래도 Qwen4가 어떤 모양으로 나올지 미리 보여준다는 점에서 볼 가치는 충분한 것 같다. 활성 파라미터는 계속 줄이고 계산 안 드는 Embedding으로 용량을 채우는 방향인데, 이게 다음 세대 흐름이 될지 궁금하다.
나중에 DGX Spark 같은 게 손에 들어오면 직접 돌려보고 후기 남겨보겠다!
참고 자료
'오픈소스' 카테고리의 다른 글
| Claude SEO 사용법 - 내 사이트 점검했더니 59점 나왔다 (0) | 2026.08.26 |
|---|---|
| Claude Design vs OpenDesign - AI로 디자인하는 두 가지 방법 (0) | 2026.08.24 |
| AI로 UI 만들 때 참고하는 사이트 정리 - 컴포넌트부터 DESIGN.md까지 (0) | 2026.08.24 |
| OmniRoute - 무료 AI 티어 351곳을 한 엔드포인트로 묶기 (0) | 2026.08.24 |
| CLIProxyAPI - Claude Code·Codex 구독을 API로 바꿔 쓰기 (0) | 2026.08.20 |