Qwen3.8-Flash-Next 정리 - Qwen4 아키텍처 미리보기

2026. 8. 28. 09:57/오픈소스

Qwen3.8-Flash-Next 배너

Qwen이 Qwen3.8-Flash-Next를 공개했다. 오픈 웨이트 멀티모달 MoE 모델인데, 그냥 신모델 하나 낸 게 아니라 Qwen4에 들어갈 아키텍처를 미리 풀어놓은 것이라 좀 눈여겨볼 만하더라.

예전에 Qwen3-Next가 Qwen3.5의 예고편 역할을 했었는데, 그때 나온 하이브리드 구조가 3.5부터 3.8까지 쭉 쓰였다. 이번에도 같은 식으로 정식 제품군 만들기 전에 커뮤니티가 먼저 뜯어보라고 던진 거다.

 


1. Qwen3.8-Flash-Next

일단 숫자부터 보면 이렇다.

항목 값
전체 파라미터 125B
활성 파라미터 6B
N-gram Embedding 별도 51B
레이어 48층
전문가(Expert) 512개 중 11개 활성
컨텍스트 262,144 (YaRN으로 1M)
라이선스 Qwen Community 1.0

125B짜리인데 토큰 하나 처리할 때 6B만 켜진다. 여기에 Embedding 51B가 따로 붙는데, 이건 계산에 거의 안 들어가서 호스트 메모리로 빼둘 수도 있다고 하더라.

 

Qwen이 이번에 내세우는 건 성능보다 비용이다. Qwen3.7-Plus랑 비교해서 학습 비용이 약 9분의 1밖에 안 들었고, 1M 컨텍스트에 캐시 적중률 90% 조건에서는 프리필 처리량이 8.6배까지 나온다고 한다.

물론 둘 다 Qwen이 자체 발표한 수치니까 걸러 들어야 한다.

 


2. 아키텍처 변경점

Attention, Residual, Embedding, Optimization 이렇게 네 군데를 손봤다고 한다.

Qwen3.8-Flash-Next 아키텍처 구조도

 

Attention - GDN + QSA

네 층 중 세 층은 Gated DeltaNet이 맡아서 과거 정보를 고정 크기 상태로 계속 압축해두고, 나머지 한 층만 전역 Attention으로 전체 맥락에서 정확히 찾아오는 식이다.

여기서 그 전역 Attention 자리에 QSA(Qwen Sparse Attention)를 새로 끼워 넣은 게 이번 변경점이다.

Qwen Sparse Attention 구조

기존 Sparse Attention은 중요한 위치를 토큰 하나하나 단위로 골랐는데, 문맥이 길어지면 그 고르는 작업 자체가 무시 못 할 부담이 되어버린다.

QSA는 시퀀스를 마이크로 블록으로 먼저 뭉친 다음 블록 단위로 중요도를 잰다. 쉽게 말해 낱개로 훑던 걸 묶음으로 훑는 거다. 그래서 Attention 비용이랑 색인 비용이 같이 줄어든다.

 

Residual - Gated Residual

보통 트랜스포머는 모든 층이 같은 통로 하나를 읽고 쓰는 구조라, 층이 깊어질수록 초반 정보가 계속 섞이면서 희석돼버린다.

이걸 4개 분기로 넓혀놨다. 어느 분기에서 얼마나 읽고 쓸지는 게이트가 그때그때 알아서 정해준다.

재밌는 게, 학습해놓고 보니까 한 분기가 첫 Attention 층을 중후반 층까지 그대로 잇는 통로로 자연스럽게 자리잡았다고 한다. 설계해서 그렇게 만든 게 아니라 알아서 그렇게 됐다는 거다.

덤으로 활성값 이상치도 눌려서 학습이 안정되고, Residual 상태는 FP8로 저장할 수 있다고 한다.

 

Embedding - N-gram

일반 Embedding은 토큰 하나로 표를 찾는데, N-gram Embedding은 앞 토큰 몇 개까지 묶어서 찾는다. 흔한 어구나 국소 패턴에 별도 표현을 주는 셈이다.

핵심은 토큰당 계산이 거의 안 늘면서 파라미터만 크게 붙는다는 거다. 찾을 위치를 미리 알 수 있으니까 호스트 메모리에 던져놓고 비동기로 당겨오면 그만이고.

Gemma 3n의 레이어별 Embedding이랑 DeepSeek Engram에서 아이디어를 가져왔다고 밝혀놨더라.

 

Optimization - Muon

Muon 옵티마이저를 쓰되 AdamW랑 역할을 나눠서 가중치 종류별로 붙였고, 스케일링 법칙도 새 구조에 맞춰 다시 맞췄다고 한다.

그 덕에 배치 크기 워밍업을 아예 없애고 처음부터 목표 배치로 시작할 수 있게 됐고, 총 스텝 수가 확 줄었다고 한다.

 


3. 벤치마크

Qwen이 공개한 표에서 눈에 띄는 것만 골라 옮겨봤다.

1M 컨텍스트 프리필 처리량 비교

항목 Flash-Next Qwen3.8-27B Qwen3.7-Plus DeepSeek-V4-Flash
활성 파라미터 6B 27B 17B 13B
SWE-bench Pro 62.5 61.7 55.8 56.0
SWE-bench Multilingual 81.0 73.8 75.8 —
DeepSWE 1.1 58.7 42.2 16.5 54.4
CoWorkBench 73.9 70.7 65.1 45.1
JobBench 55.7 33.4 27.6 41.3
Toolathlon 73.5 67.1 50.6 70.3
GPQA Diamond 91.7 89.2 90.3 90.8
LiveCodeBench v6 91.9 90.3 89.6 90.6

활성 6B로 397B짜리 Qwen3.7-Plus를 대부분 앞선다. JobBench는 55.7 대 27.6이니까 아예 두 배 차이가 난다.

그렇다고 다 이기는 건 아니고, NL2Repo-Bench는 48.1로 DeepSeek-V4-Flash(54.2)한테 밀린다. 저장소 단위로 코드 짜는 벤치마크인데 여기선 좀 아쉽다. HLE도 35.9라 Claude Opus 4.6(40.0)한테 밀리고.

멀티모달 쪽도 같이 냈는데 AndroidWorld 84.5, OSWorld 2.0 부분점수 52.3, RealWorldQA 88.5 정도 나왔더라. 물론 전부 Qwen이 자체 측정한 수치라는 건 감안하고 봐야 한다.

 


4. 로컬 실행

Unsloth가 GGUF 양자화를 벌써 올려놨다. 용량 확인해보니 이렇더라.

양자화 용량
UD-IQ1_S 67.6GB
UD-IQ1_M 69.4GB
UD-Q2_K_XL 73.5GB
UD-IQ3_XXS 76.3GB
UD-Q3_K_XL 83.8GB
UD-IQ4_XS 87.2GB
UD-Q4_K_XL 103.7GB

제일 작은 게 67.6GB다. 일반 그래픽카드로는 답이 없다. 이건 뭐 쳐다볼 수준이 아니더라.

Simon Willison은 DGX Spark에서 IQ1_S랑 Q2_K_XL을 돌려봤다고 적어놨는데, 통합 메모리 128GB급쯤 되면 Q2까지는 올라간다는 얘기인 것 같다.

 

서빙은 SGLang, vLLM, TokenSpeed가 공식 레시피를 냈다. 기본이 사고 모드라 끄려면 모델 카드에 적힌 대로 따로 설정해줘야 하고, 권장 샘플링 값도 사고 모드는 temperature 1.0, 일반 모드는 0.7로 다르다.

 

지난번에 정리한 Qwen3.8-27B는 24GB 카드에서도 돌았는데, 이건 체급이 아예 다르다.

 


5. 가격과 서빙

오픈 웨이트는 Hugging Face랑 ModelScope에 올라와 있고, 상용 버전은 Qwen3.8-Flash라는 이름으로 QwenCloud에서 돌아간다. 이쪽은 기본 컨텍스트가 1M이고 내장 도구도 붙어 있더라.

구분 가격
입력 100만 토큰당 0.16달러
출력 100만 토큰당 0.47달러

활성 파라미터가 6B밖에 안 되니까 이런 가격이 나오는 거다. 이 정도면 꽤 싼 편이다.

 


마무리

정리하면 이렇다.

  • Qwen4에 들어갈 아키텍처를 미리 공개한 오픈 웨이트 모델
  • 125B 중 6B만 활성, 계산이 거의 없는 51B Embedding이 별도
  • Attention · Residual · Embedding · Optimization 네 군데를 손봄
  • 학습 비용 1/9, 프리필 8.6배는 Qwen 자체 발표 수치
  • GGUF 최소 67.6GB — 로컬은 사실상 워크스테이션급

솔직히 개인이 집에서 돌리기엔 무리다. 나도 아직 못 돌려봤고, 당분간은 API로나 만져볼 것 같다.

그래도 Qwen4가 어떤 모양으로 나올지 미리 보여준다는 점에서 볼 가치는 충분한 것 같다. 활성 파라미터는 계속 줄이고 계산 안 드는 Embedding으로 용량을 채우는 방향인데, 이게 다음 세대 흐름이 될지 궁금하다.

나중에 DGX Spark 같은 게 손에 들어오면 직접 돌려보고 후기 남겨보겠다!

 


참고 자료

  • Qwen 공식 발표
  • Hugging Face 모델 카드
  • Unsloth GGUF 양자화
  • 기술 보고서
  • Qwen3.8-27B GGUF 양자화 정리
728x90
반응형

'오픈소스' 카테고리의 다른 글

Claude SEO 사용법 - 내 사이트 점검했더니 59점 나왔다  (0) 2026.08.26
Claude Design vs OpenDesign - AI로 디자인하는 두 가지 방법  (0) 2026.08.24
AI로 UI 만들 때 참고하는 사이트 정리 - 컴포넌트부터 DESIGN.md까지  (0) 2026.08.24
OmniRoute - 무료 AI 티어 351곳을 한 엔드포인트로 묶기  (0) 2026.08.24
CLIProxyAPI - Claude Code·Codex 구독을 API로 바꿔 쓰기  (0) 2026.08.20
'오픈소스' 카테고리의 다른 글
  • Claude SEO 사용법 - 내 사이트 점검했더니 59점 나왔다
  • Claude Design vs OpenDesign - AI로 디자인하는 두 가지 방법
  • AI로 UI 만들 때 참고하는 사이트 정리 - 컴포넌트부터 DESIGN.md까지
  • OmniRoute - 무료 AI 티어 351곳을 한 엔드포인트로 묶기
창빵맨
창빵맨
창빵맨
  • 창빵맨
    Let's be Developers
    창빵맨·로그인
    ✏️ 글쓰기 💻 관리
  • 전체
    오늘
    어제
    • 분류 전체보기 (500)
      • 오픈소스 (52)
      • ML & DL (85)
        • Computer v.. (22)
        • NLP (22)
        • 파이썬 머신러닝 완.. (3)
        • 개념정리 (38)
      • 리눅스 (22)
      • 프로젝트 (29)
        • 산불 발생 예측 (6)
        • 음성비서 (12)
        • pdf 병합 프로그.. (0)
        • 수위 예측 (5)
        • 가짜 뉴스 분류 (5)
        • 전력사용량 예측 (1)
      • 코딩테스트 (217)
        • 프로그래머스[Pyt.. (17)
        • 프로그래머스[Fai.. (3)
        • 백준[Python] (160)
        • 이것이취업을위한코딩.. (18)
        • 파이썬 알고리즘 (19)
      • 데이터분석실습 (25)
        • 데이터 과학 기반의.. (18)
        • 헬로 데이터 과학 (7)
      • 메모장 (0)
      • 잡담 (4)
      • 삽질노트 (54)
  • 공지사항

  • 인기 글

  • 태그

    이분탐색
    이코테
    dp
    BFS
    이것이취업을위한코딩테스트다
    백준
    그리디
    오픈소스
    파이썬
    claudecode
  • 최근 댓글

  • 최근 글

  • hELLO· Designed By정상우.v4.10.3
상단으로

티스토리툴바