Qwen 3.8 Preview · 2026년 7월 20일
Qwen 3.8 Max 프리뷰 공개, 정식판 이후 오픈웨이트 예고: Qwen 3.7과 달라질 점
2.4T 초대형 모델, 멀티모달 에이전트, 그리고 오픈웨이트 복귀. 지금 확인된 사실과 Qwen3.7 대비 변화 예측을 분리해 정리했습니다.
Contents
이 글에서 확인할 내용
- 01한눈에 보는 현재 상황
- 022.4T Qwen3.8-Max-Preview에서 확인된 것
- 03Qwen3.7-Max의 기준점
- 04Qwen 3.7과 3.8, 현재 확인 가능한 비교
- 053.7에서 달라질 점 1: 멀티모달이 부가기능에서 중심축으로
- 063.7에서 달라질 점 2: 코딩보다 소프트웨어 엔지니어링 전체를 겨냥
- 073.7에서 달라질 점 3: 긴 컨텍스트의 길이보다 유지력이 개선될 가능성
- 083.7에서 달라질 점 4: 오픈웨이트 전략의 복귀
- 093.7에서 달라질 점 5: 로컬 실행은 더 어려워질 수 있음
- 10성능 전망: 무엇이 좋아지고 무엇은 지켜봐야 하나
- 11출시 일정과 공개 형태 예측
- 12지금 사용해 볼 사람과 기다릴 사람
- 132.4T 숫자를 제대로 읽는 방법
- 14멀티모달 변화가 실제 업무에서 의미하는 것
- 15에이전트 성능은 이렇게 비교해야 함
- 16오픈웨이트 공개 뒤 확인할 체크리스트
- 17가능한 모델 라인업을 세 가지로 예측
- 18국내 사용자가 특히 확인할 부분
- 19확정 정보와 예측을 다시 구분하면
- 20공개 직후 24시간에 확인할 순서
- 21과장된 해석을 피하기 위한 세 가지 원칙
- 22결론
안녕하세요. SCV입니다.
Qwen이 다시 초대형 오픈웨이트 경쟁에 뛰어듭니다. Alibaba Qwen 공식 계정은 2026년 7월 19일 Qwen3.8이 곧 출시되며 오픈웨이트로 공개될 예정이라고 밝혔습니다. 동시에 체험판인 Qwen3.8-Max-Preview를 Token Plan, Qoder, QoderWork에 먼저 열었습니다. 발표에서 가장 눈에 띄는 숫자는 2.4T, 즉 2조 4천억 개 파라미터입니다.
다만 지금 당장 내려받을 수 있는 Qwen3.8 가중치가 공개된 것은 아닙니다. 현재 이용 가능한 것은 클라우드 기반 프리뷰이고, 정식판 날짜·모델 파일·라이선스·활성 파라미터 수·요구 메모리는 아직 발표되지 않았습니다. 따라서 이번 글은 확인된 사실과 합리적 예측을 분리해 봅니다.
한눈에 보는 현재 상황
- 2026년 7월 19일 Qwen3.8 출시 및 오픈웨이트 계획 발표
- Qwen3.8-Max-Preview를 Token Plan, Qoder, QoderWork에 우선 제공
- 전체 파라미터 2.4T라고 공식 발표
- 프리뷰 기간에는 성능이 계속 업데이트될 수 있음
- 정식판 출시일과 오픈웨이트 파일 공개일은 미정
- 공식 벤치마크 표, 아키텍처, 활성 파라미터, 라이선스는 미공개
정리하면 ‘출시 예정’이라는 표현은 맞지만 프리뷰 자체는 이미 시작됐습니다. 사용자가 웹이나 구독형 도구에서 시험할 수 있는 단계이며, 로컬에서 내려받아 실행하는 단계는 아직 아닙니다.
2.4T Qwen3.8-Max-Preview에서 확인된 것
공식 X 게시물은 Qwen3.8이 2.4T 파라미터를 갖고 있으며 계속 진화하고 있다고 설명합니다. Qwen 측은 선도적인 프런티어 모델과 견줄 수 있고 Fable 5 다음으로 강력하다고 주장했습니다. 하지만 점수표와 평가 조건은 함께 제시하지 않았습니다. 이 문구는 독립 검증 결과가 아니라 제작사의 자체 평가라는 점을 기억해야 합니다.
Qwen AI 플랫폼의 Token Plan 문서에는 qwen3.8-max-preview가 추론, 시각 이해, 텍스트 생성을 지원하는 모델로 표시됩니다. 개인판과 팀판에서 모두 프리뷰를 지원하며, 프리뷰 기간 동안 모델 능력을 계속 반복 개선하고 종료 후에는 모델이 내려가거나 정식판으로 교체될 수 있다고 안내합니다. 같은 모델명을 호출해도 프리뷰 기간 중 출력 성향이 달라질 수 있다는 뜻입니다.
현재 공식 안내와 보도를 종합하면 Qwen3.8-Max-Preview의 초점은 단순 채팅보다 풀스택 개발, 데이터 분석, 전문 오피스 작업, 여러 에이전트가 이어서 수행하는 장기 작업에 가깝습니다. Qwen3.7-Max가 이미 에이전트와 장기 실행을 전면에 내세웠다면 3.8은 그 방향을 더 큰 스케일과 멀티모달 입력으로 확장한 세대라고 볼 수 있습니다.
Qwen3.7-Max의 기준점
Qwen3.7-Max는 2026년 5월 공개된 Max 계열 플래그십입니다. 공식 모델 문서 기준 컨텍스트 창은 1M 토큰, 최대 출력은 64K, 사고 예산은 최대 256K입니다. 함수 호출과 내장 도구, 배치 처리를 지원하고 복잡한 추론과 프로그래밍에 권장됩니다.
출시 기록을 보면 2026년 5월 20일 스냅샷은 텍스트 중심 모델로 소개됐고, 2026년 6월 8일 스냅샷은 시각 모달 이해가 추가됐습니다. 즉 3.7 역시 고정된 단일 버전이 아니라 짧은 주기로 보강됐습니다. 이 흐름은 ‘일 단위로 진화한다’는 3.8 프리뷰 운영 방식으로 이어진 것으로 보입니다.
Qwen3.7-Max는 성능이 강하지만 공식 가중치가 배포되지 않은 API 중심 모델이었습니다. 그래서 로컬 LLM 커뮤니티에서는 Qwen의 공개형 모델 전략이 줄어드는 것 아니냐는 우려가 있었습니다. Qwen3.8에서 오픈웨이트를 다시 명시한 것은 단순 성능 향상만큼 중요한 변화입니다.
Qwen 3.7과 3.8, 현재 확인 가능한 비교
| 구분 | Qwen3.7-Max | Qwen3.8-Max-Preview |
|---|---|---|
| 상태 | 정식 API 모델 | 클라우드 프리뷰 |
| 공개 시점 | 2026년 5월 | 2026년 7월 19일 프리뷰 |
| 파라미터 | 공식 수치 미공개 | 전체 2.4T 발표 |
| 입력 | 텍스트, 최신 스냅샷은 시각 이해 | 텍스트·시각 이해 확인 |
| 컨텍스트 | 1M | 공식 상세 미공개 |
| 최대 출력 | 64K | 공식 상세 미공개 |
| 도구·에이전트 | 함수 호출과 내장 도구 | Qoder·QoderWork 복합 작업 중심 |
| 공개 방식 | API 중심, 가중치 미공개 | 정식판과 오픈웨이트 예고 |
| 검증 상태 | 운영 문서와 스냅샷 존재 | 공식 점수표와 독립 평가 부족 |
여기서 주의할 부분은 2.4T가 곧 추론 시 매 토큰마다 2.4T 전부를 계산한다는 뜻은 아니라는 점입니다. 초대형 모델은 일반적으로 MoE 구조를 활용해 일부 전문가만 활성화합니다. 그러나 Qwen은 아직 3.8의 구조와 활성 파라미터 수를 밝히지 않았으므로 정확한 GPU 요구량과 속도를 계산할 수 없습니다.
3.7에서 달라질 점 1: 멀티모달이 부가기능에서 중심축으로
가장 가능성이 높은 변화는 멀티모달 통합의 강화입니다. Qwen3.7-Max도 후속 스냅샷에서 시각 이해를 추가했지만, Qwen3.8-Max-Preview는 Token Plan 표에서 처음부터 시각 이해를 주요 능력으로 표시합니다. 관련 보도는 이미지, 영상, 문서를 텍스트와 함께 처리한다고 전합니다.
따라서 3.8은 화면 캡처를 보고 코드를 고치거나, 긴 보고서의 표와 도표를 읽고, 여러 문서와 영상을 연결해 결론을 내리는 작업에서 개선될 가능성이 큽니다. 단순 이미지 질의응답보다 ‘보고 판단하고 도구를 실행하는’ 멀티모달 에이전트가 핵심일 것입니다. 예상 확률은 높음입니다.
3.7에서 달라질 점 2: 코딩보다 소프트웨어 엔지니어링 전체를 겨냥
공식 소개가 풀스택 개발, 데이터 분석, 오피스 워크플로, 복수 에이전트, 장기 작업을 반복해서 언급한다는 점도 중요합니다. 이는 코드 한 함수를 잘 생성하는 능력보다 저장소 탐색, 계획 수립, 파일 수정, 테스트, 오류 복구, 결과 보고까지 이어지는 성공률을 높이겠다는 신호입니다.
Qwen3.7-Max도 에이전트 시대를 겨냥했지만 3.8은 Qoder와 QoderWork를 프리뷰 배포 채널로 선택했습니다. 실제 제품 안에서 도구 호출 실패와 장기 실행 중 맥락 손실을 빠르게 수집하고 모델을 업데이트하려는 전략으로 읽힙니다. 코딩 벤치마크 점수보다 실제 작업 완주율을 우선할 가능성이 높습니다. 예상 확률은 높음입니다.
3.7에서 달라질 점 3: 긴 컨텍스트의 길이보다 유지력이 개선될 가능성
Qwen3.7-Max는 이미 1M 컨텍스트를 제공합니다. 그러므로 3.8의 차별점이 단순히 2M처럼 숫자를 늘리는 데만 있지는 않을 가능성이 큽니다. 긴 코드베이스와 여러 문서를 넣었을 때 초반 지시를 잊지 않는 능력, 필요한 근거를 다시 찾는 능력, 긴 작업 중 계획을 수정하는 능력이 더 중요합니다.
3.8도 최소 1M급 컨텍스트를 유지할 가능성은 높지만, 현재 공식 한도는 공개되지 않았습니다. 1M 유지 가능성은 높음, 1M 초과 확대 가능성은 중간으로 보는 편이 안전합니다. 최대 출력 역시 3.7의 64K 이상일 수 있지만 확정 수치처럼 쓰면 안 됩니다.
3.7에서 달라질 점 4: 오픈웨이트 전략의 복귀
사용자 입장에서 가장 큰 변화는 정식판 이후 가중치 공개 예고입니다. 오픈웨이트가 실제로 이뤄지면 기업은 사내망 배포, 파인튜닝, 양자화, 자체 평가를 진행할 수 있습니다. 연구자는 모델의 편향과 안전성을 더 투명하게 분석할 수 있고, 서빙 업체는 독자적인 최적화 버전을 제공할 수 있습니다.
다만 ‘오픈웨이트’와 ‘완전한 오픈소스’는 같은 말이 아닙니다. 학습 데이터와 전체 학습 코드까지 공개한다는 약속은 없습니다. 라이선스가 Apache 2.0인지 별도 조건이 붙는지, 2.4T Max 전체 가중치가 공개되는지, 더 작은 파생 모델만 공개되는지도 확인되지 않았습니다. 공식 게시물은 Qwen3.8이 오픈웨이트로 간다고 말하지만 체크포인트 구성은 공개하지 않았습니다.
3.7에서 달라질 점 5: 로컬 실행은 더 어려워질 수 있음
2.4T 전체 가중치가 공개된다면 규모는 개인용 GPU 수준을 크게 넘어섭니다. 단순 계산으로도 FP16은 가중치만 약 4.8TB, FP8은 약 2.4TB, 4비트는 약 1.2TB가 필요합니다. 실제 서빙에는 KV 캐시, 런타임 버퍼, 전문가 배치와 통신 여유가 더 필요합니다. MoE라서 활성 계산량이 줄어도 저장해야 할 전체 가중치 규모는 별개 문제입니다.
따라서 ‘오픈웨이트 공개 = 집의 GPU 한 장으로 실행’은 아닙니다. 현실적인 접근은 클라우드 API, 다중 GPU 서버, 여러 노드 분산 추론, 강한 양자화, 혹은 추후 공개될 소형 3.8 계열을 기다리는 것입니다. 소형 Dense나 A3B·A10B 계열이 함께 나올 가능성은 있지만 아직 발표가 없으므로 기대와 사실을 구분해야 합니다.
성능 전망: 무엇이 좋아지고 무엇은 지켜봐야 하나
좋아질 가능성이 높은 영역은 복합 코딩 작업, 긴 문서와 저장소 분석, 화면 기반 작업, 전문 오피스 자동화, 여러 도구를 순서대로 호출하는 에이전트 작업입니다. 3.7에서 이미 확보한 1M 컨텍스트와 도구 사용 기반 위에 더 큰 모델과 멀티모달 학습을 얹는 방향이기 때문입니다.
반면 단정하기 어려운 영역도 많습니다. 수학·과학 추론, 한국어 문체, 환각률, 응답 지연, 토큰당 가격, 장시간 실행 안정성은 공개 점수와 반복 테스트가 필요합니다. 초기 사용자 보고에는 출력 품질이 빠르게 달라졌거나 사고 루프에 빠졌다는 사례도 있지만, 프리뷰 초기의 설정 문제인지 모델 자체 문제인지 구분하기 어렵습니다. 커뮤니티 경험은 참고 자료일 뿐 결론은 아닙니다.
출시 일정과 공개 형태 예측
공식 표현은 ‘곧’이며 날짜는 없습니다. Token Plan 문서는 프리뷰 종료 뒤 해당 모델이 내려가거나 정식판으로 교체될 수 있다고 설명합니다. 가장 자연스러운 순서는 프리뷰 운영, 품질 및 서빙 조정, 정식 Max 출시, 모델 카드와 API 세부 사양 공개, 오픈웨이트 체크포인트 공개입니다. 정식판과 가중치가 같은 날 나올 수도 있지만 시차가 생길 가능성도 있습니다.
공개 체크포인트는 세 가지 시나리오로 볼 수 있습니다. 첫째 2.4T Max 전체를 공개하는 경우, 둘째 Max와 효율형 MoE를 함께 공개하는 경우, 셋째 Qwen3.8 이름 아래 더 작은 파생 모델만 공개하는 경우입니다. 공식 문구만 보면 첫 번째에 대한 기대가 크지만, 라이선스와 모델 목록이 나오기 전에는 확정할 수 없습니다.
지금 사용해 볼 사람과 기다릴 사람
Qoder나 QoderWork를 사용하고 복잡한 코드 작업을 비교하려는 개발자, 중국 지역 Token Plan 접근이 가능하고 프리뷰 변화를 감수할 수 있는 사용자는 지금 시험해 볼 만합니다. 동일한 프롬프트와 저장소로 Qwen3.7-Max와 3.8 프리뷰를 비교하고 완주율, 수정 파일 수, 테스트 통과율, 소비 크레딧을 기록하면 유용합니다.
반대로 안정적인 API 계약, 재현 가능한 출력, 고정 가격, 데이터 거버넌스 문서가 필요한 기업은 정식판을 기다리는 편이 안전합니다. 로컬 실행이 목적이라면 모델 파일과 라이선스, 양자화 지원, vLLM·SGLang·llama.cpp 호환 정보가 나온 뒤 판단해야 합니다.
2.4T 숫자를 제대로 읽는 방법
파라미터 수는 모델 규모를 보여 주는 지표지만 성능 순위를 그대로 결정하지는 않습니다. 학습 데이터의 품질, 학습 토큰 수, 전문가 라우팅, 사후 학습, 강화학습, 추론 시간 확장, 도구 사용 방식이 실제 결과를 크게 바꿉니다. 2.4T라는 숫자만 보고 더 작은 모델보다 항상 빠르고 정확하다고 결론 내릴 수 없는 이유입니다.
특히 MoE 모델에서는 전체 파라미터와 활성 파라미터를 나눠 봐야 합니다. 전체 파라미터는 모델 파일 크기와 분산 저장 부담에 직접 영향을 주고, 토큰당 활성 파라미터는 계산량과 지연 시간에 더 가까운 지표입니다. 전문가가 몇 개인지, 토큰마다 몇 개 전문가를 선택하는지, 공유 전문가가 있는지에 따라 같은 2.4T라도 비용은 크게 달라집니다. Qwen3.8의 해당 수치가 나오기 전에는 다른 모델과 효율을 정확히 비교할 수 없습니다.
메모리 대역폭과 노드 사이 통신도 중요합니다. 초대형 MoE는 필요한 전문가가 서로 다른 GPU나 서버에 흩어져 있을 때 통신 지연이 발생합니다. 요청이 적은 개인 실험과 수천 명이 동시에 쓰는 서비스의 최적 설정도 다릅니다. Alibaba가 프리뷰를 자사 서비스에서 먼저 운영하는 이유 중 하나는 모델 품질뿐 아니라 라우팅, 캐시, 병렬화, 배치 처리의 실제 데이터를 모으기 위해서일 가능성이 큽니다.
따라서 정식 공개 때는 총 파라미터 외에 활성 파라미터, 레이어 수, 전문가 수, 지원 정밀도, 최소 GPU 구성, 권장 서빙 프레임워크를 함께 확인해야 합니다. 이 정보가 있어야 ‘크다’는 홍보를 ‘얼마나 빠르고 경제적인가’라는 실무 판단으로 바꿀 수 있습니다.
멀티모달 변화가 실제 업무에서 의미하는 것
멀티모달은 이미지에 무엇이 있는지 묻는 기능만 뜻하지 않습니다. 개발 작업에서는 오류가 난 웹 화면과 브라우저 콘솔, 디자인 시안, 기존 소스 코드를 한꺼번에 보고 수정 계획을 세울 수 있습니다. 오피스 업무에서는 긴 보고서, 표, 차트, 스캔 문서, 회의 자료를 연결해 수치 불일치나 빠진 근거를 찾는 방식으로 활용할 수 있습니다.
Qwen3.7의 시각 기능이 후속 스냅샷에서 추가된 반면 3.8은 프리뷰 단계부터 전문 작업의 한 축으로 강조됩니다. 이 차이가 실제로 나타난다면 이미지 인식 점수보다 이미지와 텍스트 사이의 근거 연결이 개선될 가능성이 큽니다. 예를 들어 화면의 버튼 위치를 설명하는 데서 끝나지 않고 저장소의 해당 컴포넌트를 찾아 수정하고 테스트까지 수행해야 진짜 에이전트 개선이라고 볼 수 있습니다.
영상과 긴 문서를 다룬다는 보도도 있지만 입력 한도, 지원 형식, 최대 파일 크기, 영상 길이는 아직 공식 모델 사양으로 확인되지 않았습니다. 멀티모달을 도입하려는 기업은 화려한 데모보다 OCR 정확도, 표 구조 보존, 페이지 인용, 프레임 위치 인용, 개인정보 마스킹을 따로 시험해야 합니다. 원문 근거를 정확히 표시하지 못하면 전문 업무에서는 답변이 그럴듯해도 검증 비용이 커집니다.
한국어 사용자에게는 한글 문서의 표와 각주, 혼합된 한자·영문 약어, 세로로 긴 모바일 화면을 얼마나 안정적으로 읽는지가 중요합니다. 글로벌 멀티모달 벤치마크가 높아도 국내 문서 양식에서 같은 품질이 나온다고 보장할 수 없습니다. 정식판이 나오면 한국어 계약서, 공공기관 보고서, 쇼핑몰 화면, 개발 문서로 별도 평가할 필요가 있습니다.
에이전트 성능은 이렇게 비교해야 함
Qwen3.7-Max와 3.8 프리뷰를 비교할 때 한 번의 멋진 결과만 캡처하면 판단을 그르치기 쉽습니다. 같은 작업을 최소 여러 차례 반복하고 성공 조건을 먼저 정해야 합니다. 코드 작업이라면 테스트 통과, 린트 오류, 변경 범위, 되돌린 횟수, 사람의 추가 수정 시간을 기록하는 편이 좋습니다.
첫 번째 시험은 작은 버그 수정입니다. 재현 절차와 실패 테스트를 제공하고 원인을 찾은 뒤 최소 변경으로 고치게 합니다. 두 번째는 저장소 수준 기능 추가입니다. 요구사항, 기존 구조, 테스트 명령을 주고 계획부터 구현까지 맡깁니다. 세 번째는 화면 기반 수정입니다. 완성 화면과 목표 시안을 함께 주고 시각적 차이와 접근성 문제를 해결하게 합니다.
네 번째는 긴 문서 분석입니다. 서로 다른 문서 여러 개에 흩어진 숫자와 조건을 교차 검증하고 모든 결론에 출처 위치를 달게 합니다. 다섯 번째는 오피스 자동화입니다. 원본 표를 읽어 계산하고 요약 보고서와 발표 구조를 만들게 합니다. 여섯 번째는 장기 에이전트 작업입니다. 중간 오류를 일부러 넣고 스스로 복구하는지, 같은 행동을 반복하는 루프에 빠지는지 확인합니다.
평가표에는 최종 성공 여부뿐 아니라 첫 유효 결과까지 걸린 시간, 입력과 출력 토큰, 도구 호출 수, 잘못된 도구 호출, 중복 수정, 테스트 실행 횟수, 총비용을 넣어야 합니다. 3.8이 더 높은 성공률을 보여도 시간이 두 배 걸리거나 비용이 크게 늘면 모든 업무에서 유리한 것은 아닙니다. 반대로 비용이 조금 높아도 사람의 검토 시간을 크게 줄이면 실무 가치는 높을 수 있습니다.
프리뷰는 계속 업데이트되므로 모델명, 시험 날짜, 도구 버전, 시스템 프롬프트, 온도, 컨텍스트를 기록해야 합니다. 어제의 결과와 오늘의 결과가 달라질 수 있으며 이는 프리뷰 정책상 이상한 일이 아닙니다. 정식 스냅샷이 나온 뒤 같은 평가를 다시 해야 재현 가능한 비교가 됩니다.
오픈웨이트 공개 뒤 확인할 체크리스트
첫째, 정확한 저장소와 게시 주체를 확인해야 합니다. Qwen 공식 Hugging Face 조직, ModelScope, GitHub 모델 카드에서 연결된 파일인지 살펴보고 이름만 비슷한 커뮤니티 업로드를 공식 모델로 오해하지 않아야 합니다. 초대형 모델은 파일 수가 많아 일부 샤드 누락이나 잘못된 설정 파일이 있어도 다운로드가 시작될 수 있습니다.
둘째, 라이선스를 읽어야 합니다. 상업적 이용, 파생 모델 배포, 월간 활성 사용자 제한, 특정 지역이나 사용 목적 제한, 모델 출력으로 다른 모델을 학습할 수 있는지 확인해야 합니다. 과거 Qwen 모델이 사용한 라이선스와 동일할 것이라고 미리 가정하면 안 됩니다.
셋째, 모델 카드의 학습 및 평가 정보를 확인해야 합니다. 공식 점수가 어떤 프롬프트와 도구 환경에서 측정됐는지, 사고 토큰과 검색 도구를 포함했는지, 경쟁 모델도 같은 조건이었는지 봐야 합니다. 도구를 사용한 점수와 순수 모델 점수를 섞으면 실제 격차를 잘못 이해할 수 있습니다.
넷째, 서빙 호환성을 확인해야 합니다. vLLM, SGLang, Transformers, TensorRT-LLM 같은 프레임워크가 해당 라우팅 구조와 양자화를 지원하는지, 텐서 병렬과 전문가 병렬을 어떻게 설정하는지 중요합니다. 파일이 공개돼도 안정적인 런타임 지원이 따라오지 않으면 초기에는 실행 난도가 매우 높을 수 있습니다.
다섯째, 양자화 품질을 확인해야 합니다. FP8이나 4비트 변환은 저장 공간을 줄이지만 라우터와 일부 레이어의 정밀도에 민감할 수 있습니다. 단순 대화 몇 개가 아니라 코딩, 수학, 긴 문맥, 도구 호출에서 원본 대비 손실을 비교해야 합니다. 커뮤니티 양자화 파일은 편리하지만 변환 설정과 해시, 원본 커밋을 확인하는 습관이 필요합니다.
여섯째, 보안과 데이터 처리를 구분해야 합니다. 로컬 가중치를 실행하면 프롬프트를 외부 API에 보내지 않을 수 있지만 모델 자체가 안전해지는 것은 아닙니다. 프롬프트 인젝션, 위험한 도구 호출, 비밀키 노출, 악성 저장소 명령 실행을 막는 권한 분리와 샌드박스가 여전히 필요합니다.
가능한 모델 라인업을 세 가지로 예측
가장 공격적인 시나리오는 Qwen3.8-Max 2.4T 전체 가중치가 그대로 공개되는 경우입니다. 연구와 대규모 클라우드 사업자에게는 큰 사건이지만 저장과 추론 비용 때문에 개인 사용자는 직접 활용하기 어렵습니다. 이 경우 여러 서빙 업체가 양자화와 API를 제공하면서 생태계가 빠르게 형성될 가능성이 큽니다.
두 번째는 2.4T Max와 함께 활성 파라미터가 작은 효율형 MoE가 공개되는 경우입니다. Qwen은 이전 세대에서 다양한 크기의 모델을 제공해 왔기 때문에 개발자 접근성과 홍보 효과를 함께 얻을 수 있습니다. 로컬 커뮤니티가 실제로 기대하는 것은 전체 Max보다 30B급, 100B급, A3B·A10B처럼 제한된 하드웨어에서도 사용할 수 있는 파생형일 가능성이 큽니다.
세 번째는 API의 Max와 공개형 체크포인트가 서로 다른 경우입니다. ‘Qwen3.8 오픈웨이트’라는 약속은 지키면서도 최고급 Max 서빙은 클라우드에 남길 수 있습니다. 공식 게시물의 문장만으로 어느 시나리오인지 단정할 수 없으므로 모델 카드가 등장할 때까지 이름과 규모를 확인해야 합니다.
개인적으로는 효율형 파생 모델이 함께 나올 가능성을 중간 이상으로 봅니다. 2.4T만 공개하면 기술적 상징성은 크지만 실제 사용층이 좁기 때문입니다. 다만 이는 Qwen의 확정 발표가 아닌 생태계 전략을 바탕으로 한 예측입니다.
국내 사용자가 특히 확인할 부분
현재 공식 프리뷰 접근은 중국의 Token Plan, Qoder, QoderWork 중심으로 안내됐습니다. 지역별 제공 여부, 해외 API 엔드포인트, 결제 수단, 데이터 저장 위치가 다를 수 있습니다. 한국에서 업무용으로 도입하려면 중국판 화면에 접속된다는 사실만으로 글로벌 서비스 가용성을 판단하면 안 됩니다.
가격 역시 프리뷰 할인과 정식 가격을 분리해서 봐야 합니다. Token Plan 문서에는 프리뷰 기간 크레딧 소비를 크게 낮추는 한시 혜택이 적혀 있습니다. 할인된 사용량을 기준으로 정식 운영비를 계산하면 나중에 비용이 급증할 수 있습니다. 정식 API의 입력·출력·캐시 가격과 환율, 야간 할인 시간대를 다시 확인해야 합니다.
한국어 품질은 번역 자연스러움만으로 평가하지 않는 것이 좋습니다. 존댓말 일관성, 법률·의료·회계 용어, 날짜와 금액 표기, 한글 파일명, 국내 주소와 기관명, 표 안의 단위 처리를 살펴야 합니다. 코딩에서는 한글 주석과 UTF-8 경로, Windows PowerShell 명령, 국내 서비스 API 문서를 함께 시험하면 실사용 차이를 더 빨리 알 수 있습니다.
기업 데이터가 포함된다면 약관과 보관 정책, 학습 사용 여부, 리전 선택, 삭제 절차를 확인해야 합니다. 공개 가중치가 나오면 자체 서버가 대안이 될 수 있지만, 2.4T급 운영비와 보안 인력을 고려하면 외부 API보다 무조건 싸다고 볼 수 없습니다. 민감도에 따라 작은 공개 모델과 대형 API를 나누어 쓰는 혼합 구성이 현실적일 수 있습니다.
확정 정보와 예측을 다시 구분하면
확정 정보의 첫 번째는 모델명입니다. 현재 서비스에 표시되는 정확한 식별자는 qwen3.8-max-preview입니다. 두 번째는 전체 규모 2.4T입니다. 세 번째는 Token Plan, Qoder, QoderWork를 통한 프리뷰 접근입니다. 네 번째는 공식 계정이 밝힌 향후 오픈웨이트 계획입니다. 다섯 번째는 프리뷰가 고정 스냅샷이 아니라 계속 개선되는 버전이라는 운영 정책입니다.
반대로 정식 출시 날짜는 예측 영역입니다. 공개 가중치의 정확한 날짜도 알려지지 않았습니다. 2.4T 전체가 내려받을 수 있는 형태로 나올지, 일부 파생 모델만 나올지도 모릅니다. Apache 2.0 라이선스, 1M 이상의 컨텍스트, 64K 이상의 출력, FP8 원본 제공, 소형 라인업 동시 공개도 모두 아직 확정되지 않았습니다.
성능 주장 역시 단계가 다릅니다. Qwen은 프런티어 모델과 견주며 Fable 5 다음이라고 표현했지만 공통 평가표를 공개하지 않았습니다. 제작사가 내부 실제 업무에서 이전 3.7보다 좋아졌다고 확인한 것과, 모든 외부 벤치마크에서 경쟁 모델을 앞선다는 것은 다른 주장입니다. 정식판의 동일 스냅샷을 여러 기관이 같은 조건으로 시험해야 객관적인 순위를 말할 수 있습니다.
멀티모달은 공식 Token Plan 표에서 시각 이해가 표시되므로 단순 소문이 아닙니다. 다만 이미지, 영상, 문서 각각의 세부 한도와 품질은 공개되지 않았습니다. 따라서 ‘시각 입력 지원’은 확정이지만 ‘모든 종류의 영상을 1M 문맥으로 분석’한다는 식의 문장은 아직 쓸 수 없습니다.
오픈웨이트 역시 공개 약속은 확정이지만 공개 범위는 미정입니다. 모델 가중치만 받을 수 있는지, 토크나이저와 추론 코드, 양자화 파일, 기술 보고서까지 같은 날 제공되는지 알 수 없습니다. 이 차이는 연구 재현성과 실제 배포 난도를 크게 바꾸므로 정식 공지를 기다려야 합니다.
공개 직후 24시간에 확인할 순서
정식 발표가 나오면 먼저 Qwen 공식 계정과 공식 저장소에서 모델 카드 링크를 확인합니다. 검색 결과 상단의 재배포 사이트보다 원본 저장소가 우선입니다. 그다음 라이선스 파일과 모델 목록을 보고 Max 전체인지 효율형 파생 모델인지 구분합니다. 파일 크기와 샤드 수를 보면 필요한 저장 공간도 대략 계산할 수 있습니다.
그다음 아키텍처 설정 파일에서 hidden size, layer 수, 전문가 수, 활성 전문가 수, 컨텍스트 설정을 살펴봅니다. 공식 추론 예제에 필요한 Transformers 버전과 사용자 정의 코드가 적혀 있는지도 중요합니다. 신형 구조는 라이브러리 최신 버전에서도 바로 지원되지 않을 수 있으므로 기존 환경을 무리하게 업그레이드하기보다 별도 가상환경에서 시험하는 편이 안전합니다.
서빙 예제가 공개되면 가장 작은 입력으로 모델 로딩과 한 번의 생성을 검증합니다. 이후 긴 문맥, 사고 모드, 함수 호출, 이미지 입력을 하나씩 추가해야 오류 원인을 찾기 쉽습니다. 처음부터 수십만 토큰과 여러 도구를 넣으면 모델 문제인지 런타임 문제인지 구분하기 어렵습니다.
벤치마크는 공개 첫날의 비공식 순위보다 자신의 업무 샘플을 우선해야 합니다. 같은 저장소와 문서로 3.7, 3.8, 현재 사용 중인 모델을 비교하고 실패 사례를 보존하면 모델 업데이트 때 회귀 테스트로 다시 쓸 수 있습니다. 프리뷰에서 좋았던 결과가 정식판에서도 유지되는지도 이 방식으로 확인할 수 있습니다.
마지막으로 비용을 계산합니다. 자체 호스팅은 GPU 임대료뿐 아니라 다운로드 시간, 저장 공간, 네트워크, 엔지니어 운영 시간, 장애 대응 비용이 들어갑니다. API는 편리하지만 토큰 비용과 데이터 정책이 부담일 수 있습니다. 하루 요청량과 평균 문맥 길이를 넣어 월간 총비용을 비교해야 합리적인 선택이 됩니다.
과장된 해석을 피하기 위한 세 가지 원칙
첫째, 모델 이름과 숫자를 분리해서 읽습니다. Qwen3.8과 과거의 Qwen3-8B는 전혀 다른 표기입니다. 점 하나가 있는 세대 번호 3.8과 하이픈 뒤 모델 크기를 뜻하는 8B를 혼동하면 검색 결과와 파일을 잘못 고를 수 있습니다.
둘째, 오픈웨이트와 로컬 친화성을 같은 뜻으로 쓰지 않습니다. 누구나 가중치를 받을 수 있어도 2.4T 전체 모델은 대형 클러스터가 필요할 수 있습니다. 실제 개인 사용성을 판단하려면 소형 파생 모델, 양자화, 활성 파라미터, 런타임 지원을 함께 봐야 합니다.
셋째, 프리뷰 결과를 최종 성능으로 고정하지 않습니다. 프리뷰 문서는 능력이 계속 업데이트된다고 명시합니다. 초기의 놀라운 성공과 이상한 반복 실패 모두 정식판을 대표하지 않을 수 있습니다. 날짜가 표시된 테스트 기록과 정식 스냅샷의 재검증이 가장 좋은 방어책입니다.
결국 이번 발표의 가치는 단순히 숫자가 큰 모델 하나가 늘었다는 데 있지 않습니다. 비공개 API 중심이던 Max 계열과 공개 가중치 생태계가 다시 연결될 수 있다는 신호라는 점이 더 중요합니다. 다만 기대가 클수록 공식 모델 카드, 라이선스, 재현 가능한 외부 평가를 차분히 확인해야 합니다. 다운로드 버튼이 나타나는 순간부터 진짜 검증이 시작됩니다.
성급한 순위표보다 실제 업무에서 반복 가능한 결과를 확인하는 편이 훨씬 중요합니다.
결론
Qwen3.8-Max-Preview는 2.4T 규모와 오픈웨이트 예고만으로도 주목할 만합니다. Qwen3.7-Max 대비 가장 기대되는 변화는 멀티모달 에이전트, 복잡한 소프트웨어 엔지니어링, 장기 작업의 안정성, 그리고 가중치 공개 전략의 복귀입니다.
그러나 지금 확인된 것은 프리뷰 접근과 방향성입니다. 정식 출시일, 공식 벤치마크, 활성 파라미터, 컨텍스트와 출력 한도, API 가격, 라이선스, 실제 공개 체크포인트는 아직 빈칸입니다. 따라서 ‘Fable 5 다음’이라는 홍보 문구보다 정식 모델 카드와 독립 평가를 확인하는 것이 중요합니다.
FAQ
자주 묻는 질문
Q1. Qwen3.8은 이미 출시됐나요?+
프리뷰는 2026년 7월 19일부터 일부 서비스에서 이용할 수 있지만 정식판과 오픈웨이트 파일은 아직 공개되지 않았습니다.
Q2. Qwen3.8-Max는 정말 오픈소스인가요?+
공식적으로 오픈웨이트 계획이 예고됐습니다. 학습 코드와 데이터까지 포함하는 완전한 오픈소스인지, 어떤 라이선스인지 아직 알 수 없습니다.
Q3. Qwen3.7-Max보다 무엇이 좋아지나요?+
공식 설명은 풀스택 개발, 데이터 분석, 오피스 워크플로, 복수 에이전트, 장기 작업의 향상을 강조합니다. 멀티모달 통합과 작업 완주율 개선이 유력합니다.
Q4. 2.4T 모델을 개인 PC에서 돌릴 수 있나요?+
전체 가중치 기준으로는 매우 어렵습니다. 4비트만 해도 단순 계산상 약 1.2TB이므로 대규모 GPU 서버나 분산 추론이 필요할 가능성이 큽니다.
Q5. 정식판은 언제 나오나요?+
공식 날짜는 없고 ‘곧’이라고만 발표했습니다. 프리뷰 품질과 서비스 안정화가 진행된 뒤 정식판으로 교체될 전망입니다.
Sources
확인한 자료
- Qwen 공식 X 발표
- Qwen Token Plan 개인판 문서
- Qwen Token Plan 팀판 문서
- Qwen 텍스트 생성 모델 문서
- Qwen 모델 출시 기록
- Alibaba Cloud 모델 가격표
- SiliconANGLE 출시 보도
- South China Morning Post 출시 보도
- IT之家 출시 보도
2026년 7월 20일 확인. 프리뷰 사양과 혜택은 예고 없이 바뀔 수 있습니다.
한 줄 결론: Qwen3.8-Max-Preview는 이미 체험할 수 있지만, 정식판·라이선스·실제 공개 체크포인트는 아직 기다려야 합니다.
'AI' 카테고리의 다른 글
| AI 시대, 이해가 새로운 병목이다 (1) | 2026.07.20 |
|---|---|
| Kimi 3.0 출시? 공식명 Kimi K3 핵심 기능과 사용법 (1) | 2026.07.17 |
| 젠스파크(Genspark)란? 2026년 요금과 10,000 크레딧, 예전에 쓰고 지금은 안 쓰는 이유 (2) | 2026.07.16 |
| 조코딩 AX 인재전쟁 신청 후기 및 결과: 5,300명 중 메디테라피 본선 예비 후보가 되기까지 (0) | 2026.07.16 |
| NotebookLM으로 영상 만들기: 실제 품질 후기와 간단한 사용법 (1) | 2026.07.15 |
