Cerebras Chat · Cerebras Cloud · Gemma 4 31B Preview
Gemma 4 31B가 Cerebras에 올라오자 1800 tokens/s가 현실감 있게 보인다
웨이퍼스케일엔진(WSE) 기반 AI 추론을 홍보하는 Cerebras가 이제 chat.cerebras.ai와 cloud.cerebras.ai에서 Gemma 4 31B를 체험하게 해준다. 체감 포인트는 단순하다. 답변이 빠른 정도가 아니라, 긴 출력이 거의 실시간으로 흘러나온다.
한줄 소감: 31B 모델이 맞나 의심이 드는 속도
목차
핵심 요약
Cerebras가 강조하는 메시지는 “모델도 중요하지만 추론 하드웨어가 사용자 경험을 바꾼다”는 쪽에 가깝다. Gemma 4 31B는 Google DeepMind의 Gemma 4 계열 중 31B급 dense 모델이고, Cerebras 문서에서는 스크린샷, 문서, 다이어그램, 디자인 자산을 다루는 멀티모달 추론 모델로 소개된다. 즉 단순 텍스트 챗봇이라기보다 이미지가 섞인 작업 흐름을 빠르게 처리하는 모델로 포지셔닝되어 있다.
이번에 눈에 띄는 부분은 속도다. 사용자가 말한 1700T/s라는 표현은 토큰 출력 속도(tokens per second)를 말하는 것으로 보는 게 자연스럽다. Cerebras의 모델 카탈로그는 Gemma 4 31B를 약 1850 tokens/s로 표기하고, Cerebras 블로그는 Artificial Analysis 측정 기준 1851 output tokens/s라고 소개한다. 실제 스크린샷에서는 한국어 답변이 906 tokens/s로 표시되는데, 이는 네트워크, 출력 길이, 계정 상태, 부하, 측정 방식에 따라 바뀌는 체감값이다. 그래도 일반적인 GPU 엔드포인트에서 느끼던 “한 글자씩 기다리는” 감각과는 완전히 다르다.
하드웨어 쪽의 핵심은 WSE-3다. Cerebras CS-3 시스템은 900000개의 AI 최적화 코어, 44GB 온칩 SRAM, 21PB/s 메모리 대역폭, 214Pb/s 인터커넥트 대역폭을 전면에 내세운다. LLM 추론은 매 토큰마다 모델 가중치와 KV 캐시, 어텐션 계산을 반복해서 다루는 작업이다. 그래서 단순 연산량뿐 아니라 메모리에서 얼마나 빠르게 데이터를 가져오고 이동시키는지가 실제 응답 속도를 크게 좌우한다.
직접 체험에서 보이는 것
Cerebras Chat은 별도 개발 환경 없이 속도를 체험하기 좋은 입구다. 화면 위쪽에는 Cerebras 로고와 개발자 문서, 무료 API 키 버튼이 있고, 아래 입력창에서 모델을 고를 수 있다. 사용자가 제공한 화면에서는 Gemma 4 31B를 선택한 상태에서 한국어 질문을 던졌고, 응답 위에는 “0.52초, 906 tokens/sec”라는 속도 표시가 붙어 있다. 실제 체감은 숫자보다 더 강하다. 답변이 생성되는 동안 기다리는 시간이 짧아서, 질문을 고쳐 묻고 다시 확인하는 흐름이 끊기지 않는다.
이런 빠른 출력은 단순한 과시가 아니다. 일반 챗봇에서는 1번 답변이 늦으면 사용자가 생각을 멈추거나 다른 탭으로 넘어간다. 반대로 응답이 매우 빠르면 사용자는 같은 시간 안에 “질문, 반박, 재질문, 요약, 형식 변환”을 여러 번 반복할 수 있다. 특히 코드 리뷰, 문서 요약, 스크린샷 판독, UI 비교처럼 짧은 루프가 많은 작업에서 속도는 곧 제품성으로 이어진다.
모델 메뉴도 흥미롭다. Gemma 4 31B, OpenAI GPT OSS, Z.ai GLM 4.7 같은 모델이 나란히 보이며, Gemma 4 31B 설명에는 스크린샷, 문서, 다이어그램, 디자인 자산을 넘나드는 멀티모달 추론이 강조되어 있다. 이는 Cerebras가 Gemma 4 31B를 “빠른 텍스트 모델”로만 파는 것이 아니라, 시각 입력이 포함된 에이전트 워크플로의 기본 모델로 밀고 있다는 뜻이다.
1700T/s 체감과 공식 수치
먼저 숫자를 정리하자. Cerebras 공식 모델 카탈로그에는 Gemma 4 31B의 모델 ID가 gemma-4-31b, 파라미터 규모가 31 billion, 속도가 약 1850 tokens/s로 올라와 있다. Cerebras 블로그는 Gemma 4 31B가 Artificial Analysis 측정 기준 1851 output tokens/s를 기록했다고 적고, Cerebras 홈페이지는 Gemma 4 31B가 1800 tokens/s 이상으로 동작한다고 홍보한다. 그러므로 1700T/s라는 체감 표현은 공식 수치보다 약간 보수적인 숫자로 보는 것이 안전하다.
다만 tokens/s는 항상 같은 의미로 비교하면 안 된다. 입력 토큰 처리량인지, 출력 토큰 처리량인지, 단일 사용자 기준인지, 동시 사용자 처리량인지, 스트리밍 표시가 언제 시작되는지에 따라 값이 달라진다. 한국어는 토크나이저 특성상 영어와 체감 길이도 다르다. 그래서 블로그에 쓸 때는 “Gemma 4 31B가 Cerebras에서 약 1800 tokens/s급으로 제공된다”는 표현이 가장 무난하고, 특정 순간의 스크린샷 숫자는 “실사용 예시”로 분리하는 편이 좋다.
사용자 제공 차트에서도 Cerebras는 약 1981 tokens/s로 표시된다. 이 차트는 모델, 날짜, 테스트 조건을 함께 알 수 없는 이미지이므로 공식 순위표처럼 단정하기보다, Cerebras가 GPU 계열 엔드포인트보다 훨씬 빠른 체감 구간에 들어와 있다는 보조 근거로 쓰는 것이 맞다. 흥미로운 점은 공식 문서의 약 1850 tokens/s와 크게 어긋나지 않는다는 점이다.
| 구분 | 본문에서 쓰기 좋은 표현 | 주의점 |
|---|---|---|
| 공식 모델 카탈로그 | Gemma 4 31B는 약 1850 tokens/s | Preview 모델이라 제공 상태가 바뀔 수 있음 |
| Cerebras 블로그 | Artificial Analysis 기준 1851 output tokens/s | 측정 조건과 시점이 중요함 |
| 사용자 스크린샷 | 한국어 응답 예시에서 906 tokens/s | 실사용 순간값이며 항상 재현되는 숫자는 아님 |
| 사용자 표현 | 1700T/s급 체감 | 공식 수치와 스크린샷 사이를 설명하는 체감 표현으로 처리 |
WSE-3가 빠른 이유: 연산보다 데이터 이동이 먼저다
LLM 추론을 느리게 만드는 대표 병목은 “계산을 못 해서”만은 아니다. 토큰을 1개 만들 때마다 모델 가중치, 어텐션 상태, KV 캐시, 중간 활성값이 계속 움직인다. GPU 서버는 HBM 대역폭이 매우 높지만, 여러 GPU를 엮는 순간 데이터 이동 경로가 늘어나고 통신 비용이 붙는다. 대형 모델을 쪼개서 여러 장치에 올리는 구조에서는 이 비용이 특히 잘 보인다.
Cerebras의 WSE 접근은 이 문제를 정면에서 다룬다. WSE-3는 46225mm² 실리콘, 4조 개 트랜지스터, 900000개 AI 최적화 코어를 가진 초대형 칩으로 소개된다. CS-3 시스템 사양에는 44GB 온칩 SRAM과 21PB/s 메모리 대역폭이 적혀 있다. 숫자만 보면 “메모리 대역폭이 21PB/s라서 빠르다”는 말이 맞지만, 더 정확히는 거대한 온칩 메모리와 웨이퍼 규모의 연결망이 반복적인 토큰 생성 루프에서 데이터 이동 지연을 줄인다고 보는 편이 좋다.
여기서 중요한 주의점도 있다. 31B 모델 전체가 언제나 44GB SRAM에 단순히 통째로 올라간다는 식의 설명은 정확하지 않을 수 있다. 모델 가중치 정밀도, 캐시, 배치, 런타임 배치 방식, 서버 구성에 따라 실제 실행 방식은 달라진다. Cerebras 문서 역시 공용 엔드포인트 모델은 원본 모델을 제공하고, 품질 민감 레이어를 보존하는 선택적 weight-only quantization을 저장 단계에서 사용한다고 설명한다. 따라서 “전체 구조가 데이터 이동을 줄이는 방향으로 설계되었다”가 더 안전한 설명이다.
결국 사용자가 체감하는 것은 “첫 토큰까지의 지연”과 “출력 토큰이 흐르는 속도”다. Cerebras 블로그는 Gemma 4 31B가 첫 답변 토큰까지 1.5초 수준이라고 설명하고, 출력 속도는 1800 tokens/s 이상으로 강조한다. 대화형 앱에서는 이 조합이 중요하다. 첫 토큰이 늦으면 답변이 시작되기 전부터 답답하고, 출력 속도가 느리면 긴 답변에서 흐름이 끊긴다. 둘 중 하나만 좋아서는 제품 경험이 완전히 달라지지 않는다.
Chat와 Cloud, 두 가지 체험 경로
1. chat.cerebras.ai에서 바로 써보기
가장 쉬운 경로는 chat.cerebras.ai다. 로그인 후 모델 선택 메뉴에서 Gemma 4 31B를 고르고, 일반 채팅처럼 질문하면 된다. 스크린샷처럼 이미지 추가 버튼도 보이므로 멀티모달 입력 흐름을 확인하기 좋다. 블로그 독자에게는 “회원가입 후 브라우저에서 바로 속도를 보는 곳”이라고 소개하면 된다.
2. cloud.cerebras.ai에서 API 키 받아보기
개발자는 cloud.cerebras.ai에서 API 키를 받아 Playground와 API를 사용할 수 있다. Cerebras Quickstart 문서는 Cloud Console에서 가입 또는 로그인한 뒤 왼쪽 메뉴의 API Keys에서 키를 만들고, 환경 변수 CEREBRAS_API_KEY로 설정하라고 안내한다. 처음에는 SDK 방식이 가장 빠르다.
$env:CEREBRAS_API_KEY="여기에_API_키"
pip install --upgrade cerebras_cloud_sdk
import os
from cerebras.cloud.sdk import Cerebras
client = Cerebras(api_key=os.environ["CEREBRAS_API_KEY"])
response = client.chat.completions.create(
model="gemma-4-31b",
messages=[
{
"role": "user",
"content": "한국어로 WSE-3가 빠른 이유를 5문장으로 설명해줘.",
}
],
)
print(response.choices[0].message.content)
이미 OpenAI SDK에 맞춰 둔 코드가 있다면 Cerebras의 OpenAI 호환 엔드포인트를 쓰는 방법도 있다. 공식 OpenAI Compatibility 문서는 base_url을 https://api.cerebras.ai/v1로 바꾸고 Cerebras API 키를 넣으면 된다고 안내한다. 완전한 1:1 호환을 전제로 하기보다, 기존 클라이언트 코드를 빠르게 바꿔 시험해보는 경로로 이해하는 것이 좋다.
import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.cerebras.ai/v1",
api_key=os.environ["CEREBRAS_API_KEY"],
)
answer = client.chat.completions.create(
model="gemma-4-31b",
messages=[{"role": "user", "content": "Gemma 4 31B로 이미지 분석 워크플로를 설계해줘."}],
)
print(answer.choices[0].message.content)
FAQ
Q1. Gemma 4 31B는 Cerebras에서 무료로 쓸 수 있나?+
Cerebras Chat은 브라우저에서 체험할 수 있고, Cloud Console에는 무료 API 키 진입점이 있다. 다만 무료 계정의 rate limit, 모델 제공 범위, 과금 정책은 바뀔 수 있으므로 실제 사용 전에는 Cloud Console과 Pricing 문서를 확인해야 한다.
Q2. 1700T/s 또는 1800 tokens/s가 항상 나오나?+
아니다. 공식 카탈로그는 Gemma 4 31B를 약 1850 tokens/s로 표기하지만, 실제 체감값은 출력 길이, 언어, 네트워크 상태, 계정 제한, 서버 부하, 측정 방식에 따라 달라진다. 블로그에서는 “1800 tokens/s급 공식 제공”과 “내 스크린샷의 순간값”을 분리해서 쓰는 것이 좋다.
Q3. Gemma 4 31B는 reasoning 모델인가?+
Gemma 4 31B는 추론과 멀티모달 이해를 강조하는 31B급 dense 모델이다. 다만 긴 reasoning trace를 전면에 내세우는 전용 reasoning 모델처럼 설명하기보다는, 스크린샷과 문서 분석이 가능한 빠른 멀티모달 모델로 소개하는 편이 정확하다.
Q4. 왜 WSE-3의 21PB/s 메모리 대역폭이 중요하나?+
LLM 추론은 토큰마다 가중치와 캐시를 반복해서 다루는 작업이라 메모리 대역폭과 데이터 이동 지연이 매우 중요하다. WSE-3는 큰 온칩 SRAM, 웨이퍼 규모 연결망, 많은 AI 코어를 결합해 이 반복 루프의 병목을 줄이는 방향으로 설계되어 있다.
Q5. 이미지 입력은 어떻게 넣나?+
Cerebras 문서 기준 이미지 입력은 Public Preview이며 현재 gemma-4-31b에서 지원된다. PNG 또는 JPEG를 base64 data URI로 만들어 Chat Completions 메시지에 넣어야 하고, 공용 티어에서는 요청당 최대 5개 이미지와 총 10MB 이미지 페이로드 제한을 고려해야 한다.
Q6. 운영 서비스에 바로 붙여도 되나?+
프로토타입에는 매우 매력적이지만, Preview 모델은 제공 상태가 바뀔 수 있다. 운영 서비스라면 모델 고정, rate limit, 전용 엔드포인트, 장애 대응, 비용, 데이터 정책을 확인한 뒤 붙이는 것이 맞다.
참고 자료
- Cerebras Blog: Gemma 4 on Cerebras
- Cerebras Inference Docs: Model Catalog
- Cerebras Inference Docs: Gemma 4 31B
- Cerebras Inference Docs: Image Inputs
- Cerebras: The Future of AI is Wafer Scale
- Cerebras: CS-3 System
- Cerebras Inference Docs: Quickstart
- Cerebras Inference Docs: OpenAI Compatibility
- Google AI for Developers: Gemma 4 model overview
'NEWS' 카테고리의 다른 글
| 클로드 코드 창시자가 말하는 AI 시대의 다섯 가지 일하는 사람의 원형 (0) | 2026.07.03 |
|---|---|
| 2026 상반기 말아먹었을 때 쓰는 글 (1) | 2026.07.03 |
| OpenAI GPT-5.6 시리즈 3종 전격 공개: 플래그십 Sol부터 Terra, Luna까지 (0) | 2026.06.27 |
| [AI 브라우저] YC가 선택한 'Aside' 브라우저 기술 분석: AI 시대의 새로운 웹 OS (1) | 2026.06.26 |
| 미 트럼프 행정부, 오픈AI에 GPT-5.6 단계적 출시 요청 - Codex 개발자의 기나긴 기다림 (0) | 2026.06.26 |
