GLM-5.3-Flash가 18B 짜리라고?
GLM-5.3-Flash의 공개 설정 파일과 가중치 용량을 직접 재봤습니다
TY KIM
Swiss School of Management - AI 박사

「320B 중 18B만 활성화」는 계산 이야기지 메모리 이야기가 아닙니다. 공개 설정 파일과 가중치 용량을 직접 재서 실제 숫자를 확인하고, 돌아다니는 벤치마크 점수를 세 등급으로 갈라 봤습니다. 30분이면 모델 발표를 판정표 한 장으로 바꾸는 절차가 손에 남습니다.
"320B 파라미터 중 18B만 활성화한다." 지난주부터 이 문장을 몇 번은 보셨을 겁니다. 그리고 그 뒤에는 거의 항상 "그래서 가볍다"가 붙어 있죠.
절반만 맞습니다. 계산은 정말 가벼워졌거든요. 그런데 메모리는 한 바이트도 안 줄었습니다. 이 두 가지가 한 문장에 뭉쳐 있는 바람에, API로 쓸 때의 이야기와 우리 서버에서 빌드 할 때의 이야기가 계속 섞입니다.

1. 18B는 계산의 단위일뿐, 메모리의 단위가 아니다
Z.ai가 2026년 8월 26일 GLM-5.3-Flash를 오픈웨이트로 공개했습니다. 라이선스는 MIT고요.
구조부터 정확히 보겠습니다. 공개된 설정 파일을 직접 열어 보면 이렇게 되어 있습니다.
전문가(expert) 288개를 두고, 토큰 하나마다 그중 8개에 공유 전문가 1개를 더해 아홉 덩어리만 켭니다. 이게 MoE(Mixture of Experts) — 모델 안에 여러 전문가 블록을 두고 입력마다 일부만 켜는 구조를 말해요. 그래서 토큰 한 개를 처리하는 연산량은 18B짜리 모델 수준으로 떨어집니다.
문제는 어느 8개가 켜질지 미리 알 수 없다는 것입니다. 다음 토큰에서 어떤 전문가가 호출될지 모르니까, 288개 전부를 언제든 꺼낼 수 있는 자리에 올려둬야 하죠.
"1/10 가격"이라는 표현도 같은 자리에서 갈립니다. 그건 Z.ai가 자사 GLM-5.3(100만 토큰당 입력 $1.4·출력 $4.4)과 자사 신모델의 API 정가를 비교한 숫자예요. 자체 구축 비용이 1/10이 된다는 뜻이 아닙니다. 두 문장은 아예 다른 예산 항목에서 놉니다.
2. 45개 층 중 11개만 전체 어텐션을 씁니다
그럼에도 새로운점이 존재합니다.바로 어텐션 쪽입니다. 회사 설명은 "sparse와 linear 어텐션을 결합한 하이브리드"인데, 이 표현만으로는 무엇이 얼마나 줄었는지 알 수 없죠. 그래서 직접 뜯아봤어요. 모댈 설정 파일에는 층별 구성이 다행히도 그대로 적혀 있었습니다.
전체 45개 층 가운데 34개가 linear attention, 11개가 sparse attention입니다. 3·7·11번째… 이런 식으로 네 층에 한 번씩만 무거운 층이 들어가요. 그 sparse 층도 전체를 다 보지 않고 상위 2,048개 토큰만 골라 봅니다.
여기서 중요한 건 KV 캐시입니다. KV 캐시란 이미 처리한 토큰의 중간 계산값을 들고 있는 메모리인데, 긴 문맥에서 진짜로 부담이 되는 쪽이 이겁니다. linear attention 층은 토큰이 늘어도 상태 크기가 늘지 않아요. 그래서 캐시를 쌓아야 하는 층이 45개가 아니라 11개로 줄어듭니다.
Z.ai는 직전 모델 대비 어텐션 연산 3.01배, KV 캐시 4.44배를 줄였다고 발표했습니다. 이건 자체 측정치라 제가 확인할 수 없습니다. 다만 설계와 앞뒤가 맞는 크기이긴 합니다 — 무거운 층 비율이 45분의 11이면 대략 4.09배거든요.
3. 그래서 실제로 몇 GB인가?
Hugging Face 저장소의 파일 크기를 합산 해보니 다음과 같았습니다.
-
FP8 판(기본 배포본): 328.3 GB
-
BF16 판: 642.7 GB
-
커뮤니티 GGUF 양자화: 4비트급 199.7 GB / 2비트급 108.7 GB / 1비트급 93.1 GB
공개된 기본 가중치가 이미 FP8이라는 점은 짚고 갈 만합니다.
흔히 "일단 받아서 양자화하면 되겠지" 하는데, 여기선 출발점이 이미 8비트예요. 더 줄이려면 그때부터는 품질을 내주는 구간으로 들어갑니다.
장비로 환산하면 이렇게 됩니다. H100 80GB 8장을 꽂은 서버 한 대가 640GB인데, FP8 판(328.3GB)은 들어가고 BF16 판(642.7GB)은 한 대에 안 들어갑니다. 2.7GB 차이로요. 실제로는 KV 캐시와 활성화 메모리까지 얹어야 하니 여유는 더 줄고요.
역설적이지만 캐시 쪽은 꽤 가볍습니다. 전체 어텐션 층 11개에 압축 잠재 벡터 512차원이니, 100만 토큰을 FP8로 들고 있어도 6GB 남짓입니다(설정값으로 계산한 값이고 구현체마다 달라집니다). 가중치가 무겁고 문맥이 가벼운 모양이에요. 짧은 요청을 많이 치는 곳보다, 긴 문서를 통째로 넣는 곳에 유리한 구조입니다.
한 가지 더. 다운로드 수를 보면 FP8 판이 44만 건대, BF16 판이 9천 건대입니다. 현장에서 실제로 굴러가는 건 사실상 FP8 쪽이라는 뜻이고, 견적도 그 기준으로 잡는 게 맞습니다.

활성 파라미터가 18B라도, 비용이 올라가는 건 마찮가지죠.
4. 가격은 맞는숫자인가?
여러 기사에 나온 100만 토큰당 입력 $0.15 / 출력 $0.50은 맞는 숫자입니다. 공식 가격 페이지의 정가고요.
그런데 같은 페이지에 이렇게 적혀 있습니다.
지금은 50% 할인 중이라 실제 청구는 입력 $0.075 / 출력 $0.25이고, 이 할인은 2026년 9월 9일 24시(UTC+8)에 끝납니다.
오늘 기준으로 엿새 남았네요. OpenRouter API를 직접 조회해도 할인가가 걸려 있는 게 보입니다.
지금 비용 시뮬레이션을 돌리고 계시다면, 끝나는 값이 아니라 정가로 잡으셔야 합니다. 할인가로 만든 표는 다음 주에 두 배가 되거든요.
여기 더 큰 변수가 하나 있습니다. 이 모델은 사고 과정(thinking)을 끌 수 없습니다. 공식 문서에 thinking.type은 enabled만 지원한다고 적혀 있고, 사고 예산인 reasoning_effort는 따로 지정하지 않으면 최고치인 max로 갑니다. 사고 토큰은 출력 토큰으로 계산되고요. 즉 단가는 싼데 건당 출력량이 늘어나는 구조입니다.
실제로 Artificial Analysis는 이 모델의 출력 속도를 초당 44.6토큰으로 재고 "느린 편"이라고 표기해 두었습니다. 이름에 Flash가 붙어 있지만 응답이 빠른 모델은 아니라는 뜻이에요. 대화형 서비스에 붙일 거라면 단가표보다 이쪽을 먼저 보셔야 합니다.
5. 벤치마크는 세 등급으로
이 글에서 제일 오래 붙잡고 있던 부분입니다. 돌아다니는 점수들이 서로 다른 무게를 갖고 있는데, 기사에서는 한 줄에 나란히 놓이거든요. 세 등급으로 갈라 봤습니다.
1등급 — 독립 측정. Artificial Analysis가 자체 지표(Intelligence Index)에서 57점을 매겼습니다. 111개 모델 중 4위고, 과제당 비용은 $0.09입니다. 회사가 준 숫자가 아니라 측정기관이 직접 돌린 값이에요. 참고로 제가 받은 자료에는 "독립 검증이 없다"고 되어 있었는데, 그건 사실과 다릅니다. 모델 카드의 GDPval 항목도 이 기관 평가라고 명시돼 있고요.
2등급 — 자체 측정 및 보고. Terminal-Bench 2.1 84.3점, DeepSWE 63.4점 같은 수치입니다. 회사가 자기 하네스로 돌려 발표한 값이라 재현 조건이 곧 결과가 됩니다. 그리고 한 가지가 걸립니다. 모델 카드에는 점수 표가 아예 없어요. 그림 파일 하나로 올려두고, 본문에는 평가 조건만 각주로 적어 두었습니다. 기계로 읽어서 대조할 수가 없다는 뜻이죠.
3등급 — 공식 리더보드. 여기가 제일 흥미로웠습니다. Terminal-Bench의 현행 공식 리더보드는 4.0이고, 스탠퍼드·Harbor·Laude Institute가 운영합니다. 페이지를 받아 전수로 훑어봤는데 GLM-5.3-Flash는 여기 없습니다. 문자열 "Flash"가 0회 나와요.
대신 직전 모델인 GLM-5.3이 올라와 있고, 점수가 41.8% ± 3.2입니다. 84.3과 41.8은 모순이 아닙니다 — 벤치마크 버전이 다르거든요. 2.1은 두 세대 전이고, 그사이 3.0을 거쳐 4.0까지 왔습니다. 같은 보드에서 Opus 5가 51.8%, Opus 4.8이 23.6%입니다. 문제가 어려워지면 모두의 점수가 내려앉는다는 게 이 표의 요지고, 그래서 2.1에서 나온 80점대는 지금 프런티어와 비교하는 데 쓸 수 없습니다.
비교 대상 자체도 짚어야겠습니다. "Claude Opus 4.8에 근접"이라는 문장에서 Opus 4.8은 이미 현행 최상위가 아닙니다. Artificial Analysis의 현재 상위권은 Fable 5.1이 66점, Opus 5(max)가 63점이고, 이 모델은 57점입니다. 근접이라는 말이 틀린 건 아닌데, 어느 시점의 무엇에 근접했는지가 빠지면 다른 뜻이 됩니다.
그렇다고 이 모델을 깎을 이유는 없습니다. 57점을 과제당 $0.09에 내는 건 그 자체로 대단한 값이에요. 제가 반대하는 건 점수가 아니라 등급이 다른 숫자를 같은 줄에 놓는 것입니다.
6. 1M 컨텍스트와 평가 구간 갭
컨텍스트 100만 토큰. 설정 파일의 max_position_embeddings가 1,048,576이니 구조상으로는 맞습니다.
그런데 출처마다 수가 다릅니다. 공식 문서는 "1M", 설정 파일은 1,048,576, OpenRouter는 1,310,720으로 적어 두었어요. 25% 차이입니다. 계약서에 "100만 토큰"이라고만 쓰면 나중에 어느 수를 가리키는지 다투게 되는 자리고요.
품질 쪽은 더 조심해야 합니다. 제가 받은 자료에는 "모델 카드에 평가를 최대 30만 토큰에서 수행했다고 적혀 있다"고 되어 있었는데, 원문을 확인해 보니 그 30만은 HLE 한 항목에만 붙은 조건이었습니다. 각주를 다 펴 보면 이렇습니다.
-
HLE(도구 사용): 최대 30만 토큰, 문맥 관리 전략 사용
-
NL2Repo: 1M 문맥에서 평가
-
DeepSWE: 40만 토큰
-
BabyVision: 16만 4천 토큰
그러니 "평가는 30만까지만 했다"는 정확하지 않습니다. 다만 원래 하려던 지적은 여전히 살아 있어요. 항목마다 문맥 길이가 제각각이고, 100만 구간을 실제로 밟은 건 NL2Repo 하나뿐입니다. 100만 토큰 전 구간에서 검색·회상 품질이 유지되는지를 통제된 조건에서 보여주는 자료는 아직 없습니다.
틀린 근거로 옳은 결론을 말하면, 반박 한 번에 결론까지 같이 무너집니다. 그래서 고쳐 적었습니다.
7. MIT 라이센스의 의미
라이선스가 이번 발표에서 가장 실질적인 부분일 수 있습니다.
MIT는 상업적 이용·수정·재배포를 사실상 제한 없이 허용하고, 이용자 수 조건이나 별도 협의 조항이 붙지 않습니다. 오픈웨이트 모델이라도 "월간 이용자 몇 명 이상이면 별도 계약" 같은 단서가 달린 경우가 흔한데, 그 단서가 없다는 뜻이에요.
제안서 관점에서 이게 만드는 차이는 구체적입니다. 자료를 밖으로 내보낼 수 없는 기관에 제안할 때, 지금까지는 "성능은 이쪽이 좋은데 폐쇄망에서는 못 씁니다"가 반복되는 자리였거든요.
가중치를 받아 기관 내부에 세울 수 있고 라이선스 마찰이 없다면, 그 문장이 "장비를 이만큼 갖추면 됩니다"로 바뀝니다. 협의 대상이 법무에서 예산으로 옮겨 가는 거죠.
다만 MIT는 반출 문제를 풀어주지 학습 데이터 출처나 개인정보 처리 책임까지 면제하지 않습니다. 그리고 3절의 숫자가 그대로 따라붙습니다. 라이선스가 열려 있다는 것과 우리 기관이 감당할 수 있다는 것은 다른 판단이에요.
곁들여 둘 만한 사실이 하나 있습니다. Z.ai는 공개 시점의 서비스를 중국산 AI 칩 클러스터에서 돌렸고, 초기 대비 3배의 서빙 성능 개선으로 "주요 NVIDIA GPU에 준하는 토큰당 비용"에 도달했다고 밝혔습니다. 회사 발표라 검증은 안 됩니다만, 방향은 눈여겨볼 만합니다.
8. 아래 프롬프트로 테스트 해볼 것
1단계. 지금 검토 중인 모델 하나를 골라, 발표 자료의 숫자를 세 칸으로 옮겨 적습니다. 독립 측정 / 자체 보고 / 미확인. 출처 URL을 같이 적으세요. 한 칸에 다 들어가면 그건 아직 정리가 안 된 겁니다.
2단계. 가격 줄에 날짜를 답니다. 정가인지 할인가인지, 할인이면 종료일이 언제인지. 이 한 칸이 없어서 다음 분기에 예산이 어긋납니다.
3단계. 온프레미스를 검토 중이라면 가중치 파일 크기를 직접 재고(파라미터 수 말고요), 장비 대수로 환산합니다. 이 세 줄이면 A4 한 장짜리 판정표가 됩니다.
아래 프롬프트를 그대로 복사해 쓰시면 됩니다.
기본형 — 증거 등급 가르기
아래는 AI 모델 발표 자료다.
[발표 자료 원문 또는 URL 붙여넣기]
수치 주장을 전부 뽑아 표로 정리하라. 열은 다음 다섯 개다.
주장 | 숫자 | 출처 유형(독립측정/자체보고/미확인) | 근거 URL | 재현 조건
규칙:
- 출처 유형을 근거 없이 '독립측정'으로 올리지 마라. 원문에 측정 주체가
적혀 있지 않으면 '미확인'이다.
- 재현 조건(하네스, 벤치마크 버전, 문맥 길이)이 원문에 없으면 빈칸으로 두고
추측해서 채우지 마라.
- 마지막에 '이 표에서 의사결정에 쓸 수 있는 줄'만 따로 3개 이하로 골라라.
고급형 — 온프레미스 도입 판정
너는 공공기관 금융기관 AI 인프라 도입을 심사하는 기술검토위원이다.
낙관적 요약이 아니라 예산 승인 근거로 쓸 문서를 만든다.
대상 모델: [모델명]
공개 가중치 저장소: [URL]
우리 기관 보유 장비: [예: H100 80GB 8장 1대]
용도: [예: 내부 문서 질의응답, 동시 사용자 20명]
다음 순서로 판정하라.
1) 가중치 파일 실제 용량을 형식별로(FP8/BF16/양자화) 적고, 파라미터 수가
아니라 용량 기준으로 우리 장비에 올라가는지 판정하라.
2) 안 올라가면 필요한 최소 장비 구성을 적어라.
3) 라이선스 조항 중 상업적 이용·재배포·이용자 수 제한을 확인해 인용하라.
4) 성능 근거를 독립측정/자체보고로 갈라 적어라.
5) 확인 못 한 항목은 '미확인'으로 남기고, 그 항목이 판정을 뒤집을 수
있는지 표시하라.
출력 형식: 표 1개 + 결론 3문장 + 미확인 항목 목록.
없는 숫자를 만들지 마라. 모르면 모른다고 적어라.
[대괄호] 자리는 이렇게 채웁니다. [모델명]에는 GLM-5.3-Flash, [URL]에는 https://huggingface.co/zai-org/GLM-5.3-Flash, [보유 장비]에는 H100 80GB 8장 1대처럼 실제 보유분을 적으시면 됩니다.
9. 프롬프트를 조금 더 잘 쓰는 법
하나 — 출력 형식을 먼저 못 박습니다. 표의 열 이름을 미리 주면 모델이 빈칸을 남깁니다. 안 주면 문장으로 풀어 쓰면서 없는 값을 메워요.
둘 — "모르면 모른다고 적어라"를 넣습니다. 이 한 줄이 있고 없고의 차이가 생각보다 큽니다. 다만 넣었다고 안심하진 마세요. 걸리는 걸 실제로 본 적 있는지는 따로 확인해야 합니다.
셋 — 나쁜 예와 개선 예를 비교해 보겠습니다.
-
나쁜 프롬프트:
이 모델 벤치마크 점수 정리해 줘 -
개선 프롬프트:
이 발표 자료에서 수치 주장만 뽑아 표로 만들어라. 열은 주장·숫자·출처유형(독립측정/자체보고/미확인)·근거URL이다. 원문에 측정 주체가 없으면 '미확인'으로 적고 추측하지 마라.
앞은 숫자를 모아 오고, 뒤는 어느 숫자를 믿을 수 있는지를 가져옵니다. 정리해 달라고 하면 정리만 되거든요.
10. 주의사항
활성 파라미터로 장비 견적을 잡는 경우. 증상은 "18B니까 A100 한두 장이면 되겠네"입니다. 원인은 1절의 혼동이고요. 교정법은 파라미터 수를 아예 보지 않고 저장소 파일 용량을 재는 겁니다.
할인가로 연간 비용을 산출하는 경우. 증상은 다음 분기에 청구서가 두 배로 오는 것. 원인은 가격표의 종료 날짜를 안 옮겨 적어서고요. 교정법은 비용표에 '정가' 열을 따로 두는 것입니다.
발행 전에 이 다섯 줄만 확인해 보세요.
-
인용한 점수마다 측정 주체가 적혀 있는가
-
벤치마크 이름 옆에 버전이 적혀 있는가
-
비교 대상 모델이 현행 최신인지 확인했는가
-
가격에 정가/할인가 구분과 종료일이 있는가
-
메모리 요구량이 파라미터 수가 아니라 파일 용량 기준인가
이번 주에 딱 하나만 하신다면, 검토 중인 모델 하나를 골라 위 기본형 프롬프트를 한 번 돌려 보세요. 세 칸으로 갈라 놓고 나면 그 표에서 의사결정에 실제로 쓸 수 있는 줄이 몇 개인지 바로 보입니다. 대개 생각보다 적습니다.
출처와 검증 메모
직접 확인한 1차 자료 (전부 2026-09-03 확인)
-
모델 카드 및 설정 파일: huggingface.co/zai-org/GLM-5.3-Flash — 층 구성(45층 중 sparse 11·linear 34), 전문가 288개·토큰당 8+1,
max_position_embeddings1,048,576,index_topk2,048, FP8(e4m3) 양자화 설정, 평가 각주(HLE 30만·NL2Repo 1M·DeepSWE 40만·BabyVision 16.4만) -
가중치 용량: Hugging Face API로 파일 크기 합산 — FP8 328.3GB, BF16 판 642.7GB, GGUF 양자화 93.1~641.6GB
-
공식 모델 문서: docs.z.ai/guides/llm/glm-5.3-flash — 1M 컨텍스트, 최대 출력 128K, 입력 모달리티,
thinking비활성화 불가, 어텐션 3.01배·KV 캐시 4.44배 절감 주장, 중국산 칩 서빙 -
공식 가격표: docs.z.ai/guides/overview/pricing — 정가 $0.15/$0.50, 50% 할인 및 2026-09-09 24:00(UTC+8) 종료 명시
-
독립 측정: Artificial Analysis — Intelligence Index 57, 111개 중 4위, 과제당 $0.09, 출력 44.6 tok/s, TTFT 1.65초
-
공식 리더보드: Terminal-Bench 4.0 — GLM-5.3 41.8%±3.2, Opus 5 51.8%, Opus 4.8 23.6%. GLM-5.3-Flash 미등재
-
공개 이력: Hugging Face 커밋 기록 — 저장소 생성 2026-08-25(빈 커밋), 가중치·모델 카드 업로드 2026-08-26
-
시세: OpenRouter
/api/v1/models직접 조회 — 컨텍스트 1,310,720, 입력 $0.075·출력 $0.25 -
기술 보고서: arXiv:2602.15763
확인 못 했거나 강도를 낮춘 것
-
Terminal-Bench 2.1의 84.3점, DeepSWE 63.4점은 회사 자체 보고치입니다. 모델 카드가 점수를 이미지로만 제공해 기계 대조가 불가능했고, 공식 리더보드에도 없습니다.
-
'ox-alpha'라는 익명으로 사전 공개돼 OpenRouter 사용량 상위에 올랐다는 내용은 2차 보도 기준입니다. 공식 문서에서 이 명칭을 확인하지 못했습니다. 사용량 수치도 검증하지 않았습니다.
-
"Opus 4.8과 동점"이라는 보도가 여럿 있으나, Artificial Analysis 현행 목록에서 Opus 4.8을 직접 확인하지 못했습니다. 이 글에는 확인된 값(GLM-5.3-Flash 57, Fable 5.1 66, Opus 5 63)만 적었습니다.
-
어텐션 3.01배·KV 캐시 4.44배는 회사 발표치이고 재현하지 않았습니다.
-
메모리 계산은 공개 설정값 기준이며 실제 구동 시험은 하지 않았습니다. 추론 엔진과 배치 크기에 따라 달라집니다.
-
라이선스 해석은 공개 문서 기준이고 법률 자문이 아닙니다.

