무엇이 바뀌었나
2025년 8월 5일 OpenAI가 공개한 gpt-oss-120b는 ChatGPT에 추가된 새 기능이 아니다. 모델 가중치를 내려받아 기업이나 개발자가 직접 실행하고 필요하면 미세 조정할 수 있는 오픈 웨이트 추론 모델이다. 핵심 변화는 성능보다도 모델을 어디에서 운영하고 누가 통제하는지가 넓어졌다는 데 있다.
이름은 120B지만 OpenAI가 공개한 실제 총 파라미터 수는 117B다. 혼합 전문가 구조를 사용해 토큰을 처리할 때는 약 5.1B만 활성화된다. 모델 전체를 매번 계산하지 않는 방식 덕분에 OpenAI는 최적화된 환경에서 단일 80GB GPU에 올릴 수 있다고 설명한다.
왜 지금 중요한가
그동안 OpenAI의 고성능 모델은 주로 ChatGPT나 API를 통해 사용했다. 반면 GPT-OSS 120B는 사내 서버나 프라이빗 클라우드에 배치할 수 있어 데이터 보관 위치와 운영 방식을 직접 정할 수 있다. 외부 API로 보내기 어려운 사내 문서, 코드, 고객 상담 기록을 다루는 조직에는 선택지가 하나 더 생긴 셈이다.
다만 ‘오픈’이 곧 무료라는 뜻은 아니다. 가중치는 Apache 2.0 라이선스로 제공되지만 GPU, 저장 공간, 추론 서버 운영 비용은 사용자가 부담한다. OpenAI는 현재 이 모델이 OpenAI API나 ChatGPT에서 제공되지 않는다고 안내하고 있다.
120B는 어떻게 작동하나
GPT-OSS 120B는 트랜스포머 기반의 MoE 모델이다. 128개의 전문가 중 토큰마다 4개를 골라 계산하며 총 파라미터와 실제 계산량을 분리한다. 36개 레이어와 128k 컨텍스트 길이를 지원하고 어텐션 메모리를 줄이기 위한 구조도 사용한다.
추론 강도는 low·medium·high로 조절할 수 있다. 빠른 분류나 짧은 응답에는 낮은 설정을 복잡한 코딩이나 수학 문제에는 높은 설정을 쓰는 식이다. 학습 데이터는 영어 비중이 높은 텍스트 중심이며 STEM, 코딩, 일반 지식에 초점이 맞춰졌다. 한국어 업무 성능은 별도 검증이 필요하다.
실제 사용 방식
개발자는 Hugging Face에서 가중치를 내려받고 OpenAI가 공개한 PyTorch·Triton·Metal 구현이나 vLLM, Ollama, llama.cpp 같은 실행 환경을 선택할 수 있다. 모델은 Harmony 형식의 프롬프트를 전제로 학습됐기 때문에 일반적인 채팅 템플릿을 그대로 쓰면 결과가 달라질 수 있다.
예를 들어 사내 개발팀이 내부망에 모델을 배치하면 코드 설명, 문서 검색, 파이썬 실행 같은 도구를 연결해 사용할 수 있다. 이때 모델 자체와 실행 서버의 로그·접근권한·출력 검증은 도입 조직이 설계해야 한다.
20B와 비교하면
같은 GPT-OSS 계열의 20B 모델은 더 작은 환경과 낮은 지연시간을 겨냥한다. 공개된 주요 사양을 나란히 놓으면 다음과 같다.
| 항목 | gpt-oss-120b | gpt-oss-20b |
|---|---|---|
| 총 파라미터 | 117B | 21B |
| 토큰당 활성 파라미터 | 5.1B | 3.6B |
| 총 전문가 수 | 128개 | 32개 |
| 토큰당 활성 전문가 | 4개 | 4개 |
| OpenAI가 제시한 실행 규모 | 80GB GPU | 16GB 메모리 |
| 컨텍스트 길이 | 128k | 128k |
120B는 복잡한 추론과 범용 업무를 우선할 때 검토할 모델이다. 반대로 개인 장비에서 빠르게 시험하거나 비용을 줄이는 것이 목적이라면 20B부터 시작하는 편이 현실적이다. 실제 속도와 메모리 사용량은 런타임, 배치 크기, 컨텍스트 길이에 따라 달라진다.
사용자·개발자·기업에 미치는 영향
개발자에게는 가중치를 직접 바꾸고 도구 연결 방식을 통제할 수 있다는 점이 가장 크다. OpenAI의 자체 평가에서는 GPT-OSS 120B가 일부 코딩·수학·도구 사용 평가에서 o4-mini와 비슷하거나 앞섰다고 발표했지만 이는 특정 벤치마크 결과다. 실제 서비스에서는 한국어, 도메인 용어, 응답 속도를 따로 측정해야 한다.
기업은 API 사용료만 비교해서는 안 된다. GPU 구매 또는 임대, 모델 업데이트, 장애 대응, 보안 점검, 안전 필터 구축까지 포함한 총비용을 계산해야 한다. 데이터가 외부로 나가지 않는 장점이 있더라도 운영 책임까지 함께 가져오는 구조다.
한계와 주의할 점
120B가 80GB GPU 하나에 들어간다는 설명은 MXFP4와 최적화된 구현을 전제로 한다. OpenAI의 참고용 PyTorch 구현은 비효율적이며 120B 실행에 여러 장의 GPU가 필요할 수 있다. ‘한 장으로 실행 가능’과 ‘어떤 환경에서도 빠르게 서비스 가능’은 같은 말이 아니다.
오픈 웨이트 모델은 배포 뒤 OpenAI가 거부 정책을 회수하거나 시스템 차원의 안전장치를 일괄 적용할 수 없다. OpenAI의 모델 카드도 공격자가 모델을 다시 미세 조정해 안전 거부를 우회할 수 있다고 설명한다. 민감한 업무에 투입한다면 입력·출력 필터와 권한 통제를 별도로 마련해야 한다.
자주 묻는 질문
GPT-OSS 120B를 ChatGPT에서 사용할 수 있나?
현재 OpenAI 안내 기준으로는 ChatGPT와 OpenAI API에서 직접 제공되지 않는다. 가중치를 내려받아 자체 서버에서 운영하거나 이를 지원하는 외부 호스팅 사업자를 이용해야 한다.
120B는 1200억 개 파라미터가 모두 매번 계산된다는 뜻인가?
아니다. 공개 사양상 총 파라미터는 약 117B지만 MoE 구조로 토큰당 약 5.1B만 활성화된다. 따라서 모델 규모와 실제 추론 비용은 같은 비율로 늘지 않는다.
일반 노트북에서 실행할 수 있나?
OpenAI가 제시한 120B의 기준은 80GB GPU 수준이다. 소비자 장비에서 실행 가능할지는 메모리, 양자화 방식, CPU 오프로딩, 런타임에 따라 달라지므로 보장된다고 보기 어렵다. 제한된 장비라면 20B가 더 적합하다.
상업적으로 무료로 사용할 수 있나?
Apache 2.0은 상업적 사용과 수정·재배포를 폭넓게 허용한다. 다만 GPT-OSS 사용 정책을 따라야 하며 서버와 GPU 운영비는 별도로 발생한다.
GPT-OSS 120B가 o4-mini보다 좋은가?
OpenAI는 자체 평가에서 일부 항목의 근접하거나 우수한 결과를 제시했다. 그러나 모든 작업에서 우월하다는 뜻은 아니므로 실제 사용할 언어와 업무 데이터를 기준으로 비교해야 한다.
한눈에 정리
GPT-OSS 120B의 의미는 OpenAI 수준의 추론 모델을 ChatGPT 밖에서 직접 운영할 수 있게 됐다는 데 있다. 117B 총 파라미터와 5.1B 활성 파라미터를 가진 MoE 모델이며 80GB GPU 실행을 목표로 설계됐다.
도입을 검토한다면 먼저 20B와 함께 동일한 업무 데이터로 정확도·지연시간·메모리 사용량을 측정해야 한다. 이후 Harmony 형식과 실행 환경을 확인하고 안전 필터와 운영비까지 포함한 작은 파일럿으로 시작하는 것이 현실적이다.