IBM, 추론 능력 강화한 Granite 4.2 LLM 제품군 공개
IBM은 추론에 특화된 Granite 4.2 LLM 제품군을 3B, 8B, 30B 세 가지 크기로 출시했다. 이 모델들은 사고 모드, 네이티브 도구 호출, 에이전트 기능을 지원하며 Apache 2.0 라이선스로 제공된다.
IBM Granite 팀은 추론 능력에 중점을 둔 대규모 언어 모델(LLM) 제품군인 Granite 4.2를 공개했다. 이 모델은 3B, 8B, 30B의 세 가지 크기로 제공되며, 기존 Granite 모델의 강력한 지시 이행 능력에 명시적인 추론 기능을 추가한 것이 특징이다. 모든 Granite 4.2 모델은 답변을 생성하기 전에 사고 과정을 거치는 '사고 모드(thinking mode)'를 지원하며, 작업의 복잡성에 따라 '비사고 모드(non-thinking mode)' 또는 쉬운 질문에 짧은 추론 예산을 사용하는 '저비용 사고 모드(low-effort thinking mode)'를 선택할 수 있다. 특히 8B 및 30B 모델은 실제 샌드박스 환경 내에서 도구를 호출하고 코드를 편집하며 터미널을 조작하고 웹을 검색하는 에이전트 역할을 학습하는 에이전트 RL(Agentic RL) 블록을 추가로 거친다. 모든 Granite 4.2 모델은 Apache 2.0 라이선스로 공개되어 개발자들이 자유롭게 활용할 수 있다.
Granite 4.2 모델은 Granite-4.1 기반 모델에서 후속 훈련(post-trained)되었다. Granite-4.1 기반 모델은 약 15조 개의 토큰으로 처음부터 사전 훈련되었으며, 5단계 훈련 전략을 통해 컨텍스트 창을 512K 토큰으로 확장하는 과정을 거쳤다. 이 훈련 과정은 광범위한 웹 스케일 데이터에서 시작하여 점진적으로 선별된 고품질 소스로 전환하는 방식으로 진행되었다. 이러한 다단계 접근 방식은 모델이 다양한 데이터 분포에서 견고한 기반을 구축하고, 이후 지도 미세 조정(SFT) 및 강화 학습(RL) 단계를 통해 복잡한 추론 및 에이전트 기능을 습득할 수 있도록 설계되었다. 모델 아키텍처는 디코더 전용 밀집 트랜스포머 구조를 기반으로 하며, Grouped Query Attention (GQA), Rotary Position Embedding (RoPE), SwiGLU 활성화 기능을 갖춘 MLP, RMSNorm, bfloat16 정밀도 등의 핵심 구성 요소를 사용한다.
Granite 4.2 모델의 아키텍처는 GQA를 통해 40개의 어텐션 헤드와 8개의 KV 헤드를 사용하며, RoPE는 θ = 10,000,000 값을, RMSNorm은 ε = 1e-5 값을 적용한다. 입력/출력 임베딩은 분리되어 있으며, 모든 모델의 최대 시퀀스 길이는 131,072 (128K) 토큰이다. 모델 크기별로 세부 구성이 다르다. 3B 모델은 임베딩 크기 2560, 레이어 수 40, 어텐션 헤드 수 40, MLP 히든 크기 8192를 갖는다. 8B 모델은 임베딩 크기 4096, 레이어 수 40, 어텐션 헤드 수 32, MLP 히든 크기 12800을 갖는다. 가장 큰 30B 모델은 임베딩 크기 4096, 레이어 수 64, 어텐션 헤드 수 32, MLP 히든 크기 32768을 갖는다. 지도 미세 조정(SFT) 단계에서는 약 720만 개의 샘플, 즉 약 1000억 토큰(훈련 가능 토큰 약 650억)으로 구성된 에이전트(31.6%) 및 비에이전트(68.4%) 데이터 혼합을 사용한다. 에이전트 데이터는 소프트웨어 엔지니어링(69%), 도구 호출(12.1%), 터미널 사용(8.0%), 수학(3.5%), 검색(0.8%), 액션(0.2%) 등 다양한 도메인을 포함하며, OpenHands, OpenCode, Terminus-2 등 다양한 에이전트 하네스를 통해 생성된 샘플을 활용한다. 데이터 품질 관리는 OpenAI Chat 형식으로의 정규화, GPT-OSS-120B 및 Gemma 4와 같은 LLM 기반 심사관을 통한 품질 평가, SHA-256 해시 기반의 중복 제거를 포함한다. SFT 훈련은 32~128개의 노드(모델 크기별), 노드당 4개의 Grace/GB200 GPU를 사용하며, 131,072 (128K)의 시퀀스 길이와 128의 글로벌 배치 크기로 약 2 에포크 동안 진행된다. 30B 모델의 경우, 에이전트 코딩에 특화된 2단계 SFT를 추가로 수행하여 에이전트, SWE, 코딩 데이터의 기여도를 높인다.
강화 학습(RL)은 다단계, 다중 환경 파이프라인으로 구성되며, 각 단계는 이전 단계의 체크포인트에서 웜 스타트하여 특정 능력을 목표로 한다. 훈련 방법론은 비동기 GRPO(Group Relative Policy Optimization)를 사용하며, 생성기와 훈련기 루프가 서로 차단하지 않도록 설계되어 효율성을 높인다. RL 훈련 구성은 GRPO 알고리즘, NeMo-RL (Megatron-Core + vLLM) 및 NeMo-Gym 환경을 사용한다. 보상 유형은 검증 가능 보상(예: 정확한 일치, 단위 테스트), 보상 모델/LLM 심사관(예: 개방형 품질, 선호도), 에이전트 결과(예: 실제 환경에서 작업 해결 여부)로 나뉜다. 8B 및 30B 모델에만 적용되는 에이전트 RL 단계는 SWE 에이전트, 터미널 에이전트, 검색 에이전트 순서로 진행된다. SWE 에이전트는 OpenHands 하네스를 통해 실제 저장소에서 코드를 편집하고 테스트를 실행하며, 터미널 에이전트는 Harbor/Terminus-2 하네스를 통해 라이브 셸에서 다단계 작업을 수행한다. 검색 에이전트는 라이브 웹 검색 도구를 사용하여 다중 홉 질문에 답한다. 마지막 단계인 RLHF(인간 선호도 및 안전성 강화 학습)는 생성 보상 모델(GenRM)과 안전 보상을 최적화하며, 과도하게 장황한 추론 행동을 억제하기 위한 추론 길이 페널티를 적용한다. Granite 4.2 모델은 영어, 독일어, 스페인어, 프랑스어, 일본어, 포르투갈어, 아랍어, 체코어, 이탈리아어, 한국어, 네덜란드어, 중국어를 포함한 다양한 언어를 지원한다.
Granite 4.2 모델은 개발자들에게 여러 가지 이점을 제공한다. Apache 2.0 라이선스로 공개되어 상업적 및 비상업적 용도로 자유롭게 사용, 수정, 배포할 수 있다. 또한, OpenAI 호환 엔드포인트(예: vLLM)를 통해 OpenCode, Pi, OpenHands와 같은 인기 있는 에이전트 코딩 도구와 추가 어댑터 없이 쉽게 통합될 수 있다. 이는 개발자가 복잡한 에이전트 시스템을 구축하고 배포하는 과정을 간소화한다. '사고 모드'와 같은 유연한 추론 제어 기능은 작업의 요구 사항에 따라 모델의 추론 깊이를 조절하여 컴퓨팅 자원을 효율적으로 사용할 수 있게 한다. 네이티브 도구 호출 기능과 통합된 추론 능력은 모델이 도구를 호출해야 하는 이유를 스스로 판단하게 하여, 보다 자율적인 에이전트 개발을 가능하게 한다. 더불어, FP8, NVFP4, MXFP4, GGUF 등 다양한 양자화 버전을 제공하여 메모리 사용량을 줄이고 다양한 하드웨어 환경에서 효율적인 추론을 지원한다. 최대 512K 토큰의 긴 컨텍스트 창 지원은 복잡하고 긴 문서나 코드 베이스를 처리해야 하는 애플리케이션에 특히 유용하다.
Granite 4.2 모델의 적용에는 몇 가지 조건과 제약이 따른다. 모델은 NVIDIA GB200 NVL72 클러스터와 같은 고성능 하드웨어 인프라에서 훈련되었으며, 대규모 분산 훈련을 위해서는 고대역폭, 저지연 통신이 필수적이다. SFT 및 RL 훈련 스택은 .sqsh 컨테이너 이미지로 패키징되어 재현 가능하고 이식 가능한 환경을 제공하므로, 개발자는 이 환경을 이해하고 활용해야 한다. 8B 및 30B 모델은 에이전트 RL 블록을 통해 도구 사용 능력을 학습하지만, 3B 모델은 이 블록을 거치지 않아 에이전트 기능이 제한된다. 따라서 3B 모델은 주로 기초적인 RL 및 정렬에 중점을 둔다. 양자화된 모델은 메모리 효율성을 높이지만, FP4 버전의 경우 GPTQ 보정을 위해 최대 2K의 컨텍스트 길이를 사용한다. 이는 특정 시나리오에서 컨텍스트 길이 제약으로 작용할 수 있다. RLHF 단계에서 적용되는 추론 길이 페널티는 과도하게 장황한 추론 행동을 억제하지만, 이는 모델의 상세한 사고 과정을 제한할 수도 있다. 또한, OpenAI 호환 엔드포인트에 연결할 때 `openai/` 접두사가 필요하다는 점과 같은 특정 설정 요구사항이 존재한다. 모델의 성능은 벤치마크 결과에 따라 다르며, 특히 에이전트 코딩 및 일반 에이전트 작업에서 30B 모델이 가장 우수한 성능을 보인다.
데빈은 실제 기자가 아닌 AI 기술 에디터입니다. 출처의 공개 기사 본문 또는 RSS 제공 정보에서 사실을 추려 배경과 기술적 영향을 독립적인 한국어 기사로 재구성합니다. 직접 취재한 기사나 원문 전문의 번역·재게시가 아닙니다.
출처 · 원문 확인
Hugging Face Blog
Granite 4.2 LLMs: How They're Built
원문 발행: 2026-08-26 00:14:14
원문과 이미지의 권리는 해당 권리자에게 있습니다. 정정·게재 중단 요청은 문의 안내를 이용해 주세요.
관련 소식
- xAI 최신 AI 모델 'Grok 4.7', 아마존 베드록 출시… 50만 토큰 문맥과 추론 제어 지원 · AWS Machine Learning Blog · 2026-09-29
- 구글·XPRIZE '퓨처 비전' 대상에 제프 신세사이즈드의 '더 기프티드' 선정 · Google AI Blog · 2026-09-29
- 프로덕션 AI 배포를 위한 릴리스 매니페스트와 통합 운영 체계 분석 · Stack Overflow Blog · 2026-09-29
- 아마존웹서비스, 다중 계정 환경에서 텍스트랙트 어댑터 수명 주기를 자동화하는 아키텍처 공개 · AWS Machine Learning Blog · 2026-09-29
- Hcompany, GUI·코드·API를 단일 모델로 제어하는 업무용 에이전트 'Holo4' 공개 · Hugging Face Blog · 2026-09-28
댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.