- Aleph Alpha가 독일·핀란드 인프라에서 처음부터 학습한 독일어·영어 모델로, 가중치를 Apache-2.0으로 공개해 조직이 자체 서버에서 데이터와 모델 운영을 통제할 수 있음
- 전문가 혼합(MoE) 구조로 전체 781억 파라미터 중 토큰당 약 35억만 사용해 연산량을 줄이며, 독일어 질문에는 독일어로 추론하도록 학습함
- 독일어 복합어에 맞춘 UniBPE 토크나이저로 텍스트를 덜 잘게 나눔. 독일 기본법 전체를 처리한 실험에서는 GPT-5 토크나이저보다 약 15% 적은 토큰을 사용함
- 최대 약 100만 토큰의 긴 문맥을 처리하며, 문서에 답을 뒷받침할 근거가 없으면 모른다고 답하도록 학습해 법률·계약서·매뉴얼 기반 질의응답에 초점을 맞춤
- 자체 평가에서는 수학과 기업 문서 질의응답이 강점이지만, 문서 없이 답하는 지식 문제와 코딩 에이전트는 상대적으로 약함. 전체 가중치를 담으려면 FP8 기준 약 78GB의 메모리가 필요함
- Kolibri는 독일 통일의 날인 2026년 10월 3일 공개됐으며, 전체 가중치를 Hugging Face에서 Apache 2.0 조건으로 내려받을 수 있음
- 독일어, 추론, 수학, 에이전트 동작과 고객의 프로덕션 요구에 특화해 공공행정, 산업, 항공우주 분야의 핵심 업무를 목표로 함
- 산업별 언어, 규제, 절차를 고려하며, 업무 맥락에 맞는 성능과 경제적 영향을 측정해 투자수익률을 관리하는 데 초점을 맞춤
- 온프레미스에서 효율적으로 실행해 내부 데이터를 제3자 추론 서비스에 보내지 않을 수 있음
- 주권은 모델을 만드는 과정과 고객에게 통제권을 넘기는 방식을 함께 포함함
- 데이터 수집부터 사전학습, 후속학습, 최종 평가까지 공급망 무결성과 의사결정 추적을 제공함
- 독일에서 개발하고 독일과 핀란드의 인프라에서 학습했으며, 유럽과 독일 법률 아래 외국의 통제 없이 전체 파이프라인을 소유함
- 고객의 배포 자유와 지식재산권 안전성을 지원하며, 추론 노력 조절로 비용과 지연시간을 답변 품질과 절충할 수 있음
- EU AI Act, GDPR, General-Purpose AI Code of Practice와 저작권법을 고려해 설계함
- 가중치와 학습 데이터 큐레이션의 투명성, 추론 과정을 통한 설명 가능성, 문서 근거에 따른 답변 유보를 강조함
- 전체 기술 세부사항은 기술 보고서에서 확인할 수 있음
- 자체 비교에서 Kolibri는 영어와 독일어 모두 품질 대비 서빙 비용의 파레토 전선에 위치함
- 비교한 모델 가운데 같은 서빙 비용으로 더 높은 품질을 제공하거나, 같은 품질을 더 낮은 비용으로 제공하는 모델이 없었음
- 품질은 벤치마크 점수의 비가중 평균, 처리량은 GPU당 초당 디코딩 텍스트로 비교함
- 수학, 코딩, 문서 근거 활용, 긴 문맥 작업에서 활성 파라미터가 최대 4배인 Nemotron 3 Super 등의 모델과 대등한 성능을 보임
- AIME 2025 영어 96.9, 독일어 87.5, AIME 2026 영어 96.0, 독일어 90.0을 기록함
- GPQA Diamond는 영어 84.3, 독일어 81.3이며, LiveCodeBench v6는 85.9, HumanEval+는 92.7임
- 긴 문맥 평가인 LongBench Pro는 64.5, AA-LCR은 68.3임
- 벤치마크는 자체 평가 하네스로 실행했으며, 적용 가능한 모델에는 각각 최고 추론 노력 수준을 사용함
- 전체 점수는 영어 75.5, 독일어 70.8로, Kolibri Origin의 54.1과 46.4보다 높음
- 영어 분야별 평균은 지식 50.1, 수학 96.5, 에이전트 63.4, 코드 89.3, 지시 이행 78.1임
- 전체 비교표의 Qwen3.8 27B는 영어 80.2, 독일어 79.9로 Kolibri보다 높은 점수를 기록함
- 에이전트 및 개발 작업에서도 평가별 성능 차이가 있음
- τ³-bench banking 38.1, τ²-bench airline 76.7, retail 69.9, telecom 94.7, BFCL v4 전체 61.4, BrowseComp 29.4를 기록함
- SWE-Bench Verified는 66.4, TerminalBench 2.1은 27.7이며, 모든 비교 모델이나 작업에서 우위를 보이는 것은 아님
- 코드로 구현한 학습 파이프라인은 데이터 수집과 큐레이션, 요소별 비교 실험, 사전학습, 후속학습, 최종 평가를 하나의 버전 관리 학습 레시피로 묶음
- 1월에 구축을 시작해 5개월과 수백 차례 실험을 거친 뒤, Kolibri Origin의 사전학습을 2026년 6월 11일 완료함
- Kolibri는 9월 11일 사전학습을 완료했으며, Kolibri Origin은 공개 출시되지 않음
- 두 모델 사이에서 총 파라미터는 306억 개에서 781억 개, 사전학습 토큰은 7.51조 개에서 20조 개로 늘어남
- 토큰당 활성 파라미터는 32.7억 개에서 34.6억 개로 비슷한 수준을 유지함
- 지원 문맥은 약 6만 5,000토큰에서 최대 100만 토큰으로 확대했으며, 20조 토큰의 학습 데이터를 얻기 위해 200조 토큰 이상의 원시 데이터를 필터링하고 중복 제거함
- 어텐션과 라우팅 알고리듬을 바꾸고 전문가 수를 3배로 늘렸으며, 희소성과 후속학습 데이터를 개선하고 환경 작업 수를 2배 이상 확대함
- 효율 개선으로 토큰당 학습 속도는 Kolibri Origin보다 빨라짐
- 모든 코드 변경 제안은 소규모 종단 간 학습과 평가를 실행해 수분 안에 문제를 확인함
- 실행은 GitHub Actions 워크플로로 관리하며, 해당 커밋을 체크아웃해 재현함
- 약 1시간마다 체크포인트를 생성하고 영어와 독일어 지식, 수학, 코드, 지시 이행, 도구 사용, 긴 문맥, 안전성, 환각 대신 답변 유보, 문서 근거 활용을 자동 평가함
- 21일간의 사전학습에서 하드웨어 고장이나 연결 시간 초과로 38차례의 예기치 않은 중단이 발생했지만 수동 개입 없이 처리함
- 약 1만 GPU시간당 한 번꼴이며, 다른 노드에서 작업을 다시 시작해 최대 250스텝 이전 체크포인트부터 재개함
- 모든 팀이 전체 파이프라인과 체크포인트에 접근할 수 있어, 한 팀이 문서 근거 활용 기능의 학습과 평가를 종단 간 담당할 수 있었음
- 개발 과정에는 실패와 재실험도 있었음
- 테스트를 통과한 데이터 셔플링 버그 때문에 Kolibri Origin을 수조 토큰 학습한 뒤 중단하고 처음부터 다시 시작함
- 비교 실험 후 버그나 설정 오류를 발견해 일부 실험을 재실행했으며, 경험과 최신 연구를 파이프라인의 보호장치에 반영함
- 이번 개선은 더 많은 파라미터와 데이터, 잘 알려진 아키텍처 계열을 비교적 작은 규모에 적용한 결과라는 한계가 있음
- 더 큰 규모로 확장할 때의 도전은 남아 있으며, 지속적인 자산은 파이프라인뿐 아니라 원시 데이터에서 LLM을 빠르게 개발하고 출시할 수 있는 팀 역량임
- 320억~1,230억 파라미터 실험에서는 규모가 커질수록 성능이 좋아졌지만, 최종 크기는 서빙 비용을 고려해 선택함
- H100 두 장에서 25만 6,000토큰 요청을 처리할 때 1,230억 모델은 동시 요청 3개, 780억 모델은 18개를 처리함
- 780억 모델의 디코딩 속도는 28% 더 빠름
- 384개의 작은 전문가를 두고 토큰당 6개를 활성화하며, 공유 전문가 1개를 사용함
- 적은 수의 넓은 전문가보다 이 구성이 실험에서 더 나은 성능을 보임
- 50개 레이어 전체가 MoE이며, 모델 차원은 2,560, 쿼리/KV 헤드는 48/4, 전문가 은닉 차원은 512임
- 50개 레이어 가운데 10개만 전체 문맥을 처리하고, 나머지 40개는 512토큰 슬라이딩 윈도를 사용함
- 5번째 레이어마다 전체 어텐션을 적용하며, 나머지 레이어의 디코딩 연산량과 메모리는 문맥 길이와 무관하게 제한됨
- 이 효율은 서빙뿐 아니라 대량의 추론이 필요한 후속 강화학습에도 도움이 됨
- B200 GPU 768장으로 세 단계, 총 약 24조 토큰을 학습함
- 사전학습: 길이 16,384에서 20조 토큰을 21일간 학습함
- 중간학습: 길이 64k에서 3.44조 토큰을 학습하며, 추론, 문제 해결, 코드, 에이전트 데이터 비중을 높임
- 긴 문맥 적응: 길이 262,144에서 2,000억 토큰을 학습함
- 긴 문서만 학습하면 앞서 얻은 능력이 약화될 수 있어, 긴 문서와 고품질 중간학습 데이터를 섞음
- RULER 같은 벤치마크 점수를 인위적으로 부풀리지 않도록 긴 문맥 데이터에서 합성 장문을 제거함
- 실제 최장 학습 길이는 256k이며, 지원하는 최대 문맥 길이 1M과는 구분됨
- 영어와 독일어의 지식 기준일은 2026년 6월 18일임
- 두 모델 모두 Muon으로 최적화했고, 손실 급등 없이 학습을 마침
- 전문가 라우팅에는 Kimi K3의 분위수 균형화를 확장한 정확한 분위수 균형화를 도입함
- 히스토그램으로 전역 분위수를 추정하는 대신 배치 크기와 무관한 고정 비용으로 정확히 계산하며, 부하 균형과 모델 품질을 개선함
- 후속학습은 지도 미세조정(SFT) 으로 기본 추론과 채팅 상호작용을 가르친 뒤, 대규모 강화학습으로 여러 단계에 걸친 작업을 학습하는 두 단계로 구성함
- 합성 데이터 1,740억 토큰을 생성하고 품질 필터링한 뒤, 허용적인 라이선스의 공개 데이터셋을 정제해 합쳐 2,680억 토큰의 SFT 학습 데이터를 만듦
- 강화학습에는 코드와 수학 추론, 에이전트 작업, 지시 이행, 질의응답, 도구 호출 등 120만 개 이상의 정제된 작업을 사용함
- 자체 학습 코드에서 비동기 학습을 사용해 현재 모델의 환경 데이터 생성과 이미 생성된 데이터의 학습을 병렬 수행함
- SFT와 강화학습 모두에서 추론 노력 수준 none, low, medium, high 의 4단계를 학습함
- 사용자가 문제 해결에 투입할 연산량을 선택해 비용과 추론 속도를 최종 답변 품질과 절충할 수 있음
- 소규모 대리 모델 실험에서는 독일어 약 20% 가 최적이었지만, 공개 독일어 데이터는 중복 제거와 필터링 후 3,900억 토큰에 그쳤음
- 20조 토큰 학습에 필요한 독일어 목표량은 약 4조 토큰이었음
- 기계번역에 크게 의존하면 미묘한 오류와 독일어 고유의 문화적 맥락 부족이 문제가 됨. 관련 내용은 Sauerkraut, Not Burgers에서 확인할 수 있음
- 첫 번째 확보 방법은 Common Crawl의 독일어 특화 큐레이션임
- 영어용 필터는 긴 단어가 많은 독일 행정 문서를 제거할 수 있어, 평균 단어 길이 같은 기준을 독일어에 맞게 조정함
- 이 파이프라인으로 원래 독일어로 작성된 웹 텍스트 1.3조 고유 토큰을 확보함
- 두 번째는 기존 독일어 문서를 백과사전 항목, 질의응답, 일반 문단으로 재서술하는 방법임
- 사실과 문화적 맥락은 유지하면서 같은 지식을 여러 형태로 학습시키며, 새로운 지식보다는 표현의 다양성을 늘림
- 약 1조 고유 토큰을 확보했으며, 대통령 중심의 외국 맥락이 아니라 총리 등 독일어 원문의 맥락을 유지함
- 세 번째 방법인 영어에서 독일어로의 번역은 Kolibri Origin에만 사용함
- 모델, 프롬프트, 분할 방식을 신중히 선택해도 관용구의 직역투가 남을 수 있음
- 영어 웹의 지리적, 인구학적, 제도적 분포까지 따라오기 때문에 독일어로 말하되 미국적인 세계를 전제하는 모델이 될 수 있음
- Kolibri의 독일어 고유 데이터는 2.4조 토큰이며, 80%는 자체 정제 또는 생성, 20%는 공개 데이터셋에서 확보함
- 업샘플링 후 사전학습의 21.3%, 약 4.3조 토큰을 차지하며, 영어는 약 62%, 코드는 약 14%임
- 독일어 토큰당 평균 노출은 1.8회로, 반복 학습의 효과가 줄어드는 4에포크 기준 안에 있음
- 약 85%는 원래 독일어 웹 텍스트 또는 그 재서술이며, 나머지는 의회 기록, 법률, 퍼블릭 도메인 자료와 소량의 번역 자료임
- UniBPE는 BPE의 상향식 방식에 Unigram의 학습 목적을 결합해 어휘에 추가할 병합을 선택함
- 영어 토큰 효율을 희생하지 않으면서 독일어 합성어를 비롯한 언어의 형태론적 구조를 더 잘 반영하도록 설계함
- 각 모델의 사전학습 데이터에 맞춰 학습했으며, Kolibri의 어휘 크기는 128,000개임
- 독일어 FineWeb-2에서 토큰당 평균 4.90바이트로 비교 대상 중 가장 높은 압축률을 기록함
- 같은 데이터와 설정의 일반 BPE는 4.89, Kolibri Origin은 4.69, GPT-5는 4.35임
- 영어 FineWeb에서는 4.58로, 일반 BPE 4.59와 비슷함
- 토큰당 더 많은 텍스트를 담으면 작업당 토큰 수가 줄어 비용과 응답시간을 줄일 수 있음
- 형태소에 가까운 분할을 적용함
- Bundessozialgerichtes는 Bundes / sozial / gericht / es, Protokolldaten은 Protokoll / daten으로 나눔
- 영어에서도 silkworm은 silk / worm, coprocessors는 co / processors로 나눔
- 비교한 다른 토크나이저들은 이 예시에서 형태소 경계를 가로질러 더 많은 조각으로 분할함
- 일반적인 LLM 학습과 평가는 정답 가능성이 있는 추측에는 보상을 주지만 답변 유보에는 주지 않아, 근거가 부족해도 답하도록 학습될 수 있음
- 같은 이유로 인용을 요구해도 그럴듯한 출처를 만들어낼 수 있음
- 규제 산업에서는 “모르겠다”고 답하는 능력이 시험 운영과 실제 배포를 가르는 중요한 조건임
- 정답이 “모르겠다”인 학습 예제를 사용하고, 별도의 문서 근거 활용 및 환각 억제 지표를 지속적으로 평가함
- 좁은 전문 분야에서는 고품질 부정 예제가 부족해, Merlin-Arthur 절차로 기존 문서에서 합성 부정 예제를 생성함
- Merlin-Arthur 학습은 세 참여자의 게임으로 구성됨
- Arthur는 실제로 학습하고 배포하는 모델임
- Merlin은 기존 문맥을 바탕으로 Arthur가 정답을 맞힐 가능성을 높이는 새 문맥을 만듦
- Morgana는 관련 증거를 제거한 문맥으로 Arthur의 환각을 유도함
- Arthur는 상대를 알 수 없으므로 질문과 문맥을 확인해야 하며, Morgana의 문맥에서는 운 좋게 정답을 추측해도 오답으로 처리됨
- M/A grounding score는 답변 중 문서에서 유래했음을 증명할 수 있는 정보량의 하한을 측정함
- Kolibri는 0.23, Kolibri Origin은 0.00이며, 비교한 Qwen3.6은 0.12, Mistral Small 4는 0.06임
- Kolibri는 Origin보다 환각 대신 답변을 유보하는 비율이 높아짐
- AA-Omniscience의 비환각 비율은 14.8%에서 44.0%로 높아졌지만, Qwen3.6의 56.7%보다는 낮음
- RGB의 답변 유보 점수는 73.9에서 85.6, 허위 정보를 만들지 않는 점수는 75.6에서 87.3으로 개선됨
- FRAMES 점수는 65.7에서 71.2로 높아짐
- 공개 벤치마크가 포착하지 못하는 요구를 위해 산업별 평가 묶음을 구축함
- 독일 공공부문, 법률, 하드웨어, 소비자 전자제품, 자동차, 항공, 제조 등에서 필요한 기술, 도구 호출, 업무 흐름, 예외 상황을 반영함
- 고객과의 대화에서 중요한 문서, 사용할 도구, 어려운 질문, 배포 시스템의 실패 사례를 찾아 평가로 전환함
- 평가에 필요한 기술을 담은 전문 합성 학습 환경을 만들고, 도구, 설정, 하네스를 무작위화해 실제 환경에 대한 견고성을 높임
- 고객 데이터를 학습하지 않고 에이전트 RAG, 도메인별 논리와 기능을 개선함
- 모든 체크포인트를 자동 평가해, 고객이 제공한 실패 사례가 이후 모델에도 지속적인 개선 목표로 남게 함
- 에이전트 RAG 평가 Honeypot은 80.8로 모든 비교 모델을 앞섰으며, 정제한 MuSiQue는 77.3으로 Nemotron 3 Super의 79.1 다음을 기록함
- Origin의 점수는 각각 25.3과 42.7이었음
- 고객 응용 5개 중 4개에서 최고 모델과 동등하거나 더 높은 성능을 보임
- 반도체는 Origin 35.3에서 Kolibri 80.4, 독일 공공부문은 54.0에서 75.0으로 개선됨
- 항공우주는 14.1에서 58.9, 자동차 공급업체는 72.4에서 99.0, 산업용 구동 기술은 31.4에서 60.0으로 높아짐
- 독일 공공부문에서는 Nemotron 3 Super가 78.0으로 더 높았고, 항공우주에서는 Qwen3.6의 59.0과 거의 같았음
- 실행에는 Kolibri용 vLLM 플러그인을 제공하는 aleph-alpha-inference 패키지가 필요함
- 패키지는 지원하는 vLLM 버전도 함께 설치하며, aleph-alpha-inference>=1.0 또는 컨테이너 이미지 ghcr.io/Aleph-Alpha/aleph-alpha-inference를 사용할 수 있음
- 추론과 도구 호출에는 kolibri1 파서를 사용하며, 안내된 서빙 설정은 FP8 KV 캐시와 자동 도구 선택을 활성화함
- 262,144토큰을 넘는 문맥에는 --max-model-len 1048576과 --hf-overrides '{"max_position_embeddings": 1048576}' 설정이 필요함
- 권장 샘플링 설정은 temperature=1.0, top_p=0.97, top_k=128임
- 기업 배포와 특화 옵션은 영업팀 문의를 통해 지원받을 수 있음