GitHub 프로젝트

25GB RAM으로 744B 파라미터 AI를 돌리는 법: JustVugg/colibri 가이드

25GB RAM으로 744B 파라미터 AI를 돌리는 법: JustVugg/colibri 가이드

💡 요약

JustVugg/colibri는 744B~2.8T 파라미터급 거대 MoE(전문가 혼합) 모델을 GPU 서버가 아니라 일반 PC에서 돌아가게 만드는 오픈소스 추론 엔진입니다. VRAM·RAM·NVMe를 하나의 메모리 계층으로 묶고 필요한 전문가만 디스크에서 그때그때 불러오는 방식으로, 25GB 남짓한 RAM에서도 744B 모델 하나를 로드합니다. 단, 속도는 대화형 채팅용이 아니라 배치·연구용 수준입니다.

항목내용
프로젝트명JustVugg/colibri
개발자Vincenzo Fornaro
주요 역할대형 MoE 모델을 디스크 스트리밍 방식으로 소비자용 하드웨어에서 실행
구현 언어순수 C (외부 의존성 없음, 선택적 Python 변환·API 게이트웨이)
라이선스Apache 2.0
저장소 주소https://github.com/JustVugg/colibri

※ 이 글은 2026년 9월 기준 GitHub 저장소 공개 정보(README, 릴리스 노트)와 외부 벤치마크 리뷰를 근거로 작성되었습니다. 버전과 수치는 시점에 따라 달라질 수 있습니다.


1. Colibri는 무엇을 해결하는가

GLM-5.2, Kimi K3, DeepSeek V4처럼 744B에서 2.8T 파라미터에 이르는 최신 MoE(Mixture-of-Experts) 모델은 대부분 전체 파라미터를 한 번에 쓰지 않습니다. 질문 하나를 처리할 때 실제로 계산에 참여하는 파라미터(활성 파라미터)는 GLM-5.2 기준 약 40B 수준이고, 나머지는 필요할 때만 불려오는 "전문가(expert)" 조각으로 나뉘어 있습니다.

전문가 조각을 전부 RAM이나 VRAM에 올려두려면 일반 가정용 PC가 감당할 수 없는 메모리가 필요합니다. Colibri는 VRAM·RAM·NVMe SSD를 하나의 메모리 계층(memory tiering)으로 취급해, 지금 당장 필요한 전문가만 디스크에서 읽어 들이고 나머지는 그대로 디스크에 남겨둡니다.

구현도 특이합니다. 모델 하나당 C 파일 한 개(예: c/glm.c)로 엔진 전체를 짜서 BLAS 라이브러리도, 런타임 CUDA도, Docker도 필요 없이 gcc와 OpenMP만으로 빌드됩니다. 그 덕에 저장소는 공개 두 달여 만에 3만 개 이상의 스타를 모았고, Redis를 만든 Salvatore Sanfilippo가 같은 문제를 다루던 별도 프로젝트와 자주 비교되기도 했습니다.

📝 용어 설명  MoE(Mixture-of-Experts)는 모델 전체를 여러 개의 작은 "전문가" 신경망으로 쪼개고, 입력마다 그중 일부만 골라 계산하는 구조입니다. 전체 파라미터 수는 크지만 매 순간 실제로 쓰이는 연산량은 훨씬 작다는 특징이 있습니다.

2. 설치와 첫 실행

📍 사전빌드 바이너리 압축 해제 › coli info 확인 › 모델 변환·다운로드 › coli chat 실행

사전빌드 바이너리를 받는 방법이 가장 간단합니다.

mkdir colibri && tar xzf colibri-v1.8.0-linux-x86_64.tar.gz -C colibri && cd colibri
python3 coli info

소스에서 직접 빌드하려면 저장소를 내려받아 모델별 엔진을 컴파일합니다.

git clone https://github.com/JustVugg/colibri && cd colibri/c
./setup.sh
make -C c glm   # GLM-5.2 엔진 빌드

모델은 원본 가중치를 직접 변환하거나, 이미 변환된 컨테이너를 내려받습니다. GLM-5.2 int4 컨테이너는 용량이 약 372GB로, 다운로드만으로도 시간이 꽤 걸린다는 점을 감안해야 합니다.

./coli convert --model /nvme/glm52_i4
# 또는 사전 변환된 컨테이너 다운로드 (약 372GB)

COLI_MODEL=/nvme/glm52_i4 ./coli chat   # 터미널 대화형 실행
COLI_MODEL=/nvme/glm52_i4 ./coli web    # 웹 대시보드 실행
COLI_MODEL=/nvme/glm52_i4 ./coli serve  # OpenAI 호환 API 서버 실행

💡 꿀팁  372GB짜리 모델을 무작정 내려받기 전에 coli doctor로 현재 하드웨어 상태를 점검하고, coli plan으로 선택한 모델이 지금 디스크·RAM 조합에서 어느 정도 속도가 나올지 미리 가늠해 보세요. 실사용 리뷰들도 한결같이 다운로드 전에 이 두 명령부터 돌려보라고 권합니다.

3. 지원 모델과 하드웨어 요구사항

README는 2026년 9월 기준 9개 모델 계열마다 이 정도의 디스크·RAM 조합을 요구한다고 밝힙니다.

모델 디스크 RAM GPU
OLMoE약 7GB8GB불필요
GLM-5.2 / 5.3372GB / 419GB16GB 최소, 24GB 권장불필요
Qwen3.6약 20GB24GB선택(다중 GPU 시 최대 7배 가속)
DeepSeek V4 Flash167GB (REAP 축소 시 85GB)16GB 최소, 32GB 권장선택(GTX 10 이상)
Kimi K3약 1.6TB32GB 이상불필요

⚠️ 참고  README는 구형 per-row int4 컨테이너 대신 반드시 gs64 컨테이너를 쓰라고 명시합니다. 구형 포맷은 품질 저하와 생성 루프(같은 문장을 반복하는 현상)를 일으킬 수 있고, MTP(추측 디코딩) 헤드도 int4가 아닌 int8로 둬야 합니다. int4로 두면 수용률이 0~4%까지 떨어집니다.

4. 진짜 속도와 함정: 채팅용이 아니다

Colibri가 자주 오해받는 지점이 바로 속도입니다. 캐시가 비어 있는 콜드 상태에서는 초당 약 0.05~0.1개 토큰이 나옵니다. 짧은 답변 100토큰을 만드는 데도 17~33분이 걸릴 수 있다는 뜻으로, 두 개의 독립적인 실사용 리뷰에서 동일하게 확인된 수치입니다.

디스크를 빠른 것으로 바꿔도 속도가 비례해서 늘지는 않습니다. 순차 읽기 속도가 5.8배 빠른 SSD로 교체한 리뷰에서도 실제 토큰 생성 속도는 2.9배 개선에 그쳤는데, 병목이 디스크 입출력에서 CPU 연산으로 옮겨가기 때문입니다. GPU를 추가하는 것도 만능 해법이 아닙니다. 372GB짜리 모델은 소비자용 GPU 한 장의 VRAM에 다 들어가지 않으므로, 오히려 시스템 RAM을 늘리는 쪽이 더 큰 체감 성능 향상을 주는 경우가 많습니다.

⚠️ 참고  프로젝트를 리뷰한 한 개발자는 "이걸 프로덕션 인프라로 부르지 말 것"이라고 결론 내렸습니다. Colibri는 실시간 대화형 챗봇이나 고객 대면 API 서비스에는 맞지 않고, 시간 제약이 없는 연구·품질 평가·개인 실험 용도에 적합합니다.

5. Brio 모드와 실전 팁

모든 응답이 긴 문장을 새로 생성해야 하는 것은 아닙니다. "병합 / 수정 요청 / 반려" 처럼 선택지가 정해진 질문이라면 Colibri의 Brio 모드가 훨씬 빠릅니다. 토큰을 하나씩 샘플링하지 않고 각 선택지의 확률만 읽어 오기 때문에 completion_tokens가 0으로 처리될 만큼 가볍게 끝납니다.

./coli chat --model /nvme/qwen36_i4_gs64
> /brio merge | request changes | close

# API 호출 예시
curl -s http://127.0.0.1:8000/v1/brio -H 'Content-Type: application/json' -d '{
  "model": "qwen36",
  "state": "340줄, 파일 8개 변경, 테스트 없음. CI는 통과했지만 해당 경로는 커버되지 않음.",
  "question": "리뷰어는 어떻게 해야 하는가?",
  "options": ["merge", "request changes", "close"]}'

💡 꿀팁  바로 대규모 모델부터 시도하지 말고, 실제로 쓸 워크로드에서 뽑은 30~100개 샘플로 먼저 테스트해 콜드 캐시와 웜 캐시 속도를 각각 따로 기록해 보세요. 그 다음 호스팅 API를 계속 쓸 때의 비용과 비교하면 Colibri가 내 상황에 맞는지 훨씬 명확해집니다.

한눈에 보는 실행 체크리스트

✅ 핵심 정리

  • ☑️ coli doctor, coli plan으로 하드웨어와 예상 속도를 먼저 점검했는가
  • ☑️ 구형 per-row int4가 아닌 gs64 컨테이너로 변환했는가
  • ☑️ MTP(추측 디코딩) 헤드를 int8로 유지했는가
  • ☑️ 콜드 캐시와 웜 캐시 속도를 실제 워크로드 샘플로 따로 측정했는가
  • ☑️ 실시간 채팅이 아닌 연구·배치·품질 평가 용도로 기대치를 맞췄는가
  • ☑️ 폐쇄형 질문에는 전체 생성 대신 Brio 모드 사용을 검토했는가

자주 묻는 질문 (FAQ)

Q1. GPU가 반드시 있어야 하나요?

아니오. Colibri가 지원하는 모든 모델은 CPU만으로 작동합니다. GPU는 선택 사항이며 있으면 속도만 더 빨라집니다.

Q2. 일반 채팅 비서로 바로 써도 되나요?

권장하지 않습니다. 캐시가 비어 있으면 초당 0.05~0.1토큰 수준이라 실시간 대화에는 맞지 않습니다. 시간이 걸려도 괜찮은 연구·실험·배치 작업에 적합합니다.

Q3. macOS나 Windows에서도 되나요?

Apple M 시리즈를 포함한 macOS와 Windows 빌드 문서를 저장소가 별도로 제공하므로 지원됩니다. 다만 플랫폼별 세부 설정은 저장소의 docs/windows.md 등 공식 문서를 함께 확인하는 것이 안전합니다.