닫기

Advertisements

카카오, ‘COLM 2026’서 AI 연구 성과 공개…학습비용 낮추고 모델 경량화

기사듣기 기사듣기중지

공유하기

닫기

  • 카카오톡

  • 페이스북

  • 트위터 엑스

URL 복사

https://www.asiatoday.co.kr/kn/view.php?key=20261008010002386

글자크기

닫기

손강훈 기자

승인 : 2026. 10. 08. 09:27

구글 검색 선호 출처 추가 Google 검색에서 아시아투데이 기사를 더 자주 볼 수 있습니다.

Advertisements

Advertisements

MoE 최적 학습률 전체 비용 1% 수준으로 예측
BBT 적용해 모델 크기 최대 40.4% 줄이고 성능 개선
26.10.08[카카오 사진자료]카카오, 언어모델링 국제 학회 ‘COLM 2026’에서 AI 연구 성과 발표
카카오가 대규모 언어모델(LLM)의 학습 비용을 줄이고 모델 크기를 경량화하는 인공지능(AI) 연구 성과를 국제 학회에서 공개했다. 대규모 모델 학습에 필요한 최적 설정을 적은 비용으로 예측하고, 모델 크기를 줄이면서도 성능을 높이는 기술을 함께 선보였다.

8일 카카오에 따르면 회사는 언어모델링 국제학회 'COLM(Conference on Language Modeling) 2026' 메인 컨퍼런스와 토크나이제이션 워크숍 'TokShop'에서 관련 연구 결과를 발표했다.

메인 컨퍼런스에서는 대규모 전문가 혼합(MoE) 모델의 최적 학습률을 전체 학습 비용의 약 1% 수준으로 예측하는 방법론을 소개했다. 학습률은 AI 모델이 학습 과정에서 매개변수를 얼마나 크게 조정할지를 결정하는 값으로, 학습 안정성과 성능에 영향을 미친다.

카카오는 소규모 모델에서 찾은 최적 학습 설정을 대규모 모델로 확장하는 '뮤-매개변수화(μ-Parameterization)' 기법을 MoE 구조에 맞게 적용했다. 모델 크기와 학습 토큰량을 단계적으로 늘리면서 적정 학습률을 찾고, 짧은 학습 구간에서 확보한 설정이 대규모 학습에서도 유효한지를 검증했다.

해당 방법론은 카카오의 'Kanana-2.6-155b-a17b' 모델 사전학습에도 적용됐다. 이를 통해 10조 토큰 규모까지 안정적으로 학습을 진행했다는 게 회사 측 설명이다.
TokShop에서는 모델 크기를 줄이면서 성능을 높인 'BBT(BPE-Guided Byte Transformer)' 구조를 공개했다. 기존 BPE 방식이 단어나 단어 조각에 해당하는 정보를 저장하는 것과 달리, BBT는 더 작은 기본 단위인 바이트를 활용해 모델 크기를 줄이는 방식이다.

비교 실험에서는 파라미터 수를 20.2~40.4% 줄이면서 테스트 성능을 2.7~6.6% 개선했다. 오탈자나 문자 교란에 대한 대응력과 학습하지 않은 언어로의 전이 성능도 높였다.

카카오는 이를 온디바이스 환경에서 AI 모델의 메모리 부담을 줄이고, 다국어 입력이나 오탈자가 많은 대화 환경에서도 안정적인 성능을 구현하는 데 활용할 수 있을 것으로 보고 있다.

카카오는 앞으로 연구 적용 범위를 다양한 모델 구조와 멀티모달·다국어 환경으로 넓혀 대규모 LLM의 학습 및 운영 비용을 낮춘다는 계획이다.

카카오 관계자는 "이번 연구는 AI 모델의 성능을 유지하거나 높이면서 학습과 운영 비용을 낮출 수 있는 방법을 제시했다는 데 의미가 있다"며 "다양한 모델 구조와 멀티모달, 다국어 환경으로 연구를 확대해 실제 서비스 활용 가능성을 높이겠다"고 말했다.
손강훈 기자

ⓒ 아시아투데이, 무단전재 및 재배포 금지

기사제보 후원하기