카카오, 언어모델링 국제학회 'COLM 2026'서 AI 연구 성과 발표

3 days ago 8

대규모 AI 모델 학습 최적화 방법, 모델 경량화 연구 기법 발표 [아이뉴스24 정유림 기자] 카카오는 언어모델링 국제 학회 'COLM 2026'에서 대규모 전문가 혼합(MoE) 모델의 학습 효율을 높이는 기술, 모델 크기를 줄이면서도 성능을 개선하는 경량화 기술을 발표했다고 8일 밝혔다.카카오 로고 [사진=카카오]COLM은 대규모 언어모델(LLM)과 언어모델링 연구를 전문적으로 다루는 국제 학회로, 2024년 신설됐다. 카카오는 이번 학회의 메인 컨퍼런스와 토크나이제이션(토큰화·AI가 문자를 처리할 수 있도록 작은 단위로 쪼갬) 워크숍(톡샵·TokShop)에서 각각 성과를 소개했다.메인 컨퍼런스에서 발표한 논문은 대규모 MoE 모델의 사전 학습에 필요한 최적의 학습률을 전체 학습 비용의 약 1% 수준으로 예측하는 방법론을 담았다.학습률은 인공지능(AI) 모델이 학습할 때 내부 설정값인 매개변수를 얼마나 크게 조정할지 정하는 값이다. 너무 크면 학습이 불안정해지고 너무 작으면 학습 속도가 느려질 수 있어 적절한 값을 찾는 것이 중요하며 이는 학습의 안정성과 성능에 영향을 미친다.카카오는 소규모 모델에서 찾은 최적의 학습 설정을 대규모 모델로 확장하는 '뮤-매개변수화(μ-Parameterization)' 기법을 MoE 모델 구조의 특성에 맞게 적용했다. 모델의 크기와 학습 토큰량을 단계적으로 확장하며 최적의 학습률을 탐색하고 짧은 학습 구간에서 찾은 설정이 대규모 학습에서도 유효하게 적용됨을 검증했다. 이 방법론은 카카오의 '카나나-2.6-155b-a17b' 모델의 사전학습에 적용돼 10조(10T) 토큰까지 안정적으로 학습하는 데 활용됐다.워크숍에서는 모델 크기를 줄이면서도 성능을 높인 경량화 기술(BBT)을 공개했다. 기존 문자 조합 토큰 생성 방식(BPE) 기반 모델은 글을 읽고 답변을 생성하기 위해 수많은 단어와 단어 조각에 해당하는 정보를 저장해야 한다. BBT는 이를 더 작은 기본 단위인 바이트를 활용하는 구조로 바꿔 모델의 크기를 줄이면서 여러 문자를 묶어 효율적으로 압축 처리하는 기존 방식의 장점은 유지했다.이 기술은 비교 실험에서 파라미터 수를 20.2~40.4% 줄이면서 테스트 성능을 2.7~6.6% 개선한 것으로 나타났다. 오탈자나 문자 교란에 대한 강건성을 확보하고 학습하지 않은 언어로의 전이 성능도 높였다.이로써 온디바이스(기기 자체에서 AI 연산과 추론 실행) 환경에서 AI 모델의 메모리 ...

Read Entire Article