"이미지 이해력 지키며 멀티모달 AI 경량화"…노타, NeurIPS 논문 채택

텍스트·이미지별 전문가 중요도 평가…추가 학습 없이 압축
"전문가 절반 제거해도 성능 91% 유지…GPU 메모리 47% 절감"

본문 이미지 - 노타 전문가 혼합(MoE) 기반 멀티모달 AI 모델 전문가 푸르닝 연구논문 NeurIPS 2026 메인트랙 채택(노타 제공)
노타 전문가 혼합(MoE) 기반 멀티모달 AI 모델 전문가 푸르닝 연구논문 NeurIPS 2026 메인트랙 채택(노타 제공)

(서울=뉴스1) 김민석 기자 = 인공지능(AI) 모델에서 불필요한 부분을 덜어내는 '프루닝'은 텍스트와 이미지를 함께 처리하는 멀티모달 AI에 적용하기가 더 까다롭다. 글을 이해할 때 덜 쓰이는 부분도 차트나 사진을 분석할 때는 중요할 수 있어서다. 노타가 텍스트와 이미지에 필요한 부분을 각각 살피며 모델을 경량화하는 기술을 개발했다.

1일 업계에 따르면 노타의 전문가 혼합(MoE) 기반 멀티모달 AI 모델의 '전문가 프루닝' 연구 논문이 NeurIPS 2026 메인트랙에 채택됐다. 논문명은 'Modality-Aware Expert Pruning for MoE-Based Multimodal Large Language Models'다.

MoE는 여러 전문가 모듈 가운데 입력을 처리하는 데 필요한 일부만 골라 연산하는 구조다. 다만 연산에 참여하지 않는 전문가도 메모리에 저장해야 한다. 모델이 커질수록 구동에 필요한 GPU 메모리도 늘어나는 이유다. 전문가 프루닝은 중요도가 낮은 모듈을 제거해 이 부담을 줄인다.

노타 관계자는 "기존 언어모델용 기준을 멀티모달 모델에 그대로 적용하면 텍스트 처리에는 덜 중요해도 이미지 이해에는 필요한 전문가를 잃을 수 있다"며 "기존 방식에서 차트 이해처럼 시각 정보가 중요한 과제의 성능 저하를 확인했다"고 설명했다.

연구진은 텍스트와 이미지에 대한 전문가별 중요도를 따로 평가했다. 텍스트 기준으로 유지할 전문가를 고르고 이미지 기준을 활용해 제거할 전문가를 가려냈다. 모델의 모든 층에서 같은 수를 제거하는 대신 전체 전문가를 비교해 중요한 층에 필요한 모듈이 남도록 했다.

노타 측 평가에 따르면 약 310억 개 매개변수(파라미터) 모델에서 전문가 모듈의 25%를 제거했을 때 원본 성능의 98%를 유지했다. 제거 비율을 50%로 높였을 때는 91%를 유지했다. GPU 메모리 사용량은 58GB에서 31GB로 약 47% 줄었다. 노타는 이를 통해 해당 모델을 메모리 용량 40GB인 GPU 한 장으로 구동할 수 있는 수준을 확보했다고 회사 측은 설명했다.

별도 추가 학습 없이 한 차례 압축 과정으로 경량화할 수 있다는 점도 특징이다. 노타는 이번 기술을 AI 최적화 플랫폼 '넷츠프레소'에 반영해 이미지와 언어를 함께 처리하는 비전언어모델(VLM) 지원 역량을 강화할 계획이다. 영상과 음성으로 적용 범위를 넓히는 방안도 기대하고 있다.

채명수 노타 대표는 "이번 연구는 모델 성능을 유지하면서 필요한 컴퓨팅 자원을 크게 줄일 수 있다는 점에서 실제 AI 인프라 운영 효율을 높이는 데 의미가 크다"고 말했다.

ideaed@news1.kr

대표이사/발행인 : 이영섭

|

편집인 : 채원배

|

편집국장 : 김기성

|

주소 : 서울시 종로구 종로 47 (공평동,SC빌딩17층)

|

사업자등록번호 : 101-86-62870

|

고충처리인 : 김성환

|

청소년보호정책 책임자 : 허정현

|

통신판매업신고 : 서울종로 0676호

|

등록일 : 2011. 05. 26

|

제호 : 뉴스1코리아(읽기: 뉴스원코리아)

|

대표 전화 : 02-397-7000

|

대표 이메일 : webmaster@news1.kr

Copyright ⓒ 뉴스1. All rights reserved. 무단 사용 및 재배포, AI학습 활용 금지.