데이터 바꾸고 삭제해도 검색 정확도 유지하는 AI 기술 개발
KAIST 전산학부 김민수 교수팀, 검색 기술 '콘다' 개발
- 김종서 기자
(대전=뉴스1) 김종서 기자 = 한국과학기술원(KAIST)은 전산학부 김민수 교수 연구팀이 데이터가 지속적으로 추가되고 삭제되는 환경에서도 높은 검색 정확도를 안정적으로 유지하는 동적 벡터 검색 기술인 '콘다(CONDA)'를 개발했다고 5일 밝혔다.
생성형 AI는 학습이 끝난 뒤 새롭게 등장한 정보를 스스로 알지 못한다. 이를 보완하기 위해 최신 뉴스나 기업 내부 문서 등을 검색해 답변에 활용하는 '검색증강생성(RAG)' 기술이 널리 쓰이고 있다.
RAG가 제대로 작동하려면 수많은 자료 가운데 질문에 필요한 정보를 빠르고 정확하게 찾아내는 검색 기술이 중요하다. 현재 많은 AI 서비스는 문서나 이미지의 의미를 컴퓨터가 계산할 수 있는 숫자 묶음인 벡터로 바꾼 뒤, 의미가 비슷한 정보들을 서로 연결해 필요한 자료를 찾는다.
문제는 실제 기업이나 인터넷의 데이터는 계속 변한다는 점이다. 새로운 문서와 뉴스, 상품 정보가 들어오는 동시에 오래된 정보는 수정되거나 삭제된다. 이런 변화가 반복되면 데이터 사이에 만들어 놓은 연결망이 조금씩 끊어지는 '연결성 붕괴'가 발생할 수 있다.
콘다는 데이터 사이의 거리뿐만 아니라 필요한 정보까지 찾아갈 수 있도록 검색 경로가 제대로 연결돼 있는지를 함께 고려한다. 새로운 데이터가 추가되거나 기존 데이터가 삭제돼도 중요한 연결을 유지해 특정 정보가 검색망에서 고립되는 것을 막는 방식이다.
실험 결과, 콘다는 데이터가 쉴 새 없이 추가되고 삭제되는 환경에서도 기존 최신 기술 대비 검색 정확도를 최대 24.5% 높였다. 데이터 처리 속도도 최대 1.90배 향상시켰다.
1억 개의 데이터가 존재하는 대규모 환경에서 6시간 동안 검색과 데이터 업데이트를 동시에 수행하는 실험에서도 콘다는 비교 기술 대비 가장 짧은 응답시간과 높은 검색 정확도를 유지했다.
이번 기술은 생성형 AI가 외부 정보를 찾아 답변에 활용하는 RAG 환경에서 최신 정보를 오랫동안 안정적으로 검색하는 기반 기술로 활용될 것으로 기대된다.
연구팀은 향후 콘다의 연결성 보존 기술을 더 큰 규모와 다양한 저장 환경으로 확장하는 등 지속 고도화할 계획이다.
이번 연구 성과는 실제 제품에도 적용된다. 김 교수가 창업한 인공지능 데이터 인프라 기업 그래파이의 데이터베이스 제품인 '아카식DB'에 콘다 기술이 적용돼 올해 4분기 상용화될 예정이다.
김 교수는 "RAG의 중요한 가치는 대규모언어모델(LLM)이 미처 학습하지 못한 최신 정보를 필요한 순간 즉시 찾아 활용할 수 있다는 점"이라며 "이번 연구는 데이터가 끊임없이 변하는 현실 환경에서도 인공지능이 오랜 시간 정확하게 최신 지식을 활용할 수 있는 데이터 인프라를 제시했다는 점에서 의미가 크다"고 말했다.
KAIST 전산학부 이다래 석사과정 졸업생이 제1저자로 참여한 이번 연구 결과는 지난 9월 2일 데이터베이스 분야 국제학술대회 'VLDB 2026'에서 발표됐다.
jongseo12@news1.kr
Copyright ⓒ 뉴스1. All rights reserved. 무단 전재 및 재배포, AI학습 이용금지.









