SoG: 지식 기반 합성 데이터 생성으로 LLM의 지평을 넓히다
SoG는 LLM의 데이터 효율성 문제 해결을 위한 혁신적인 합성 데이터 생성 프레임워크로, 문서 간 지식 연관성을 고려하여 다양하고 심층적인 데이터를 생성합니다. CoT와 CC 기법을 통합하여 데이터 품질을 높이고, 다양한 실험을 통해 SOTA를 능가하는 성능을 입증했습니다. 데이터 부족 분야에서 LLM의 효율적인 지식 습득을 위한 실질적인 해결책을 제시하며, AI 기술 발전에 크게 기여할 것으로 기대됩니다.

대규모 언어 모델의 한계를 극복하다: SoG의 등장
최근 괄목할 만한 성과를 거두고 있는 대규모 언어 모델(LLM)은 여전히 데이터 효율성 문제에 직면하고 있습니다. 특히, 소규모의 전문 분야 데이터셋으로 학습할 때는 그 한계가 더욱 두드러집니다. 기존의 합성 데이터 생성 방법들은 주로 문서 내 정보에만 초점을 맞춰 문서 간의 지식 연관성을 고려하지 못했는데, 이는 콘텐츠의 다양성과 심도를 제한하는 요인이었습니다.
SoG: 문서 간 지식 연관성을 활용한 혁신적인 접근
중국과학원 연구진(Xuhui Jiang 외)이 제안한 Synthetic-on-Graph (SoG) 는 이러한 문제를 해결하기 위해 등장했습니다. SoG는 문서 간 지식 연관성을 활용하여 효율적인 말뭉치 확장을 가능하게 하는 합성 데이터 생성 프레임워크입니다. SoG는 원본 말뭉치에서 개체와 개념을 추출하여 문서 간 연관성을 나타내는 컨텍스트 그래프를 구축하고, 그래프 워크 전략을 사용하여 지식과 관련된 샘플링을 수행합니다.
이를 통해 합성 데이터의 다양성과 일관성이 향상되어 모델은 복잡한 지식 구조를 학습하고 희귀 지식을 처리하는 능력을 향상시킬 수 있습니다. 더 나아가, Chain-of-Thought (CoT)와 Contrastive Clarifying (CC) 기법을 통합하여 합성 데이터의 질을 높이고, 추론 과정과 판별 능력을 강화했습니다.
놀라운 성능: SOTA를 뛰어넘다
다양한 실험 결과는 SoG의 우수성을 입증합니다. 다단계 문서 질의응답 데이터셋에서 SoG는 기존 최고 성능(SOTA) 방법을 능가하는 성능을 보였으며, 독해 이해 과제 데이터셋에서는 SOTA 방법과 비슷한 성능을 기록했습니다. 이는 SoG의 뛰어난 일반화 능력을 보여주는 결과입니다.
새로운 가능성을 열다
SoG는 합성 데이터 생성 분야에 새로운 이정표를 제시하며, 특히 데이터가 부족한 분야에서 LLM의 효율적인 지식 습득을 위한 실질적인 해결책을 제공합니다. SoG의 성공은 LLM의 발전과 다양한 응용 분야 확장에 크게 기여할 것으로 기대됩니다. 앞으로 SoG를 기반으로 더욱 발전된 합성 데이터 생성 기술이 개발되어 LLM의 한계를 뛰어넘는 혁신적인 결과들을 만들어낼 수 있기를 기대해봅니다. 이는 인공지능 시대의 새로운 가능성을 열어줄 것입니다.
Reference
[arxiv] Synthesize-on-Graph: Knowledgeable Synthetic Data Generation for Continue Pre-training of Large Language Models
Published: (Updated: )
Author: Xuhui Jiang, Shengjie Ma, Chengjin Xu, Cehao Yang, Liyu Zhang, Jian Guo
http://arxiv.org/abs/2505.00979v1