DeepMath-103K: 인공지능 수학 추론의 혁신을 위한 거대한 도약
He Zhiwei 등 15명의 연구원이 개발한 DeepMath-103K는 엄격한 검증 과정을 거친 10만 3천 개의 수학 문제로 구성된 대규모 데이터셋으로, 강화학습 기반 AI 모델의 수학적 추론 능력 향상에 크게 기여할 것으로 기대됩니다. GitHub에서 공개적으로 제공됩니다.

인공지능(AI)이 복잡한 수학적 추론 능력을 갖추는 것은 AI 발전의 중요한 척도입니다. 최근 대규모 언어 모델(LLM)에 강화학습(RL)을 적용하는 연구가 주목받고 있지만, 충분히 어려운 문제를 포함하고, 검증 가능한 답변 형식을 가지며, 기존 평가 기준과 중복되지 않는 대규모 학습 데이터의 부족이 발전의 걸림돌이 되고 있었습니다.
이러한 한계를 극복하기 위해, He Zhiwei 등 15명의 연구원이 DeepMath-103K 라는 새로운 대규모 데이터셋을 발표했습니다. DeepMath-103K는 약 10만 3천 개의 수학 문제로 구성되어 있으며, 강화학습을 통해 고급 추론 모델을 훈련시키도록 특별히 설계되었습니다.
단순히 문제를 모아놓은 것이 아닙니다. DeepMath-103K는 다음과 같은 엄격한 과정을 거쳤습니다.
- 철저한 출처 분석: 문제의 신뢰성을 확보하기 위해 꼼꼼한 출처 분석이 이루어졌습니다.
- 엄격한 중복 제거: 다양한 기존 벤치마크와의 중복을 철저히 제거하여 데이터셋의 독립성을 확보했습니다.
- 난이도 필터링: 주로 5~9 레벨의 고난이도 문제만 선별하여, AI 모델의 추론 능력 향상에 도움이 되도록 했습니다.
- 검증 가능한 답변: 각 문제는 검증 가능한 최종 답변을 포함하고 있어, 규칙 기반 강화학습에 적합합니다.
- 다양한 솔루션 제공: 세 가지의 서로 다른 솔루션을 제공하여, 지도 학습 미세 조정이나 지식 증류 등 다양한 훈련 패러다임을 지원합니다.
DeepMath-103K는 다양한 수학 분야를 아우르며, 일반화 가능한 추론 능력 개발을 촉진합니다. 연구팀은 DeepMath-103K로 훈련된 모델이 어려운 수학 벤치마크에서 성능이 크게 향상되는 것을 확인하여, 데이터셋의 효과를 검증했습니다.
더 나은 AI 추론 시스템 구축을 위한 공동체의 발전을 위해, DeepMath-103K는 https://github.com/zwhe99/DeepMath 에서 공개적으로 제공됩니다. 이번 연구는 AI의 수학적 추론 능력 향상에 중요한 이정표를 세웠으며, 앞으로 AI의 발전에 큰 영향을 미칠 것으로 기대됩니다.
Reference
[arxiv] DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning
Published: (Updated: )
Author: Zhiwei He, Tian Liang, Jiahao Xu, Qiuzhi Liu, Xingyu Chen, Yue Wang, Linfeng Song, Dian Yu, Zhenwen Liang, Wenxuan Wang, Zhuosheng Zhang, Rui Wang, Zhaopeng Tu, Haitao Mi, Dong Yu
http://arxiv.org/abs/2504.11456v1