OpenAI가 2026년 10월 6일 공개하지 않은 내부 frontier model(가장 앞선 성능의 최신 모델)이 만든 수학 원고 722편을 한꺼번에 내놓았습니다. 8월 10건, 9월 100여 건이던 결과물이 10월 첫 주 만에 722편으로 늘었으니, 한 달에 열 배쯤 불어나는 셈입니다. 숫자보다 더 눈여겨볼 대목은 따로 있습니다. 이제 수학에서 어려운 일은 증명을 찾는 것보다 그 증명이 맞는지 확인하고 이해하는 것이 되어 가고 있습니다.

무엇이 공개됐나

OpenAI는 ’Sharing AI progress in mathematics’라는 제목의 연구 발표와 함께 원고 722편, 추론 과정 기록, 추측(conjecture), Lean 형식 증명을 GitHub의 공개 저장소에 올렸습니다. Lean은 증명을 컴퓨터가 한 줄씩 검사할 수 있는 코드로 옮기는 형식 증명 언어입니다. 저장소에는 원고가 372개 묶음으로 정리되어 있습니다.

발표에 앞서 OpenAI는 Institute for Advanced Study의 독립 자문 그룹인 Advisory Group on Mathematics and Artificial Intelligence와 결과 공개 기준과 권고안을 논의했다고 밝혔습니다.

시기 공개한 결과
2026년 8월 문제 10개에 대한 결과 약 10건
2026년 9월 Navier-Stokes 관련 결과와 문제 100여 개의 결과
2026년 10월 6일 원고 722편(17개 분야)

결과 하나를 만드는 데 든 계산량은 ChatGPT Pro가 약 3시간 생각하는 것과 비슷한 수준이었다고 OpenAI는 설명합니다. 원고는 소수 분포와 대수학부터 플라즈마 물리, 양자 회로까지 17개 분야에 걸쳐 있습니다. 한 수학자가 40년을 바쳐 대수기하학의 한 갈래를 밀고 나가는 것과 비교하면 규모와 속도의 차이가 큽니다.

또 하나 주목할 점은 이 모델이 수학 전용 엔진이 아니라는 것입니다. 이메일 초안을 쓰고 코드를 짜고 시를 짓는 범용 대규모 언어 모델이 특정 분야에 맞춘 조정 없이 이런 결과를 냈습니다.

수백 개의 원고 묶음이 쌓인 서가에 새 원고를 꽂는 로봇 팔

▲ AI가 쏟아낸 수학 원고

주요 결과 세 가지

이번 결과는 Riemann 가설이나 P 대 NP 문제를 완전히 푼 것은 아닙니다. 대신 오래된 난제에서 부분적인 진전을 여럿 냈습니다.

준 Riemann 가설의 경계 0.875

Riemann 가설은 제타 함수의 영점이 어디에 놓이는지를 다루며, 소수가 전체적으로 어떻게 분포하는지와 연결됩니다. Bernhard Riemann이 1859년에 겨냥한 자리는 0.5 임계선입니다. 사람 수학자들은 그동안 1.0선을 제외하고 영점이 놓일 수 있는 영역을 조금씩 좁혀 왔습니다. 이번 모델은 제타 함수와 모든 Dirichlet L-함수에서 어디서나 성립하는 0.875라는 고정 경계를 세웠습니다.

이런 경계 증명은 안개에 가린 산에 비유할 수 있습니다. 정상은 보이지 않지만, 등반대가 실제로 오른 지점까지는 산이 적어도 그만큼 높다고 증명할 수 있습니다. 0.875는 그렇게 확실히 다져 놓은 높이에 해당합니다.

Birch-Swinnerton-Dyer 추측

타원 곡선의 해를 다루는 Birch-Swinnerton-Dyer(BSD) 추측에서는 Selmer corank가 0 또는 1인 넓은 부류에 대해 완전한 공식을 세웠습니다.

Goldfeld 추측

Goldfeld 추측은 유리수 위의 타원 곡선 가운데 유리수 해가 유한한 것과 무한한 것이 절반씩 나뉜다고 봅니다. 모델은 예측된 50 대 50 analytic rank 분할까지 이어지는 다리를 완성했습니다.

이 결과들은 추측 전체를 증명하지 않았으므로 $100만이 걸린 Clay Mathematics Institute의 밀레니엄 문제 상금 대상은 아닙니다. 그래도 1970년대 말과 1980년대 이후 가장 큰 구조적 진전으로 볼 수 있습니다.

병목은 증명에서 검증으로

하루에 깊이 있는 논문 722편이 나오면 곧바로 문제가 생깁니다. 이런 원고를 평가할 전문성을 갖춘 수학자는 전 세계에 수백에서 1,000명 남짓입니다. 사람이 쓴 원고 한 편을 검토하는 데도 보통 몇 주에서 몇 달이 걸립니다.

여기서 Lean 형식 증명이 중요한 구실을 합니다. 형식화된 부분은 기계가 자동으로 논리를 검사할 수 있기 때문입니다. 수학의 질문이 ’증명할 수 있는가’에서 ’검증하고 이해할 수 있는가’로 옮겨 가는 이유가 여기에 있습니다.

다만 722편은 아직 수학계의 정식 동료 평가를 모두 거치지 않았습니다. 일부 원고에 미묘한 오류나 hallucination(그럴듯하지만 틀린 내용을 만드는 현상)이 섞여 있을 수 있습니다. 그런 오류도 모델의 추론이 어디서 무너지는지 보여 주는 신호가 된다는 점에서 쓸모가 있습니다. 검증 결과 90% 이상이 맞는 것으로 확인된다면 수학사에서 가장 큰 돌파로 기록될 수 있습니다.

수학계의 반발도 있습니다. 일부 수학자들은 정상적인 학술 절차 없이 자동 생성 결과 722편을 인터넷에 쏟아 놓았다고 강하게 비판했습니다. Fields Medal 수상자 25명은 공개 서한에서 AI가 수학을 사람의 탐구에서 산업적 검증 작업으로 바꿀 수 있다는 우려를 밝혔습니다. 서한은 수학의 목표가 세대를 이어 이해를 쌓는 사람의 공동체를 지키는 것인지, 검증된 추측을 AI 시스템에 계속 넣는 것인지를 묻습니다. 컴퓨터 과학자 Scott Aaronson도 OpenAI가 Navier-Stokes 문제를 비롯한 주요 난제의 해법을 쥐고 있다는 소문이 수학계에 돌고 있다고 전했습니다.

천장까지 쌓인 원고를 검토하는 소수의 수학자들

▲ 검증을 기다리는 원고 더미

왜 하필 수학인가

OpenAI가 수학에 힘을 싣는 까닭은 기존 benchmark(성능 평가 기준)가 포화 상태에 이르렀기 때문으로 보입니다. 아직 증명되지 않은 수학은 결과가 맞는지 객관적으로 확인할 수 있어서 가장 앞선 AI의 능력을 시험하기에 알맞습니다.

수학의 진전은 AI 자체로 되돌아올 수도 있습니다. OpenAI의 한 연구자는 순수 수학의 돌파가 학습 알고리즘, 행렬 곱셈, AI 칩 설계를 개선하는 되먹임 고리를 만든다고 짚었습니다. Google의 AlphaEvolve와 Sakana AI의 연구처럼 AI가 자동으로 찾아낸 결과가 다음 AI 시스템의 설계에 쓰이는 사례도 이미 있습니다.

다음은 생물학과 의학일 수 있다

수학이 먼저 바뀌는 것은 증명이 형식적이고 컴퓨터로 검증할 수 있기 때문입니다. 생물학과 의학은 실제 실험과 시험을 거쳐야 하므로 사정이 다릅니다. 그래서 수학은 다른 과학 분야에서 벌어질 일을 미리 보여 주는 지표로 볼 수 있습니다.

예를 들어 미래의 AI 모델이 주요 질병을 고칠 수 있는 새 의약 화합물 722종을 한꺼번에 내놓는다고 가정해 보면 검증 문제가 훨씬 무거워집니다. 사회는 사람의 이해 속도에 맞춰 AI의 발견을 늦출지, 작동 원리를 깊이 이해하지 못한 채로 활용을 서두를지 골라야 할 수 있습니다. 안전이 보장될 때까지 연구를 멈춰야 하는지를 두고도 의견이 갈립니다.

더 근본적인 질문도 남습니다. AI가 사람의 이해를 끌어올릴지, 아니면 사람이 따라갈 수 없는 지점까지 앞서 나갈지입니다. 침팬지는 막대기나 동물 뼈 같은 도구는 이해했지만 불, 바퀴, 헬리콥터 앞에서는 이해가 끊겼습니다. 지금도 최전선 수학을 이해하는 사람은 극소수인데, AI의 발견이 사람이 추적하거나 검증할 수 없는 지평을 넘을 위험이 있다는 우려가 나오는 까닭입니다.

정리: 결과보다 검증을 지켜볼 때

이번 발표의 핵심은 AI가 수학 결과를 사람보다 훨씬 빠르게 만들기 시작했고, 그 결과를 확인하고 이해하는 일이 새로운 병목이 됐다는 점입니다. 독자가 지금 해 볼 만한 일은 다음과 같습니다.

  • 원고 한 편의 완성도보다 몇 달 사이의 증가 곡선을 함께 봅니다.
  • 관심 있는 분야가 있다면 OpenAI가 공개한 저장소의 원고, 추론 기록, Lean 코드를 직접 살펴봅니다.
  • 어려운 논문은 ChatGPT 같은 도구로 쉬운 말로 풀어 달라고 해 읽되, Lean 같은 형식 검증 여부를 함께 확인합니다.
  • 앞으로 몇 달 동안 수학계의 검증 결과가 몇 퍼센트 맞는 것으로 나오는지 지켜봅니다. 그 비율이 이번 발표의 실제 무게를 정할 가능성이 큽니다.
  • 수학의 변화를 생물학과 의학, 그리고 AI 연구 자체에서 벌어질 변화의 선행 지표로 삼습니다.