tracks
옥스퍼드의 수학자 Marc Lackenby는 열린 문제를 Google의 AI 공동 수학자에게 건넸습니다. AI가 증명을 만들었고, 이어 자체 검토 에이전트가 그 증명을 반려했습니다. 반려된 논증을 읽던 Lackenby는 그 안에서 진정으로 새로운 전략을 발견했고, 스스로 빈틈을 메워 문제를 해결했습니다.
공동 수학자는 AI와 수학에 분주한 해에 등장했습니다. 2026년 7월, Claude Fable 5가 야코비안 추측에 균열을 냈고; GPT-5.6 Sol이 맥스웰 추측을 무너뜨린 구성을 제안했으며 Dinitz-Garg-Goemans 추측의 해결을 도왔다; 그리고 공개되지 않은 OpenAI의 Astra가 하루 만에 열 개의 열린 문제를 해결했습니다.
이들 대부분은 원샷 결과였습니다. 모델이 답을 내고, 인간이 검증하는 방식이죠. 공동 수학자는 다른 방향의 시도입니다. 단일 질문에 답을 던져주는 대신, 연구의 길고 비선형적인 중간 과정을 위해 설계되었습니다. 이 글에서는 AI 공동 수학자가 무엇인지, 그 워크플로우와 멀티 에이전트 구조가 어떻게 작동하는지, 초기 사용자들의 발견, 그리고 아직 미흡한 부분을 다룹니다.
Google DeepMind AI 공동 수학자는 무엇인가?
AI 공동 수학자는 Google DeepMind의 연구 워크벤치로, 전문화된 AI 에이전트 팀을 조율해 수학자가 질문 설정부터 증명 작성까지 연구 프로젝트 전체를 수행하도록 돕습니다. 단발성 답변이 아니라, 연구의 복잡한 전 과정을 오케스트레이션하는 것을 목표로 합니다.
2026년 5월, Google DeepMind 연구진은 "에이전틱 AI로 수학자를 가속화한다"는 제목의 arXiv 프리프린트를 공개하며, 아이데이션, 문헌 조사, 계산, 증명 시도, 이론 구축까지 수학적 작업 전 주기를 오케스트레이션하는 에이전틱 AI 워크벤치를 소개했습니다.
현재 일부 연구자에게 제한적으로 제공되는 AI 공동 수학자는 그 자체로 해결사나 챗봇이 아니라, 비선형적이고 복잡한 수학 워크플로우를 오케스트레이션하는 상태 유지형 작업 공간입니다. 병렬 연구 스레드를 관리하고, 불확실성을 추적하며, 실패한 시도도 향후 참조를 위해 보존합니다. 출력물은 수학 및 물리학 연구에서 표준인 LaTeX 형식입니다.
이 시스템은 Gemini 3.1 위에 구축되었습니다. 현재는 증명 시도에 내부적으로 Gemini Deep Think를 사용하고, 계산 탐색을 위해 Python 실행과 통합합니다. 아직은 DeepMind의 전문 수학 엔진(AlphaProof, AlphaEvolve, Aletheia)을 내부 구성요소로 통합하지 않았지만, 향후 통합을 염두에 두고 설계되었습니다.
왜 AI 공동 수학자가 중요한가?
수학자들은 다음과 같은 작업에 LLM을 활용합니다:
- 문헌 조사
- 비공식적 증명 스케치
- 상용구 LaTeX 작성
- 탐색적 코드
또한 형식적 증명 보조기 등 AI 도구를 사용해 기계적으로 증명을 검증합니다.
각 도구는 전체 워크플로우의 특정 부분에서는 강력하지만, 수학자가 그 결과를 임기응변으로 엮어야 했습니다. 지금까지 수학자들이 실제로 사용하는 비선형 과정을 오케스트레이션하는 인프라 도구는 없었습니다.
AI 공동 수학자의 작동 방식
워크플로우 모델은 Claude Code나 Codex와 같은 AI 코딩 도구에서 느슨하게 차용했습니다. 그러나 이 워크플로우를 그대로 적용할 수는 없습니다. 소프트웨어에는 명세와 테스트 스위트가 있지만, 수학 연구는 비선형적입니다. 목표는 출발 시점에 모호하거나 정의되지 않았을 수 있고, 중간의 발견이 질문 자체를 완전히 재정의하기도 합니다.
공동 수학자의 워크플로우는 멀티 에이전트 시스템에 의해 구동되며 다음과 같습니다:
- 초기 탐색. 완벽한 원샷 프롬프트를 요구하기보다, 연구자는 시스템과 상호작용하며 상위 목표를 정제하고 연구 질문을 공식화합니다. 본격적인 작업 전 연구 의도를 명시적으로 만드는 단계입니다.
- 문헌 조사. 공동 수학자는 핵심 논문을 식별하고 관련 증명과 수학적 기법을 추출하는 문헌 조사를 수행합니다.
- 계산 프레임워크. 공동 수학자는 시연 사례와 관련 테스트를 갖춘 계산용 Python 라이브러리를 생성합니다.
- 검색 실행. 계산 프레임워크가 구축되면, 커스텀 라이브러리를 임포트해 클라우드 클러스터 전반으로 검색을 확장합니다. 저수준 로그에 파묻히지 않도록 고수준 진행 보고를 제공합니다.
- 최종 출력. 최종 출력은 컴파일된 LaTeX 문서입니다. 결과만이 아니라 발견 과정을 설명하며, 여백 주석으로 주장과 특정 참고문헌 또는 코드 출력 간의 연결을 표시합니다. 모든 검토자 에이전트가 승인한 후에만 보고서가 최종으로 표시됩니다. 검토에 실패한 보고서도 미해결로 표시되어 연구자에게 제공되며, 이렇게 해서 결함 있는 증명이 Lackenby에게 전달되었습니다.

AI 공동 수학자의 워크스트림 아키텍처
AI 공동 수학자의 아키텍처는 상위 프로젝트 코디네이터 에이전트와 전문화된 하위 에이전트가 존재하는 멀티 에이전트 시스템입니다.
워크플로우 조정
문제를 해결하기 위한 작업에 착수하기 전에, 프로젝트 코디네이터는 연구자와의 대화를 열어 명확화 질문을 통해 목표를 정제합니다. 예를 들어 계산기하학의 열린 문제인 "소파 문제"의 상계에 대해 묻는 연구자에게는 어느 변형에 집중할지, 혹은 둘 다 다룰지를 묻습니다. 합의된 정확한 목표가 에이전트를 배치하기 전에 문제의 범위를 규정합니다.
목표가 정해지면, 프로젝트 코디네이터는 에이전트와 하위 에이전트에게 작업을 위임하며, 의존성이 없는 한 병렬로 진행합니다. 한 에이전트는 문헌 조사를, 또 다른 에이전트는 계산 프레임워크 구축을, 또 다른 에이전트는 검색을 수행합니다. 다만 의존성이 있습니다. 계산 프레임워크의 커스텀 라이브러리가 존재해야 검색을 실행할 수 있습니다.

환각 방지
표준 에이전트는 종종 유효하지 않은 지름길을 찾거나, 레마를 환각하거나, 성급히 성공을 선언합니다. AI 공동 수학자는 이러한 단점을 피하기 위해 검토자 에이전트를 포함한 여러 장치를 사용합니다.
예를 들어 계산 탐색 중 탐색 공간이 폭발하면, 코딩 하위 에이전트는 모든 테스트가 통과하고 검토자 에이전트가 결과를 승인하기 전까지 코드를 완료 처리할 수 없어 워크플로우가 정지됩니다. 이 실패한 탐색은 로그로 남고 프로젝트 코디네이터에게 전달되며, 코디네이터는 채팅에서 연구자에게 이를 알립니다. 그러면 연구자는 다른 접근을 제안할 수 있습니다.
이런 막다른 길은 단순히 기록되는 데 그치지 않고, 정보로 취급됩니다. 버전 추적되어 연구 기록의 일부로 보존됩니다. 수학에서는 실패한 접근이 제약을 드러내거나 다른 경로를 가리키는 경우가 흔합니다.
과정 전반에서 코디네이터는 기본적으로 저수준 잡음을 걸러내지만, 연구자는 필요할 경우 어떤 워크스트림이든 자세히 들여다보고 수정할 수 있습니다.
첫 사례 연구와 협업 방식
초기 사례 몇 건은 서로 다른 협업 방식을 보여줍니다. 결함 있는 증명이 인간 통찰을 이끌어낸 경우, 여백 주석 하나가 질문을 재구성한 경우, 그리고 막다른 길을 빠르게 탐지해 한 주의 삽질을 막아준 경우입니다.
시스템이 잘못되었다고 표시한 증명 수선하기
옥스퍼드 대학교 수학과 교수 Marc Lackenby는 Kourovka 노트북(군론의 열린 연구 문제 모음)의 한 문제에 시스템을 적용했습니다. AI가 증명을 시도했고, 검토자 에이전트가 증명의 결함을 찾아 Lackenby에게 보고했습니다. 그는 그 빈틈을 어떻게 메울지 알고 있었습니다.
그런 인수인계가 핵심입니다. 기계가 놓친 것을 인간이 잡아내고, 그 주변의 무거운 작업은 기계가 담당했습니다.
여백 주석을 따라 새로운 통찰로
또 다른 수학자 Gergely Bérczi는 Stirling 계수 추측과 관련된 문제를 연구했습니다. 초기 검토를 위해 그는 주제, 배경, 알려진 방법, AlphaEvolve 실험이 제안한 잠재적 방향을 AI 공동 수학자에 제공했습니다.
AI 공동 수학자는 두 개의 추측에 대해(현재 인간 수학자의 검토 중) 증명을 제시하고, 주장에 대한 상세한 계산적 근거를 함께 제공했습니다. Bérczi는 완성된 문서의 여백 주석이 핵심 통찰을 일깨워 주었고, 그를 채팅 인터페이스에서 후속 탐구로 이끌었다고 보고했습니다.
한 주를 날리기 전에 막다른 길 감지
마지막으로 Semon Rezchikov은 해밀토니안 미분동형사상에 관한 기술적 문제를 제기했습니다. 그는 프로젝트 코디네이터와 문제를 논의해 작업의 정확한 정의에 합의했습니다. AI가 생성한 보고서에는 사실상 문제를 해결하는 핵심 레마와 그 증명(이후 검증됨)이 포함되어 있었습니다.
그 과정에서 한 접근법을 탐색했지만 막다른 길에 다다랐습니다. AI는 그 막다른 길에 훨씬 빠르게 도달했기에, 그는 일주일을 허비하지 않았습니다. 시스템은 낭비될 한 주의 노력을 몇 시간으로 압축했습니다.
FrontierMath 벤치마크 결과
AI 공동 수학자는 본질적으로 수학 문제 해결 도구가 아닌 워크플로우 도구입니다. 그럼에도 불구하고, 저자들이 높은 벤치마크 성과를 제시하는 데에는 몇 가지 이유가 있습니다:
- 기반 수학 엔진이 최전선 수학에서 유용한 협업자가 될 만큼 충분히 유능함을 보여주기 위해.
- 벤치마크가 오케스트레이션 계층이 더하는 가치를 측정할 수 있는 통제된 환경을 제공함을 보여주기 위해.
- 표준화된 지표가 아직 없으므로 협업 효능을 대리 측정하기 위해.
결과: AI 공동 수학자는 연구 수준 벤치마크인 FrontierMath 티어 4에서 48%를 기록했습니다. 이는 동일한 테스트, 동일한 티어에서 19%를 기록한 Google의 Gemini 3.1 Pro를 포함해 보고된 성과 중 최고입니다. Epoch AI는 FrontierMath 문제(티어 1–4 전반)의 약 3분의 1에서 오류를 발견했으며, 인간 검토를 진행 중입니다.
AI 공동 수학자는 전문 수학자들이 제공한 코드로 검증 가능한 답을 가진 유출되지 않은 연구 수준 수학 문제 100문항으로 구성된 Google 내부 벤치마크에서 87%를 기록했으며, Gemini 3.1 Pro는 57%, Gemini 3.1 Deep Think는 70%를 기록했습니다.
AI 공동 수학자의 알려진 한계
해당 논문은 구조적 한계에 대해 투명하게 밝힙니다:
- 주요 품질 관리는 검토자 에이전트와 증명 에이전트에 의존합니다. 적대적 검토 사이클은 검토자를 만족시키는 논증에 수렴하는 편향을 보일 수 있으며, 이는 정답성과 다를 수 있습니다. 구조적 취약점입니다.
- 다듬어진 LaTeX 출력이 거짓된 엄밀함을 줄 수 있습니다. 형식이 잘 갖춰진 문서는 기저 수학이 올바른지와 무관하게 완성되어 보일 수 있습니다.
- 연구자가 진정한 도메인 전문가일 때만 시스템이 잘 작동합니다. 비전문가가 모호한 문제를 시스템에 넘기고 그 출력을 맹신할 위험이 있습니다.
- AI의 증명은 여전히 인간 검증이 필요합니다. 예를 들어 Bérczi의 증명은 게재 당시에도 인간 검토 중이었습니다.
마무리 생각
AI 공동 수학자는 AI에게 문제를 풀어달라고 요청하는 방식에서 벗어나, AI와 함께 반복적이고 복잡한 수학 연구 과정을 수행하는 방향으로의 전환을 보여줍니다. 진짜 병목은 수학자들의 실제 작업 방식을 반영하는 워크플로우 인프라입니다.
이와 같은 에이전틱 시스템을 직접 구축해 보고 싶다면, DataCamp의 Associate AI Engineer for Developers 및 Associate AI Engineer for Data Scientists 트랙이 좋은 출발점입니다.
Google AI 공동 수학자 FAQs
AI 공동 수학자는 ChatGPT나 Gemini와 어떻게 다른가요?
ChatGPT와 Gemini는 단일 교환에 최적화된 대화형 도구입니다. AI 공동 수학자는 병렬 연구 스레드를 실행하고, 실패한 시도를 추적하며, 수주에 걸친 조사를 관리하는 상태 유지형 작업 공간입니다.
AI 공동 수학자가 수학자를 대체하나요?
아닙니다. 이 시스템은 출력물을 평가하고, 결함 있는 증명 속에서도 유용한 아이디어를 알아볼 수 있는 도메인 전문가가 이끌 때 가장 잘 작동합니다.
멀티 에이전트 시스템이란 무엇인가요?
여러 전문화된 AI 모델이 협업해 과제를 수행하는 아키텍처입니다. AI 공동 수학자에서는 문헌 검색, 계산, 증명 시도, 적대적 검토를 각각 별도의 에이전트가 담당합니다.
AI 공동 수학자는 오류와 막다른 길을 어떻게 처리하나요?
실패한 시도는 폐기되지 않고, 로그로 남기고 버전 추적하여 연구자에게 상신합니다. 수학에서는 막다른 길이 종종 제약을 드러내거나 더 나은 경로를 가리킵니다.
출력물은 일반적인 AI 생성 응답과 어떻게 다른가요?
시스템은 근거 없는 산문이 아니라, 주장과 특정 논문 또는 코드 출력 간의 연결을 여백 주석으로 표시한 컴파일된 LaTeX 문서를 생성합니다. 모든 검토자 에이전트가 승인한 뒤에야 보고서가 최종으로 표시됩니다.
