Jungseob's Note
포스트
원문 대표 이미지 · The paradox at the heart of AI and science | Terence Tao

헬리콥터로 폭포에 데려다주면 가는 길을 배우지 못한다 - 테런스 타오가 말하는 AI와 과학의 역설

과학을 폭포를 찾아가는 하이킹에 비유하고 AI 도구를 목적지로 곧장 날아가는 헬리콥터에 비유해 효율의 대가를 지적한 30분 인터뷰. 인간 전문가는 깊이에 강하고 AI는 넓이에 강하다는 상보성, 케플러의 모델이 초기에는 기존 모델보다 정확도가 낮았다는 사례로 본 즉각 피드백의 위험, 그리고 증명 소화불량과 종자 옥수수 문제까지 다룬다.

헬리콥터로 폭포에 데려다주면 가는 길을 배우지 못한다 - 테런스 타오가 말하는 AI와 과학의 역설

헬리콥터로 폭포에 데려다주면 가는 길을 배우지 못한다

TL;DR

  • 비유가 이 인터뷰의 축인데 과학은 하이킹과 비슷해서 폭포를 찾아 나서며 지도를 만들고 길을 조금 잃는데 그 와중에 흥미로운 다른 것을 발견하기도 한다는 것이다. 그런데 도구가 다르다. 이 AI 도구들은 목적지로 곧장 날아가 보여주고 다시 데려오는 헬리콥터처럼 될 수 있어서, 기술적으로는 목표를 훨씬 효율적으로 달성하지만 거기 가는 법을 배우지 못하고 요청한 것 말고는 어떤 흥미로운 현상도 보지 못할 수 있다.
  • 역설이 정면으로 서술되는데 AI는 더 강력하고 유능해지며 실수를 덜 하고 과학자가 하려는 일이라 생각하는 목표를 표면상 많이 달성해서 실험을 돌리고 데이터를 분석하고 논문을 쓴다는 것이다. 그런데 대가가 지목된다. AI가 어떤 기술을 익히는 대신 인간 과학자는 과학을 더 잘하게 되지 않을 수 있고, 무슨 일이 방금 일어났는지와 왜 이 발견이 흥미로운지를 아무도 설명할 수 없게 될 수 있다.
  • 능력의 상보성이 일차원 사고를 대체하는데 인간 전문가는 깊이에 집중해 진전을 시도하는 것만으로 통찰이 드러날 만큼 어려운 문제 하나둘을 고르지만, AI는 표준 기법이 통하지 않는 문제에서 여전히 아주 나쁘고 무작위로 추측할 뿐이라는 것이다. 그런데 강점이 반대편에 있다. AI는 넓이에서 탁월해서 1,000개 문제를 던지면 5퍼센트만 풀어도 50개가 풀린 것이며, 1970년 어느 저널의 논문에 열쇠가 있다는 것을 인간은 알아채지 못한다.
  • 케플러 사례가 즉각 피드백의 위험을 보여주는데 다섯 정다면체로 태양계를 설명한 착상을 오래 붙들었고 튀코 브라헤의 고품질 데이터를 얻고 나서야 맞지 않는다는 것을 발견해 여러 해 만에 타원에 도달했다는 것이다. 그리고 위험이 명시된다. 코페르니쿠스 자신이 자기 측정이 당시 최선 예측보다 나쁘다고 인정했으므로, 그들에게 AI가 있었다면 올바른 태양중심 모델이 초기 예측이 나쁘다는 이유로 버려졌을 수 있다.
  • 증명 소화불량이 현재 상태로 제시되는데 생성과 검증이 자동화되어 해답이 많이 나오지만 증명은 길어지고 AI가 쓴 것은 사소한 것에 많은 시간을 쓰고 가장 흥미로운 부분에는 거의 쓰지 않는다는 것이다. 그리고 병목이 지목된다. 초기 단계는 가속되지만 후기 단계는 아니어서 이해하고 교과서 형태로 넣는 속도는 여전히 인간이 하며, 소화해야 할 해답이 넘쳐 분류해야 하는 처음 겪는 상황이다.

Source

The paradox at the heart of AI and science — Big Think × Terence Tao(UCLA 수학 교수), 30분 11초 · 2026년 9월 3일 공개

Terence Tao 인터뷰

Source: The paradox at the heart of AI and science — Big Think × Terence Tao, 30분 11초

Knowledge

폭포로 가는 하이킹과 헬리콥터

인터뷰는 비유로 시작한다. 과거에 준 비유 하나가 과학이 하이킹을 가는 것과 조금 비슷하다는 것이라는 것이다. 상황이 서술된다. 흥미로운 폭포, 아름다운 폭포가 저기 있다는 말을 들었고 그래서 친구들과 그것을 찾으러 하이킹을 가기로 하는데 지도를 만들어야 한다는 것이다. 그리고 과정의 가치가 제시된다. 길을 조금 잃지만 어쩌면 길을 잃는 동안 흥미로운 다른 것을 발견하고 그것을 기록해 둔다는 것이다. 또 하나의 발견도 서술된다. 이 폭포로 가는 길에 멀리서 더 장관인 폭포를 발견하는데 아직 거기 갈 수는 없지만 어쩌면 미래의 어떤 하이커가 거기 가는 법을 알아낼 것이라는 것이다. 그래서 결론이 나온다. 목표에 도달하는 데 전체 과정이 있고 그것도 아주 값어치 있다는 것이다.

그런데 도구가 다르다고 한다. 이 AI 도구들은 이 폭포로 곧장 날아가서 그것을 보게 하고 다시 날아 돌아오는 헬리콥터처럼 될 수 있다는 것이다. 그리고 대가가 두 가지로 제시된다. 거기 가는 법에 대해 아무것도 배우지 못한다는 것이다. 그리고 요청한 특정한 것 말고는 어떤 흥미로운 현상도 보지 못할 수 있다는 것이다. 그래서 판정이 나온다. 기술적으로는 목표를 훨씬 더 효율적으로 달성했더라도 잃어버린 무언가가 있을 수 있다는 것이다.

발화자도 밝혀진다. 자기 이름은 테런스 타오이고 캘리포니아대학교 로스앤젤레스의 수학 교수이며 곧 나올 책이 있다는 것이다.

과학의 패러다임이 넷으로 늘어난 경로

역사가 정리된다. 과학과 수학이 여러 세기에 걸쳐 많이 바뀌었다는 것이다. 전통적인 두 패러다임이 제시된다. 이론과 실험이었다는 것이다. 예시도 붙는다. 케플러가 행성이 어떻게 움직이는지 이론을 만들거나 뉴턴이 중력 이론을 만들고 실험을 돌려 무엇이 일어나는지 보고 이론과 실험이 맞는지 확인하려 했다는 것이다.

수학의 특이성도 제시된다. 수학은 거의 전적으로 이론이라는 점에서 조금 달랐으며 순수 수학에서 할 실험은 아주아주 적었다는 것이다. 예외도 하나 제시된다. 가우스가 유명하게 첫 10만 개 소수를 계산했고 그것이 예측을 만드는 데 쓴 데이터셋이었으며 지금 소수 정리라 부르는 것을 예측했다는 것이다.

이후 추가된 것이 열거된다. 나중에 시뮬레이션이 나와서 크고 비싼 실험을 돌리지 않고 슈퍼컴퓨터에서 허리케인을 시뮬레이션할 수 있게 되었다는 것이다. 그다음 빅데이터가 나와서 특정 이론을 확인하거나 부정하려고 적은 수의 실험을 하는 대신, 메가바이트나 페타바이트의 데이터를 가져다 패턴을 식별하고 방대한 데이터셋에서 법칙을 추출하려 하게 되었다는 것이다.

그런데 지금 모든 방식이 변형되고 있다고 한다. 이제 AI가 우리를 돕기 때문이라는 것이다. 과거의 조건이 대비된다. 과거에는 이 모든 과학 방식이 인간 과학자가 해야 했으며 실험을 수행할 사람이나 이론적 계산을 할 사람, 시뮬레이션을 돌릴 사람, 데이터를 살펴볼 사람이 있어야 했다는 것이다. 컴퓨터를 써도 마찬가지였다고 한다. 일부는 컴퓨터로 할 수 있었지만 그때도 데이터 분석 도구를 프로그래밍해야 했고 여전히 많은 전문성이 필요했다는 것이다.

현재가 열거된다. 실험을 자동으로 수행하는 자동화된 실험실이 있고 코딩 에이전트에게 시뮬레이션을 돌리게 할 수 있고 자동 데이터 분석도 시도할 수 있다는 것이다. 그리고 자동 이론도 점점 가능해진다고 한다. 어떤 수학 문제를 가져다 이 가설들과 공리들의 결과가 무엇인지, 어떤 결론을 얻어야 하는지 물을 수 있다는 것이다. 규모도 제시된다. 이 도구들이 이제 규모에서 훨씬 빠르게 될 수 있으며 어떤 한 인간 과학자보다 훨씬 많은 이론적 분석을 돌릴 수 있다는 것이다.

느린 방식에 있는 가치

그런데 그것만 원하는 것이 아니라고 한다. 느린 방식으로 하는 것에 가치가 있다는 것이다. 구체적 장면이 제시된다. 펜과 종이로 몇 시간이고 풀어 나가는 과학자, 맨손으로 현장에서 실험을 하는 과학자, 그리고 나타나는 시뮬레이션을 실제로 디버깅하는 과학자라는 것이다. 그리고 얻는 것이 열거된다. 그들은 찾으려는 답을 얻는 것을 넘어 추가 통찰을 많이 배우는 일이 잦다는 것이다. 발견도 열거된다. 새로운 현상을 발견할 수 있고 연결을 볼 수 있으며 문헌 어딘가에서 연구된 이전 것과의 유사성을 볼 수 있고 자기가 발견한 것을 다른 사람에게 전달할 수 있다는 것이다.

그래서 역설이 정면으로 제시된다. 한편으로 AI는 더 강력하고 유능해지며 실수를 덜 하고 우리가 과학자가 하려는 일이라 생각하는 목표를 표면상 많이 달성한다는 것이다. 열거도 붙는다. 실험을 돌리고 데이터를 분석하고 논문을 쓴다는 것이다.

그런데 대가가 지목된다. AI가 어떤 기술을 익히는 대신 어떤 인간 과학자도 과학을 하는 데 더 나아지지 않는 결과가 될 수 있다는 것이다. 잃는 것이 구체적이다. 무슨 일이 방금 일어났는지, 왜 이 과학적 발견이 흥미로운지, 왜 이 증명이 새로운지, 어떤 특징을 갖고 어떻게 연결되는지를 아무 인간도 정확히 전달할 수 없다는 것이다.

그래서 요구가 제시된다. 과학이 무엇인지, 과학에서 실제로 무엇을 원하는지에 대한 우리 개념을 어느 정도 다시 설계해야 할 수 있다는 것이다. 그리고 질문이 남는다. 정확히 과학은 무엇을 위한 것이고 우리는 무엇을 하려는 것인지, 그리고 AI 도구를 과학에 겨눌 때 잘못된 것을 최적화하고 있을 위험이 있는지라는 것이다.

다음 단어를 맞히는 것이 왜 작동하는가

기계 학습이 회귀로 설명된다. 아주 단순한 예가 회귀이며 어떤 동물에게 먹이를 더 주면 더 커진다는 것을 관찰한다면 여러 동물에게 준 먹이 양과 무게를 그래프에 점으로 찍고 운이 좋으면 어떤 선에 맞으며 그 선이 예측이 된다는 것이다. 현실의 복잡성도 인정된다. 실제 세계에서는 이런 깔끔한 선형 관계를 늘 얻지 못하고 입력도 많고 출력도 많고 관계가 정말 복잡할 수 있다는 것이다. 그럼에도 방법이 있다고 한다. 때로 데이터에 형태가 있고 이제 이 형태를 탐지하고 입출력 쌍에 곡선을 맞추는 온갖 영리한 방법이 있다는 것이다.

대규모 언어 모델도 같은 틀로 설명된다. 챗봇을 돌리는 그것들은 문장에서 다음 단어를 대는 게임을 하고 있을 뿐이라는 것이다. 예시도 제시된다. 장미는 붉고 제비꽃은 무엇이냐 하면 답이 파랗다는 것이라고 아마 짐작할 것이라는 것이다. 구조가 서술된다. 입력이 이 모든 불완전한 문장이고 출력이 완성하고 싶은 단어인 거대한 그래프를 상상할 수 있으며 고차원 공간의 이 점들에 어떤 곡선을 맞춰 가장 가능성 있는 단어를 설명하려 한다는 것이다. 단일 답이 아닌 경우도 제시된다. 안녕 내 이름은 다음에는 넣을 수 있는 이름이 아주 많으므로 늘 단일 답을 얻지는 못하지만 가장 그럴듯한 답을 얻으려 할 수 있다는 것이다.

그리고 자동완성과의 연속성이 제시된다. 사람들이 이것을 시도했고 휴대폰의 자동완성 기능이 이것을 하며 때로는 맞고 때로는 우스꽝스럽다는 것이다. 반복의 결과도 서술된다. 많은 사람이 자동완성을 계속 누르며 놀아 봤는데 헛소리 문장이 나오고 타자기 앞의 원숭이를 얻는다는 것이다.

그런데 마법이 어디서 오는지가 제시된다. 이 모델들을 충분한 데이터, 수조 개의 데이터 점으로 훈련하고 가능한 한 좋은 곡선을 맞추려 정말 애쓰는데 이것이 수백만 달러의 컴퓨팅과 여러 달의 시간을 들이며 그러면 갑자기 반복해도 일관성이 유지된다는 것이다. 결과가 서술된다. 원숭이가 아니라 실제로 사람이 말하는 것처럼 들리기 시작한다는 것이다. 그리고 정직한 유보가 붙는다. 왜 그런지 우리는 완전히 이해하지 못한다는 것이다.

참인 것 같은 것이 제시된다. 영어나 다른 자연 언어가 우리가 의식적으로 알지 못하는 숨은 패턴을 많이 담고 있다는 것이다. 예시도 제시된다. 문법 법칙 같은 영어의 법칙 일부는 알지만 인간이 습득하는 말해지지 않고 쓰이지 않은 규칙이 있으며 인간 아이는 명사나 동사가 무엇인지 배우지 않고도 영어 단어가 어떤 순서로 가는지 습득할 수 있다는 것이다. 그래서 결과가 제시된다. 언어에 계속 노출되는 것만으로 이 모델들도 언어의 패턴을 습득하도록 가르칠 수 있는 것처럼 보이며 2 더하기 3의 답은 하고 물으면 5라고 말할 지점까지 간다는 것이다.

능력 향상의 기제도 제시된다. 영어를 조금 말할 능력이 생기면 루프를 돌며 자기 작업을 확인하고 실수를 덜 할 수 있으며 단계별로 진행하고 이중 확인되지 않으면 말하지 않도록 프롬프트할 수 있다는 것이다. 그래서 상태가 규정된다. 그렇게 따옴표 붙인 더 똑똑해짐이 일어나 아주 복잡한 과업을 많이 풀 지점에 이르지만 여전히 다음에 말할 단어를 추측하고 있을 뿐이라는 것이다. 그리고 한계가 명시된다. 실제 세계에 대한 어떤 깊은 이해에 근거하지 않으며 지적인 방식으로 말하는 사람을 모방할 만큼 언어 패턴을 잘 흡수해서 우리를 속일 만큼 그리고 실제로 유용한 일을 할 만큼 지능적으로 보일 수 있다는 것이다.

수학에서의 실제도 제시된다. 이제 LLM에게 증명을 제시하라고 해서 어떤 수학 문제를 풀 수 있고 때로 그 증명은 완전히 쓰레기지만 충분히 루프를 돌리고 검사를 충분히 하면 실제로 양의 성공률을 갖기 시작할 수 있다는 것이다. 그리고 성격이 규정되는데 이 대목의 표현이 인상적이다. 문제를 푸는 아주 이상한 방식이며 우리가 보통 지능을 아주 근거 있고 방법론적인 첫 원리 사고로 생각하는 방식과 완전히 직교한다는 것이다. 비유도 제시된다. 많이 아는데 살짝 취해 있어서 아이디어를 던져 대는 사람 같지만 충분한 안내가 있으면 실제로 유용한 출력을 뽑아낼 수 있다는 것이다.

깊이와 넓이의 상보성

논쟁의 오류가 먼저 지목된다. AI의 과학과 다른 분야에서의 역할에 대한 논쟁 일부가 일차원적 사고로 기본 설정된다는 것이다. 그 형태가 제시된다. 쉬운 과업과 어려운 과업과 아주 어려운 과업이 있고 인간은 어느 수준까지 할 수 있고 AI도 어느 수준까지 할 수 있으니 어느 쪽이 더 나은가 하는 것이 일차원적 사고방식이라는 것이다.

그런데 실제로 발견한 것이 다르다고 한다. AI와 작업하며 그들의 문제 해결 방식을 인간의 방식과 비교했을 때 그들이 정말 꽤 상보적이라는 것이다.

인간의 강점이 서술된다. 인간 전문가는 깊이에 집중하며 수천 개 문제를 풀 수 있는 인간 수학자는 그중 하나둘을 고른다는 것이다. 선택 기준도 정교하다. 어렵지만 불가능할 만큼 어렵지는 않고 그것을 향해 조금 진전을 시도하는 연습만으로 온갖 통찰이 드러나 공유할 수 있고 학생이나 협력자나 다른 사람이 그 위에 쌓을 수 있을 만큼 어려운 것이라는 것이다.

AI의 약점이 명확히 제시된다. 표준 기법이 하나도 통하지 않는 정말 어려운 문제에 AI를 겨누면 여전히 아주아주 나쁘며 그냥 무작위로 추측한다는 것이다.

그런데 강점이 반대편에 있다고 한다. 그들은 넓이에서 탁월하다는 것이다. 구조가 서술된다. 다양한 난이도의 문제 1,000개를 겨누면 어떤 것은 너무 어렵지만 실제로 기존 방법으로 닿을 수 있는 것이 있고 문헌에 문제를 풀 어떤 방법이 있거나 별개의 두 방법을 조합해야 하는 경우가 있다는 것이다. 그리고 병목이 인간 쪽에 있다고 한다. 이 모든 문제를 볼 인간 전문가가 충분하지 않으며 문제를 보는 인간 전문가도 실제로 이 문제를 풀 핵심 착상을 담은 1970년 어느 저널의 잘 알려지지 않은 논문이 있다는 것을 알아채지 못할 수 있다는 것이다. 또 하나도 붙는다. 어느 기법이 어느 문제에 통할지 모든 조합을 다 훑을 인내심이나 시간이 없다는 것이다.

AI의 실제 작동도 서술된다. 어느 기법이 문제에 통할지 다소 무작위로 교육된 추측을 하며 어떤 것은 멍청하지만 어떤 것은 통할 수 있고 이 모든 조합을 통해 때로 나머지 모든 인간이 놓친 해답을 잡을 수 있다는 것이다.

편견의 부재도 강점으로 제시된다. 때로 전문가들의 통념이 틀린데, 어떤 문제가 긍정적 답을 갖는다고 다들 생각하지만 실제로는 부정적 답을 가지며 다들 답이 참이라 생각해서 부정적 경우를 별로 보지 않았을 수 있다는 것이다. 그런데 AI는 다르다고 한다. 그런 선입견이 없을 수 있으므로 때로 독립적인 한 쌍의 눈으로 기능한다는 것이다. 결과도 제시된다. 아주 어렵다고 생각한 어떤 문제들이 놀랍도록 단순한 해답을 가졌고 돌아보면 우리 스스로 도달했어야 했을 것이라는 것이다.

수치로도 정리된다. 아주 넓은 범위의 문제를 겨누면 어떤 비율을 푸는데, 1,000개 문제를 겨누어 5퍼센트를 풀면 그것도 50개 문제가 풀린 것이라는 것이다. 그리고 판정이 나온다. 풀린 문제의 생수로는 어떤 의미에서 인간 수학자를 능가하는 도구를 이미 가질 수 있다는 것이다. 다만 유보도 붙는다. 풀리는 50개 문제가 가장 풀리기를 원하는 50개 문제가 아닐 수 있고 무작위 50개 문제일 수 있다는 것이다. 그럼에도 인상적이라고 한다.

직업으로서의 과제가 제시된다. 넓은 규모에서 문제를 푸는 이 새 능력을 통합하는 방법을 찾고 깊은 문제 몇 개를 아주 느리게 푸는 기존 능력과 어떻게 맞물리게 할지 알아내야 한다는 것이다.

케플러가 보여주는 즉각 피드백의 위험

케플러 이야기가 과정의 중요성을 보여주는 사례로 제시된다. 그가 유명한 운동 법칙을 발견한 이야기가 매혹적이며 과정이 얼마나 중요한지 보여준다는 것이다.

경로가 서술된다. 케플러가 코페르니쿠스의 행성 운동 이론을 알게 되었고 코페르니쿠스는 지구와 태양의 거리와 화성의 거리 등을 대략 계산해 두었다는 것이다. 착상이 제시된다. 케플러가 이 궤도들의 비율이 기하학에서 나오는 어떤 비율과 조금 비슷하다는 것을 알아챘다는 것이다. 그래서 제안이 나온다. 행성마다 구를 하나씩 잡고 당시 알려진 여섯 행성이 있으니 이 여섯 구 사이에 십이면체와 정육면체와 정사면체 같은 다섯 정다면체를 내접시킬 수 있고 완벽히 맞을 것이라 생각했으며 이것이 태양계의 모양을 다섯 정다면체로 설명한다는 것이다. 성격도 규정된다. 이것이 그의 아름다운 기하학적 착상이었다는 것이다.

전환점이 제시된다. 튀코 브라헤의 정말 고품질 관측 데이터를 손에 넣고 나서야였는데 실제로 그것을 얻으려 싸워야 했고 어쩌면 훔쳤을 수도 있다는 것이다. 그리고 결과가 서술된다. 그 데이터에 이론을 맞추려 했으나 실제로 잘 맞지 않았고 튀코의 데이터가 제공하는 정밀도로는 이 구들을 맞출 수 없었다는 것이다. 진짜 발견이 그 과정에서 나왔다고 한다. 화성과 지구의 궤도가 원일 수 없고 다른 어떤 형태여야 한다는 것을 그 과정에서 발견했다는 것이다.

시간의 길이도 강조된다. 무엇을 할지 알아내는 데 여러 해를 썼고 그의 글에서 여러 다른 것을 시도한 것을 볼 수 있으며 원을 중심에서 벗어나게 만들려 했고 어느 지점에서 타원에 도달했으며 그러자 갑자기 모든 것이 맞았다는 것이다.

그런데 더 복잡한 층이 제시되는데 이 대목이 이 인터뷰의 핵심 논거다. 케플러 이전에 코페르니쿠스 이론에 대한 비판 하나가 코페르니쿠스 자신이 자기 측정이 당시 이용 가능한 최선의 예측보다 나쁘다고 인정했다는 것이었다는 것이다. 당시 최선이 무엇인지도 제시된다. 그리스인과 그다음 아랍인과 인도인이 발전시킨 지구중심 모델이 최선의 모델이었고 수많은 조정과 미세 조정이 있어서 모든 행성이 어디 있을지 아주 복잡한 방식으로 예측할 수 있는 아주 정밀한 모델이었다는 것이다. 그래서 결론이 나온다. 데이터와의 일치를 아는 것만이 반드시 유일한 지표는 아니라는 것이다. 그리고 시점이 명시된다. 케플러가 궤도가 원이 아니라 타원인 개정 모델을 찾은 뒤에야 태양중심 모델이 지구중심 모델보다 정확해졌다는 것이다.

교훈이 제시된다. 과학은 어떤 과학 문제를 풀었는지 아닌지에 대해 늘 즉각적인 피드백을 받을 수 없다는 것이다. 그리고 반사실이 제시된다. 케플러와 코페르니쿠스에게 AI가 있어서 우주의 모델을 예측하라고 요청했다면, 올바른 태양중심 모델을 생성한 AI가 초기에 예측이 지구중심 것만큼 좋지 않다는 이유로 버려질 수 있었다는 것이다. 필요한 것도 제시된다. 이 모든 이론을 정말로 소화하고 행성과 운동과 중력에 대해 우리가 아는 다른 모든 것과 어떻게 맞물리는지 보는 데 시간이 걸린다는 것이다.

그리고 우려가 하나 더 제시된다. AI가 너무 빠르다는 것이다. 위험도 명시된다. 이 AI들이 과적합이라 불리는 것을 해서, 실제로 무슨 일이 일어나는지와는 아무 상관 없지만 데이터에는 극도로 잘 맞는 아주 복잡한 모델을 만들 위험이 있으며 그 데이터셋을 넘어 외삽하지 못한다는 것이다.

통합의 어려움도 정리된다. 개별 단계는 확실히 가속할 수 있어서 실험을 더 빠르게 하고 코드를 더 빠르게 쓰고 논문을 더 빠르게 쓸 수 있다는 것이다. 그런데 전체는 다르다고 한다. 모든 구성 요소가 빨라진다고 해서 과학 자체가 반드시 가속되지는 않을 수 있다는 것이다. 그래서 위험이 반복된다. AI를 과학에 겨눌 때 잘못된 것을 최적화해서 서류상으로는 놀라운 성공을 다 얻지만 과학이 실제로는 예전 방식으로 진보하지 않는다는 것을 알게 될 위험이 있다는 것이다. 그럼에도 결론은 도구 쪽이다. 이 도구를 갖는 것이 갖지 않는 것보다 여전히 낫다는 것을 알게 될 것이며 다만 가장 효율적으로 쓰는 법을 여전히 배우는 중이라는 것이다.

증명 소화불량

증명의 생애주기가 제시된다. 먼저 해답을 위한 증명을 생성해야 하고 이것이 예전에는 꽤 어려웠다는 것이다. 다음 단계도 제시된다. 생성한 증명 일부는 틀리므로 검증해서 어느 것이 맞는지 확인해야 하며 그것도 예전에는 꽤 지루했다는 것이다. 그런데 변화가 제시된다. 이 두 과업이 점점 더 자동화되고 있다는 것이다. 그래서 결과가 나온다. 여러 문제에 대한 제안된 해답을 점점 많이 보게 되며 그중 많은 것이 실제로 맞다는 것이다.

그런데 부작용이 지목된다. 증명이 또한 길어지고 있으며 AI가 쓴 것은 읽기에 별로 즐겁지 않은 일이 잦다는 것이다. 구체적 양상이 제시된다. AI가 생성한 증명은 아주 사소한 것에 많은 시간을 쓰고 논문의 가장 흥미로운 부분에는 아주 적은 시간을 쓸 수 있다는 것이다. 원인도 추정된다. AI가 무엇이 어렵고 무엇이 힘든지 구분할 수 없기 때문이라 생각하는데, 무차별 대입으로는 모든 것이 그들에게 같은 시간이 걸리기 때문이라는 것이다. 인간과의 대비가 제시된다. 논문의 가장 어려운 단계에서 자연히 씨름해야 했던 인간은 그 단계에 자연히 많은 시간을 쓸 것이라는 것이다.

그다음 단계들도 열거된다. 논문과 증명을 잘 읽히고 다른 사람에게 설명될 수 있는 방식으로 써야 한다는 것이다. 그리고 다른 사람이 흥분해야 한다고 한다. 이것이 정말 흥미로워서 내 문제를 푸는 데 도움이 되겠다거나 이 현상이 왜 참인지 정말 명확히 해 준다고 받아들여져야 하며 여기서 전통적으로 동료 심사 과정이 있어 심사자가 결과에 흥분하면 논문이 받아들여진다는 것이다. 그런데 예외도 제시된다. 기술적으로 맞고 읽을 수 있고 괜찮지만 아무도 신경 쓰지 않는 질문에 답하는 논문이 있을 수 있다는 것이다.

마지막 단계도 제시된다. 완전히 다듬어져 교과서에 들어가 학생들에게 가르쳐져야 한다는 것이다. 그런데 첫 버전은 적합하지 않다고 한다. 증명의 첫 버전은 교과서에 쓰기에 적합하지 않은 일이 잦으며 아주 비효율적인 방식으로 되어 있고 단계 순서가 논리적이지 않다는 것이다. 그래서 소화 과정이 필요하다고 한다. 논문을 조직하고 편집해서 같은 방식으로 흐르게 하는 완전히 올바른 방법이 무엇인지 아주 열심히 생각하는 데 누군가 많은 시간을 써야 하는 소화 과정이 있으며 다큐멘터리나 영화를 편집하는 것과 조금 비슷하다는 것이다.

그래서 진단이 제시된다. AI 도구가 이 과정의 초기 단계는 가속하지만 후기 단계는 아니라는 것이다. 상태가 구체적이다. 이제 증명을 많이 생성하고 그중 여럿을 검증하지만 이해하고 최종 교과서 형태로 넣는 속도는 여전히 인간이 한다는 것이다.

그리고 이름이 붙는다. 이제 증명 소화불량이라 부를 만한 것을 겪고 있다는 것이다. 상태가 서술된다. 갑자기 이해되어야 하고 교과서로 들어가야 하는 대기 중인 해답이 아주 많은데 그저 너무 많은 것에 잠겨 있고 골라야 하고 분류해야 하며 이것은 전에 일어난 적이 없는 일이라는 것이다.

과거와의 대비가 선명하다. 예전에는 해답이 아주 드물게 나와서 주요 문제의 해답이 나오면 모든 전문가가 모든 것을 내려놓고 그것을 읽고 가능한 한 빨리 소화하려 했으며 아주 드물고 아주 값어치 있어서 그럴 값어치가 있었기 때문이라는 것이다. 그런데 지금은 다르다고 한다. 그저 이 모든 가능한 해답에 잠기고 있다는 것이다.

자기 사례도 공개된다. 자기도 자기 분야의 모든 최신 발전을 따라가려는 시도를 멈춰야 했으며 때로 너무 많은 일이 일어나서 이제 나타나는 모든 발전을 읽겠다고 약속할 수 없다는 것이다. 그리고 시점이 정리된다. 이것이 AI 이전에도 이미 문제가 되기 시작했지만 AI가 생성되는 내용의 순수한 분량을 정말로 가속했다는 것이다. 그래서 필요가 제시된다. 훨씬 나은 큐레이션과 필터링이 필요할 것이라는 것이다. 그럼에도 성격은 좋은 문제라고 한다. 먹을 수 있는 것보다 음식이 너무 많은 것이 먹을 음식이 부족한 것보다 낫지만 여전히 문제라는 것이다.

4년의 진보와 검증되지 않은 것들

능력의 진보가 연도로 정리된다. 지난 3년간 발전을 따라온 사람에게는 일종의 꾸준한 진행이 있었다는 것이다. 단계가 열거된다. 4년 전에는 중학교 수학 문제를 풀 수 있었고 그다음 고등학교 문제, 그다음 고교 올림피아드 수준 문제, 그다음 대학원생 자격시험 수준 문제였다는 것이다. 그리고 다음 단계가 제시된다. 폴 에르되시 같은 사람이 제안했지만 아무도 정말 보지 않았을 사소한 미해결 문제 몇 개를 풀기 시작했으며 낮게 달린 과일이 많았다는 것이다.

그런데 최근이 다르다고 한다. 바로 최근에 사람들이 실제로 아주 열심히 풀려 했던 문제 몇 개를 푼 경우가 한둘 있었다는 것이다. 기제도 제시된다. 어쩐지 집단적으로 인간들이 모두 잘못된 길로 갔고 다른 편견 집합을 가진 AI가 꽤 영리한 해답을 엮어 냈으며 이미 어느 정도 영향을 미쳤다는 것이다. 파급도 제시된다. 예컨대 단위 거리 문제 근처의 어떤 문제들도 AI의 기법을 적용한 인간들에 의해 풀렸다는 것이다. 그리고 감상이 붙는다. 그것이 꽤 흥분되었다는 것이다.

동료들의 반응도 서술된다. 어떤 동료들에게는 아주 우려스러웠는데 특히 이전 발전을 따라오지 않아서 여기까지 왔다는 것을 깨닫지 못했다면 그렇다는 것이다. 대비도 제시된다. 어떤 동료가 2023년 챗봇이 할 수 있던 것만 봤다면 어려운 수학 문제를 물으면 완전히 쓰레기를 줬을 것이며 지금은 꽤 다르다는 것이다. 그리고 성격이 규정된다. 여전히 근본적으로 같은 기술이지만 오류율을 줄이고 진정으로 유용해지는 방법을 찾았다는 것이다.

그런데 검증되지 않은 것이 정직하게 열거된다. 이것이 얼마나 재현 가능한지는 여전히 불분명하다는 것이다. 이유도 제시된다. 이 성취 다수가 사기업이 한 것이고 쓴 자원을 공개하지 않는다는 것이다. 질문이 구체적이다. 컴퓨터 비용이 10만 달러였는지 100만 달러였는지 정말 모른다는 것이다. 그리고 성공률도 모른다고 한다. 푼 그 문제가 본 유일한 문제였는지, 10개를 봤는지 100개를 봤는지 모른다는 것이다. 그래서 판정이 유보된다. 결과가 인상적이지만 이것이 완전히 정기적인 일이 될지, 아니면 10만 달러를 여러 달에 걸쳐 10명 팀과 써야만 이런 결과를 얻는지 정말 판단할 데이터가 충분하지 않으며 어쩌면 우리가 신경 쓰는 문제의 1퍼센트만 이 방법에 순응할 수 있는지 모른다는 것이다.

그럼에도 노력이 있다고 한다. 더 적절히 과학적인 방식으로 벤치마크하려는 노력이 있다는 것이다. 최신 것도 제시된다. 퍼스트 프루프 챌린지라 불리며 최신 모델들을 연구 수준 질문 10개의 테스트 세트에 시험했다는 것이다. 결과도 제시된다. 최고 모델들이 이 중간 난이도 수학 문제 10개 중 다섯이나 여섯 정도를 할 수 있었으며 이미 해답이 있었지만 해답이 비밀로 유지된 것이었다는 것이다.

일상 연구에 대한 판단도 제시된다. 연구에서 매일 하는 일상적 과업이 많고 그중 어떤 비율은 이제 AI가 할 수 있다는 것이다. 비용도 제시된다. 비쌀 수 있으며 이 도구 다수가 해답을 얻기 전에 수백 달러가 필요하고 때로는 실패해서 이 모든 컴퓨트를 쓰고 유용한 것 없이 끝난다는 것이다.

프로그래밍의 사례도 제시된다. 많은 전문 프로그래머가 코드를 쓰는 능력이 이 도구로 5배나 10배나 100배 늘었다고 보고한다는 것이다. 그런데 대가도 보고된다고 한다. 손으로 코딩하는 능력을 잃어 가는 것을 스스로 느낄 수 있고 때로는 에이전트에서 나온 코드를 검토할 수 없다는 것이다. 그래서 원칙이 나온다. 절충이 있으며 속도가 전부는 아니라는 것이다.

협력의 리듬과 종자 옥수수

협력의 가치가 개인적으로 서술된다. 수학의 협력적 측면을 아주 좋아하며 그것이 그렇게 중요한지 커리어의 상대적으로 늦은 시점까지 깨닫지 못했다는 것이다. 경로도 제시된다. 자기가 배운 수학의 많은 부분을 대학원 이후에 여러 분야의 수학자와 과학자와 함께 일하며 배웠고 자기가 아는 것을 가르치고 그들이 아는 것을 배워 결과적으로 훨씬 넓어졌다는 것이다.

오래된 협력의 상태가 서술된다. 오래 함께 일한 협력자와 있으면 거의 정신적으로 조율되는 지점이 있다는 것이다. 비유도 제시된다. 오래 대화한 정말 가까운 친구나 가족이라면 때로 서로의 문장을 완성할 수 있고 상대가 무슨 말을 할지 안다는 것이다. 협력에서의 모습도 제시된다. 아이디어를 던지면 문장을 끝내기도 전에 상대가 알아채고 그것으로 달려 나갈 수 있다는 것이다.

AI와의 대비가 열거된다. 사람들이 AI를 이렇게 쓰려 했지만 대화할 수 없으며 물론 때로 실수하고 때로는 아첨해서 듣고 싶은 것만 말한다는 것이다. 그리고 물리적 문제도 제시된다. 지금 이 도구와의 상호작용은 다소 개인적이어서 사람들과 직접 만나 협력하면서 AI도 함께 두려 해 봤지만 리듬을 깨뜨린다는 것이다. 상태가 규정된다. 이 도구들은 인간 협력자와 그런 만큼 유동적인 대화가 되지 않는다는 것이다. 다만 유보가 붙는다. 어쩌면 거기 도달할 것이라는 것이다.

학습의 부재도 지목된다. 최근까지 그들은 대화에서 배우지 않으므로, 협력자와는 다음 날 아주 빠르게 이어 갈 수 있고 때로는 여러 해 만나지 않은 통화에서도 아주 오래된 실을 집어들 수 있다는 것이다. AI의 대응도 제시된다. AI는 일정한 문맥을 갖고 어떤 것을 기억할 수 있고 기록해 메모를 만들어 이 기억을 시뮬레이션할 수 있지만 정말 가까운 협력에서와 같은 방식으로 조율할 수는 없다는 것이다.

자기 사용법도 공개된다. 실제 문제 해결 과정에는 이 도구를 그리 많이 쓰지 않는다는 것이다. 대신 쓰는 곳이 열거된다. 지금까지는 문헌 검색이나 증명 확인, 코드 작성, 자기가 쓴 것을 교정해서 조금 더 조여질 기회가 있는지 보는 이차적 과업에 훨씬 낫다고 느꼈다는 것이다. 이유가 다시 제시된다. AI와 일하는 리듬이 인간 협력자와 일하며 선호하는 리듬이 아니지만 그것이 현재 기술의 현 상태일 수 있다는 것이다.

마지막으로 자금 구조의 위험이 제시된다. 과학 사업 전반의 자금 구조 면에서 다소 위험한 지점에 있다는 것이다. 양면이 제시된다. 한편으로 이 도구들이 과학의 산출물, 또는 과학의 산출물처럼 보이는 것을 훨씬 가속된 속도로 만들게 한다는 것이다. 그런데 대가가 지목되는데 이 표현이 핵심이다. 다음 세대 과학자를 위한 종자 옥수수를 기르는 것을 희생하는 대가로 올 수 있다는 것이다.

구체적 우려가 제시된다. 대학원생에게 첫 프로젝트로 주어 약간의 인정과 커리어 훈련과 경험을 얻게 하는 훈련 문제들이 있으며 이것들이 이제 AI가 논문을 다수 재현할 수 있는 유형의 문제라는 것이다. 그리고 귀결이 제시된다. 대학원생을 이 AI로 대체하면 AI가 이 대학원생 수준 논문을 생성하겠지만 다음 세대 학생을 얻지 못하게 된다는 것이다.

더 큰 위험도 제시된다. 이 모든 AI 출력을 소화해서 다음 세대 인간과 AI가 그 위에 쌓을 다음 지식 기반을 만드는 과정을 계속하지 않으면, 과학 사회로서 정체될 수 있다는 것이다. 상태가 구체적이다. 현재 기술로 할 수 있는 모든 것을 최적화할 수는 있겠지만 정말 독창적인 새 아이디어를 더는 개발하지 못할 수 있다는 것이다.

그래서 요구가 제시된다. 기초 과학이 무엇이고 무엇에 유용하며 왜 여전히 호기심 주도 연구를 갖는 것이 중요한지에 대해 훨씬 열린 논의를 해야 한다는 것이다. 이유도 제시된다. 왜 여전히 인간 공동체가 때로는 느리게, 때로는 최신 모델 AI만큼 효율적이지 않은 방식으로 탐색해야 하는지, 그리고 그로써 얻는 통찰이 무엇인지라는 것이다.

대중과의 소통도 권고된다. 통찰을 더 많이 공유하고 일반 대중에게 더 많이 다가가야 한다고 생각한다는 것이다. 진단도 제시된다. 오늘 일반 대중은 과학의 보이는 산출물을 볼 수 있어서 휴대폰과 인터넷과 GPS를 갖고 있지만 많은 사람이 전체 과정과 수학과 과학의 기초적 이해가 실제로 주변 세계를 훨씬 덜 무섭고 훨씬 명확하게 만드는 방식을 보지 못한다는 것이다.

마지막 진단이 제시된다. 지금 많은 사람이 그저 불안 상태에서 살고 있으며 세계가 너무 복잡하다는 것이다. 그리고 놓친 것이 지목된다. 기술적 산출물 같은 딱딱한 것만큼 과학의 이런 부드러운 가치를 강조하지 않았다는 것이다. 결론이 제시된다. 과학은 사고에 일정한 명료함을 더하며 이것들은 값어치 있는 것이고 지원받아야 한다는 것이다.

더 생각해보기

  • 헬리콥터로 목적지에 가는 것과 걸어서 가는 것 사이에 중간 형태가 있다면 무엇인가.
  • 깊이와 넓이의 상보성은 연구 자금 배분에서 어떻게 반영되어야 하는가.
  • 1,000개 중 50개가 풀린다면 그 50개를 고르는 기준은 누가 정하는가.
  • 케플러의 사례는 초기 성능이 낮은 접근을 얼마나 오래 살려 둬야 한다고 말하는가.
  • 과적합 위험은 수학처럼 검증 가능한 분야에서도 같은 방식으로 작동하는가.
  • 증명 소화불량에서 무엇을 먼저 소화할지 분류하는 기준은 어떻게 만들어야 하는가.
  • AI가 쓴 증명이 사소한 것에 시간을 쓴다면 난이도를 표시하게 훈련할 수 있는가.
  • 사기업이 자원과 성공률을 공개하지 않는다면 재현성 판단은 무엇으로 대체되는가.
  • 대학원생의 훈련 문제를 AI가 대체한다면 훈련의 대안 경로는 어디에 있는가.
  • 과학의 부드러운 가치를 대중에게 전달하는 일은 누구의 책임으로 배분되어야 하는가.
원문 출처는 본문의 Source에서 확인할 수 있습니다.