스크립트
00:00:00오픈에이아이의 차세대 주요 모델인 아스트라가 수학 및 컴퓨터 과학 분야의 10대 난제를 해결했습니다
00:00:05결과가 정말 인상적이라는 평이 많으며, 심지어 박사급 지능을 뛰어넘었다고 말하는 사람도 있습니다
00:00:10이들은 누구나 읽을 수 있도록 전체 내용을 온라인에 공개했습니다
00:00:14249페이지 분량의 논문에는 모델의 자체 추론 과정이 62페이지에 걸쳐 담겨 있는데, 이것이 우리
00:00:20소프트웨어 엔지니어들에게는 어떤 의미일까요? 지금까지 알려진 바에 따르면 아스트라는
00:00:24며칠 또는 몇 시간 동안 단 하나의 문제에 매달리도록 설계되었기 때문입니다. 그러니 모든 걸 러스트로 재작성하고 싶으시다면—
00:00:30특히 분을 지칭하는 건 아닙니다만—이 모델이 바로 여러분에게 필요한 것일지도 모릅니다. 이번 영상에서는 오픈에이아이가 실제로
00:00:35어떤 주장을 했고 여러분이 이를 어떻게 직접 확인할 수 있는지, 그리고 이런 모델이 길을 잃지 않고
00:00:41며칠 동안 문제를 해결해 나갈 수 있는지 살펴보겠습니다. 먼저 오픈에이아이가 실제로 주장한 내용은 무엇일까요? 주말에 게시물이 올라왔는데
00:00:51제목은 “수학 및 이론 컴퓨터 과학에서의 10가지 진전”이었습니다. 이 결과들은 전부
00:00:58차세대 주요 모델인 아스트라의 내부 버전을 통해 달성되었으며, 해결된 10가지 문제를 모두 나열했습니다
00:01:03다 이해하는 척할 생각은 없지만, 단순히 주장만 한 것은 아닙니다
00:01:07모든 결과는 컴퓨터가 줄 단위로 검증하는 증명 언어인 '린(Lean)'이라는 형식으로 작성되었습니다
00:01:13따라서 오픈에이아이를 맹신할 필요도 없고 수학을 완벽히 이해할 필요도 없습니다. 왜냐하면
00:01:18코드가 컴파일된다는 것 자체가 증명이 성립한다는 뜻이기 때문입니다. 또한 각 결과에 도달하게 된
00:01:24모델 자체의 설명도 함께 공개했으니, 62페이지짜리 PDF를 읽고 싶다면 확인해 보시기 바랍니다
00:01:30이렇게 조심하는 데는 그럴만한 이유가 있습니다. 작년 10월에 정확히 이와 비슷한 일로 덴통을 입었기 때문인데요. 오픈에이아이의 케빈 웨일이
00:01:35GPT-5가 이전에 풀리지 않았던 10개의 에르되시 문제에 대한 해답을 찾았다는 게시물을 올렸으나
00:01:43알고 보니 GPT-5는 이미 인간이 해결해 둔 논문들을 찾아냈던 것뿐이었습니다. 그래서 이번에는
00:01:48훨씬 더 신중을 기하고 있으며, 여러분이 직접 결과를 검증할 수 있도록 했습니다
00:01:52우리가 코드 다루는 방식과 똑같습니다. 누가 그렇다고 해서 함수가 잘 작동할 거라고 맹신하지 않죠
00:01:57물론 전부 그렇지는 않겠지만요. 테스트 코드를 작성하고 기계가 판단하게 하듯이, 린(Lean)도 같은 개념이며 컴파일러가
00:02:03증명을 받아들이거나 거부하거나 둘 중 하나인 것입니다. 아울러 이 문제를 해결하는 데 필요한
00:02:08총 토큰 비용이 솔(Sol) API 기준으로 대략 2,000달러 정도 소요될 것이라고 언급했는데, 제 생각에는
00:02:14충격적일 정도로 저렴한 금액입니다. 이 추세대로라면 지능이 그저
00:02:18저렴한 상품으로 전락하지 않는 게 이상할 정도입니다. 다만 이 금액은 실제로 성공한 실행 비용만 다룰 뿐
00:02:24그전에 얼마나 많은 시도가 있었는지, 한 번에 성공했는지 수천 번 만에 성공했는지는 알 수 없습니다. 게다가 내부 모델이기 때문에
00:02:30오픈에이아이 외에는 누구도 돌아가서 확인할 수가 없습니다. 따라서 10가지 결과 자체는 사실이고 누구나 검증할 수 있지만
00:02:36실제 총비용은 아직 불확실합니다. AI 소식을 계속 받아보고 싶다면
00:02:42베터스택(Better Stack)을 구독해 주세요. 그렇다면 아스트라는 정확히 무엇일까요? 아마도 루나, 테라, 솔과 나란히 배치될 새로운 모델 가문이겠지만
00:02:49지향하는 바가 다릅니다. 기존 모델들은 일상적인 소프트웨어 엔지니어링을 처리할 수 있으며, 아스트라는
00:02:54장기 호라이즌 작업을 위해 설계되었습니다. 이러한 소문은 오픈에이아이가 이전에 밝혔던 입장과도 일치하는데,
00:03:00작년에 회사의 자체 팟캐스트에 출연한 수석 과학자 야쿠프 파추키는
00:03:06몇 시간이나 며칠 동안 문제에 매달릴 수 있는 시스템을 원한다고 언급했습니다. 현재 모델들은 단기 작업에만 능숙하므로
00:03:11바로 이 점을 바꾸고자 하는 것입니다. 즉, 이 모델은 인간에게는 완전히 비현실적인 연구를 잠재적으로 수행할 수 있으며,
00:03:16방대한 양의 데이터를 종합하고 며칠 동안 문제를 깊이 파고들 수 있습니다
00:03:21하지만 장기 실행에서 무너지는 것은 언제나 지능만이 아닙니다. 대개는 일관성이 무너집니다
00:03:27여러분도 직접 겪어보셨을 겁니다. 명확한 계획을 가지고 세션을 시작하지만 40분이 지나면 컨텍스트가 가득 차고
00:03:33초기 결정 사항들은 뒤로 밀려나 버립니다. 그러면 모델은 20분 전에 저질렀던 실수를
00:03:37태연하게 다시 반복하게 되죠. 이것이 바로 미해결 수학 문제가 훌륭한 테스트인 이유입니다
00:03:43무작정 들이받을 수도 없고 속일 수도 없습니다. 전체 논리가 완벽하게 들어맞기 전까지는 부분 점수나 피드백이 전혀 없기 때문입니다
00:03:48따라서 시스템이 흐트러지지 않고 몇 시간 동안 그 문제에 집중할 수 있다면, 여러분의 리팩터링 작업에도
00:03:54적용할 수 있을 것입니다. 하지만 제가 정말 흥미롭게 느끼는 부분은 따로 있습니다. 여기서 얻어지는 이득의 상당 부분이
00:03:59모델 자체라기보다는 모델을 둘러싼 하니스(harness)와 도구들로부터 오기 때문입니다
00:04:04알려진 아키텍처에 따르면, 루트 에이전트가 하위 에이전트들을 생성하여 각각에게 문제의 일부를 할당하고
00:04:09결과를 기다린 뒤 이를 종합해 최종 답변을 도출한다고 합니다
00:04:15물론 이러한 에이전트들을 조율하는 데는 상당한 복잡성이 따릅니다. 단순히 문제를 던지고 결과를 기다리는 것과는 다릅니다
00:04:21이미 이와 유사한 아키텍처가 출시된 바 있습니다. 솔 울트라(Sol Ultra)가 정확히 그 방식을 사용하기 때문인데요
00:04:26솔 울트라에서는 하위 에이전트들이 완전히 고립된 상태로 있지 않고 작업을 수행할 때 서로 소통할 수 있습니다
00:04:32하지만 문제를 쪼개는 것이 마냥 공짜는 아닙니다. 하위 에이전트에 작업을 넘길 때마다 조율 비용이 발생합니다
00:04:37여러 에이전트를 설정하는 방식은 계획 수립처럼 단단히 결합된 작업에서는 오히려 역효과가 날 수 있습니다
00:04:43오버헤드와 누적되는 오류가 작업을 쪼개서 얻었던 이득을 전부 상쇄해 버리기 때문입니다
00:04:49전체 설계는 문제를 쪼갰다가 다시 조합하는 과정이 조율 비용보다 더 큰 결과물을 가져다준다는 사실에 의존합니다
00:04:54이번 10개의 문제에서는 그 결과가 확실히 빛을 발했지만, 내부 결과만 마냥 믿을 수는 없으므로
00:04:59직접 손에 쥐고 확인해 볼 수 있을 때까지 결과를 지켜봐야 할 것입니다
00:05:04물론 이번 일로 수학자들이 대체된다는 이야기가 많이 나오고 있습니다. 토마스 블룸은 이에 대해 반박하며
00:05:09다음과 같이 말했습니다. 수학자가 만든 하나의 추측을 증명하는 것을 두고
00:05:14수 세기에 걸쳐 수학자들이 일군 이론과, 수학자들이 만들고 모든 수학자의 저작을 읽으며 훈련된 AI를 사용했다고 해서
00:05:21그것이 수학자를 대체한다고 부르는 것은 옳지 않다고요
00:05:26따라서 대체론은 제게는 설득력이 없어 보입니다. 비록 결과가 유망해 보일지라도 말이죠
00:05:32하지만 마침내 아스트라를 직접 만져보고 소프트웨어 엔지니어링 작업에 얼마나 실용적인지
00:05:37직접 테스트해 볼 날이 정말 기대됩니다
00:05:43다들 이번 영상 재미있게 보셨기를 바라며, 최신 테크 및 AI 소식을 계속 받아보고 싶다면
00:05:47베터스택을 구독해 주세요. 시청해 주셔서 정말 감사드리고 다음 영상에서 뵙겠습니다