OpenAI 아스트라, 수학 능력이 단숨에 10배 향상되었습니다...

BBetter Stack
컴퓨터/소프트웨어경제 뉴스

스크립트

00:00:00오픈에이아이의 차세대 주요 모델인 아스트라가 수학 및 컴퓨터 과학 분야의 10대 난제를 해결했습니다
00:00:05결과가 정말 인상적이라는 평이 많으며, 심지어 박사급 지능을 뛰어넘었다고 말하는 사람도 있습니다
00:00:10이들은 누구나 읽을 수 있도록 전체 내용을 온라인에 공개했습니다
00:00:14249페이지 분량의 논문에는 모델의 자체 추론 과정이 62페이지에 걸쳐 담겨 있는데, 이것이 우리
00:00:20소프트웨어 엔지니어들에게는 어떤 의미일까요? 지금까지 알려진 바에 따르면 아스트라는
00:00:24며칠 또는 몇 시간 동안 단 하나의 문제에 매달리도록 설계되었기 때문입니다. 그러니 모든 걸 러스트로 재작성하고 싶으시다면—
00:00:30특히 분을 지칭하는 건 아닙니다만—이 모델이 바로 여러분에게 필요한 것일지도 모릅니다. 이번 영상에서는 오픈에이아이가 실제로
00:00:35어떤 주장을 했고 여러분이 이를 어떻게 직접 확인할 수 있는지, 그리고 이런 모델이 길을 잃지 않고
00:00:41며칠 동안 문제를 해결해 나갈 수 있는지 살펴보겠습니다. 먼저 오픈에이아이가 실제로 주장한 내용은 무엇일까요? 주말에 게시물이 올라왔는데
00:00:51제목은 “수학 및 이론 컴퓨터 과학에서의 10가지 진전”이었습니다. 이 결과들은 전부
00:00:58차세대 주요 모델인 아스트라의 내부 버전을 통해 달성되었으며, 해결된 10가지 문제를 모두 나열했습니다
00:01:03다 이해하는 척할 생각은 없지만, 단순히 주장만 한 것은 아닙니다
00:01:07모든 결과는 컴퓨터가 줄 단위로 검증하는 증명 언어인 '린(Lean)'이라는 형식으로 작성되었습니다
00:01:13따라서 오픈에이아이를 맹신할 필요도 없고 수학을 완벽히 이해할 필요도 없습니다. 왜냐하면
00:01:18코드가 컴파일된다는 것 자체가 증명이 성립한다는 뜻이기 때문입니다. 또한 각 결과에 도달하게 된
00:01:24모델 자체의 설명도 함께 공개했으니, 62페이지짜리 PDF를 읽고 싶다면 확인해 보시기 바랍니다
00:01:30이렇게 조심하는 데는 그럴만한 이유가 있습니다. 작년 10월에 정확히 이와 비슷한 일로 덴통을 입었기 때문인데요. 오픈에이아이의 케빈 웨일이
00:01:35GPT-5가 이전에 풀리지 않았던 10개의 에르되시 문제에 대한 해답을 찾았다는 게시물을 올렸으나
00:01:43알고 보니 GPT-5는 이미 인간이 해결해 둔 논문들을 찾아냈던 것뿐이었습니다. 그래서 이번에는
00:01:48훨씬 더 신중을 기하고 있으며, 여러분이 직접 결과를 검증할 수 있도록 했습니다
00:01:52우리가 코드 다루는 방식과 똑같습니다. 누가 그렇다고 해서 함수가 잘 작동할 거라고 맹신하지 않죠
00:01:57물론 전부 그렇지는 않겠지만요. 테스트 코드를 작성하고 기계가 판단하게 하듯이, 린(Lean)도 같은 개념이며 컴파일러가
00:02:03증명을 받아들이거나 거부하거나 둘 중 하나인 것입니다. 아울러 이 문제를 해결하는 데 필요한
00:02:08총 토큰 비용이 솔(Sol) API 기준으로 대략 2,000달러 정도 소요될 것이라고 언급했는데, 제 생각에는
00:02:14충격적일 정도로 저렴한 금액입니다. 이 추세대로라면 지능이 그저
00:02:18저렴한 상품으로 전락하지 않는 게 이상할 정도입니다. 다만 이 금액은 실제로 성공한 실행 비용만 다룰 뿐
00:02:24그전에 얼마나 많은 시도가 있었는지, 한 번에 성공했는지 수천 번 만에 성공했는지는 알 수 없습니다. 게다가 내부 모델이기 때문에
00:02:30오픈에이아이 외에는 누구도 돌아가서 확인할 수가 없습니다. 따라서 10가지 결과 자체는 사실이고 누구나 검증할 수 있지만
00:02:36실제 총비용은 아직 불확실합니다. AI 소식을 계속 받아보고 싶다면
00:02:42베터스택(Better Stack)을 구독해 주세요. 그렇다면 아스트라는 정확히 무엇일까요? 아마도 루나, 테라, 솔과 나란히 배치될 새로운 모델 가문이겠지만
00:02:49지향하는 바가 다릅니다. 기존 모델들은 일상적인 소프트웨어 엔지니어링을 처리할 수 있으며, 아스트라는
00:02:54장기 호라이즌 작업을 위해 설계되었습니다. 이러한 소문은 오픈에이아이가 이전에 밝혔던 입장과도 일치하는데,
00:03:00작년에 회사의 자체 팟캐스트에 출연한 수석 과학자 야쿠프 파추키는
00:03:06몇 시간이나 며칠 동안 문제에 매달릴 수 있는 시스템을 원한다고 언급했습니다. 현재 모델들은 단기 작업에만 능숙하므로
00:03:11바로 이 점을 바꾸고자 하는 것입니다. 즉, 이 모델은 인간에게는 완전히 비현실적인 연구를 잠재적으로 수행할 수 있으며,
00:03:16방대한 양의 데이터를 종합하고 며칠 동안 문제를 깊이 파고들 수 있습니다
00:03:21하지만 장기 실행에서 무너지는 것은 언제나 지능만이 아닙니다. 대개는 일관성이 무너집니다
00:03:27여러분도 직접 겪어보셨을 겁니다. 명확한 계획을 가지고 세션을 시작하지만 40분이 지나면 컨텍스트가 가득 차고
00:03:33초기 결정 사항들은 뒤로 밀려나 버립니다. 그러면 모델은 20분 전에 저질렀던 실수를
00:03:37태연하게 다시 반복하게 되죠. 이것이 바로 미해결 수학 문제가 훌륭한 테스트인 이유입니다
00:03:43무작정 들이받을 수도 없고 속일 수도 없습니다. 전체 논리가 완벽하게 들어맞기 전까지는 부분 점수나 피드백이 전혀 없기 때문입니다
00:03:48따라서 시스템이 흐트러지지 않고 몇 시간 동안 그 문제에 집중할 수 있다면, 여러분의 리팩터링 작업에도
00:03:54적용할 수 있을 것입니다. 하지만 제가 정말 흥미롭게 느끼는 부분은 따로 있습니다. 여기서 얻어지는 이득의 상당 부분이
00:03:59모델 자체라기보다는 모델을 둘러싼 하니스(harness)와 도구들로부터 오기 때문입니다
00:04:04알려진 아키텍처에 따르면, 루트 에이전트가 하위 에이전트들을 생성하여 각각에게 문제의 일부를 할당하고
00:04:09결과를 기다린 뒤 이를 종합해 최종 답변을 도출한다고 합니다
00:04:15물론 이러한 에이전트들을 조율하는 데는 상당한 복잡성이 따릅니다. 단순히 문제를 던지고 결과를 기다리는 것과는 다릅니다
00:04:21이미 이와 유사한 아키텍처가 출시된 바 있습니다. 솔 울트라(Sol Ultra)가 정확히 그 방식을 사용하기 때문인데요
00:04:26솔 울트라에서는 하위 에이전트들이 완전히 고립된 상태로 있지 않고 작업을 수행할 때 서로 소통할 수 있습니다
00:04:32하지만 문제를 쪼개는 것이 마냥 공짜는 아닙니다. 하위 에이전트에 작업을 넘길 때마다 조율 비용이 발생합니다
00:04:37여러 에이전트를 설정하는 방식은 계획 수립처럼 단단히 결합된 작업에서는 오히려 역효과가 날 수 있습니다
00:04:43오버헤드와 누적되는 오류가 작업을 쪼개서 얻었던 이득을 전부 상쇄해 버리기 때문입니다
00:04:49전체 설계는 문제를 쪼갰다가 다시 조합하는 과정이 조율 비용보다 더 큰 결과물을 가져다준다는 사실에 의존합니다
00:04:54이번 10개의 문제에서는 그 결과가 확실히 빛을 발했지만, 내부 결과만 마냥 믿을 수는 없으므로
00:04:59직접 손에 쥐고 확인해 볼 수 있을 때까지 결과를 지켜봐야 할 것입니다
00:05:04물론 이번 일로 수학자들이 대체된다는 이야기가 많이 나오고 있습니다. 토마스 블룸은 이에 대해 반박하며
00:05:09다음과 같이 말했습니다. 수학자가 만든 하나의 추측을 증명하는 것을 두고
00:05:14수 세기에 걸쳐 수학자들이 일군 이론과, 수학자들이 만들고 모든 수학자의 저작을 읽으며 훈련된 AI를 사용했다고 해서
00:05:21그것이 수학자를 대체한다고 부르는 것은 옳지 않다고요
00:05:26따라서 대체론은 제게는 설득력이 없어 보입니다. 비록 결과가 유망해 보일지라도 말이죠
00:05:32하지만 마침내 아스트라를 직접 만져보고 소프트웨어 엔지니어링 작업에 얼마나 실용적인지
00:05:37직접 테스트해 볼 날이 정말 기대됩니다
00:05:43다들 이번 영상 재미있게 보셨기를 바라며, 최신 테크 및 AI 소식을 계속 받아보고 싶다면
00:05:47베터스택을 구독해 주세요. 시청해 주셔서 정말 감사드리고 다음 영상에서 뵙겠습니다

핵심 요약

오픈에이아이의 차세대 모델 아스트라는 몇 시간에서 며칠 동안 한 문제에 집중하는 장기 호라이즌 설계와 하위 에이전트 조율을 통해 수학 및 이론 컴퓨터 과학 분야의 10대 난제를 해결했다.

하이라이트

  • 오픈에이아이의 차세대 모델 아스트라는 수학 및 컴퓨터 과학 분야의 10대 난제를 해결했다.

  • 모든 결과는 컴퓨터가 검증하는 증명 언어인 린(Lean) 형식으로 작성되어 컴파일을 통해 검증된다.

  • 아스트라는 며칠 또는 몇 시간 동안 단 하나의 문제에 매달려 장기 호라이즌 작업을 수행하도록 설계되었다.

  • 10가지 문제를 해결하는 데 소요된 총 토큰 비용은 솔 API 기준 약 2,000달러이다.

  • 아키텍처는 루트 에이전트가 하위 에이전트를 생성하여 문제를 할당하고 결과를 종합하는 방식을 사용한다.

타임라인

아스트라의 수학 난제 해결과 검증 방식

  • 아스트라는 수학 및 이론 컴퓨터 과학 분야의 10대 난제를 해결했다.
  • 모든 결과는 컴퓨터가 줄 단위로 검증하는 린(Lean) 형식으로 작성되었다.
  • 이전 모델의 오류 경험을 바탕으로 누구나 직접 검증할 수 있도록 249페이지 분량의 논문을 공개했다.

오픈에이아이는 차세대 모델 아스트라의 내부 버전을 통해 10가지 난제를 해결했다고 발표했다. 주장이 아닌 객관적 검증을 위해 컴퓨터가 컴파일 여부로 증명을 확인하는 린(Lean) 언어를 사용했다. 과거 GPT-5의 에르되시 문제 해답 논란을 의식하여 이번에는 철저한 검증 과정을 거쳤다.

장기 호라이즌 작업과 아스트라의 아키텍처

  • 아스트라는 몇 시간 또는 며칠 동안 단 하나의 문제에 매달릴 수 있도록 설계되었다.
  • 해당 작업의 총 토큰 비용은 솔 API 기준 약 2,000달러가 소요되었다.
  • 루트 에이전트가 하위 에이전트들을 생성하여 문제를 쪼개고 조율하는 아키텍처를 사용한다.

기존 모델은 단기 작업에 치중되어 시간이 지나면 일관성이 무너지는 한계가 있었다. 아스트라는 장기 호라이즌 작업을 통해 미해결 수학 문제처럼 엄격한 논리가 필요한 분야에 적용된다. 하위 에이전트들의 조율 비용과 오버헤드 문제가 존재하지만, 이번 난제 해결을 통해 그 실효성이 입증되었다.

커뮤니티 글

모든 글 보기