스크립트
00:00:00GPT 5.6 Soul이 출시되었고, 현재 모두가 똑같은 질문을 던지고 있습니다.
00:00:04드디어 Claude를 이길 모델이 나왔을까요?
00:00:06저희는 소프트웨어 회사로서,
00:00:08지난 4일간 자체 제품에 Soul을 적용해 보았습니다.
00:00:11자체 구축한 커뮤니티 플랫폼을 포함해 여러 고객 프로젝트에도 사용해 봤죠.
00:00:16결론적으로 더 낫다거나 못하다는 건 아니었습니다.
00:00:18Soul은 Fable과는 행동 방식이 매우 달랐습니다.
00:00:21따라서 두 모델을 똑같은 방식으로 사용하면 둘 다 제대로 활용할 수 없습니다.
00:00:25Soul은 Fable이 여러 번 대화해야 끝낼 작업을 한 번에 끝내기도 했고,
00:00:29Fable이라면 멈췄을 상황에서도 계속 다음 동작을 수행하기도 했습니다.
00:00:32리뷰 과정에서 Fable은 검사를 거부했던 앱의 일부 영역에서 문제를 찾아내기도 했죠.
00:00:374일간의 테스트 끝에, Soul을 최적으로 사용하기 위한 7가지 규칙을 정리했습니다.
00:00:42이 영상이 끝날 때쯤이면 어떤 용도로 사용해야 할지,
00:00:44어디서 Fable을 앞서고 어디서 부족한지, 그리고 꺼두어야 할 설정 하나까지 알게 되실 겁니다.
00:00:49본격적으로 시작하기 전에,
00:00:51혹시 놓치셨을 분들을 위해 OpenAI의 최신 모델 출시 소식을 간단히 짚어보겠습니다.
00:00:54OpenAI는 GPT 5.6 모델들을 새로 출시했는데,
00:00:58이번에는 총 3가지 모델을 선보였습니다.
00:01:01가볍고 저렴한 모델인 Luna와 Terra,
00:01:04그리고 가장 뛰어난 성능을 자랑하는 Sol입니다.
00:01:06무엇이 새로워졌을까요?
00:01:07OpenAI의 핵심 전략은 '효율성'입니다.
00:01:10기본적으로 토큰당 더 많은 작업을 수행하고, 비용 대비 성능을 극대화하는 것이죠.
00:01:15OpenAI에 따르면,
00:01:17코딩과 장기 작업에서 Fable보다 더 적은 토큰을 사용하면서 절반 정도의 시간 만에 작업을 완료한다고 합니다.
00:01:22종합적인 지능 면에서는 Fable과 비슷한 수준이지만 비용은 더 낮다고 하는데요,
00:01:28이 부분은 나중에 더 자세히 살펴보겠습니다.
00:01:30기존의 별도 Codex 데스크톱 앱은 ChatGPT 앱으로 통합되었습니다.
00:01:34물론 터미널 버전인 Codex CLI를 통해 Sol을 계속 사용할 수도 있습니다.
00:01:38OpenAI는 또한 한 번에 여러 에이전트를 실행하는 Ultra라는 새로운 모드를 추가했습니다.
00:01:44이게 사용할 가치가 있는지 나중에 다시 알아보죠.
00:01:46현재 최상위 모델은 두 가지입니다.
00:01:48기존에 사용하시던 Fable, 그리고 이제 Sol이 있죠.
00:01:51남은 시간에는 Fable 대신 언제 Sol을 써야 할지 등 Sol을 최대한 활용하는 방법을 알려드리겠습니다.
00:01:57먼저 솔직한 부분부터 말씀드리겠습니다.
00:01:58Sol이 Fable보다 똑똑한 건 아닙니다.
00:02:00정해진 해결책이 없는 어려운 문제에서는 여전히 Fable이 더 나은 답을 제시합니다.
00:02:05차이는 의사결정이 내려지고 모델이 작업을 완수해야 할 때 나타납니다.
00:02:09무엇을 해야 할지 파악하는 능력은 Fable이 더 좋지만,
00:02:12Soul은 계속해서 다시 작업을 시킬 필요 없이 모든 단계를 꾸준히 이어나가는 능력이 뛰어납니다.
00:02:17이 차이가 사용 방식을 바꿔야 하는 이유입니다.
00:02:20첫 번째 규칙으로, Soul을 독자적으로 작업하게 하기 전에 경계를 설정해야 합니다.
00:02:24Fable은 위험해 보이는 동작을 하면 멈추거나 거부했기 때문에 크게 고민할 필요가 없었지만,
00:02:31Sol은 다릅니다.
00:02:32작업이 끝날 때까지 계속 행동을 취하죠.
00:02:35저희가 작업을 진행할 때 가장 확실한 사례를 경험했습니다.
00:02:39방해가 되는 파일이나 실행 중인 프로세스를 발견하자,
00:02:41저희에게 묻지도 않고 파일을 삭제하고 프로세스를 중단시켜 버렸습니다.
00:02:45Fable이라면 멈췄을 상황이지만, Sol은 방해물을 치우고 작업을 이어나갔습니다.
00:02:50Soul을 테스트하는 다른 사람들은 더 극단적인 경우를 겪기도 했고,
00:02:54누군가의 Mac에서 거의 모든 파일을 삭제해 버린 사례도 있었습니다.
00:02:59그러니 실행하기 전에 접근 가능한 범위를 제한해야 합니다.
00:03:02긴 작업을 시작하기 전에 Codex에게 별도의 Git 브랜치를 만들고 현재 작동하는 버전을 커밋하도록 하세요.
00:03:08브랜치가 Sol의 접근을 막지는 못하지만, 문제가 생겼을 때 변경 사항을 되돌릴 수 있는 안전한 지점이 됩니다.
00:03:14Codex 앱 설정에서 승인 정책을 'never'로, 샌드박스를 'workspace right'로 설정하세요.
00:03:21'never'는 기다림 없이 계속 작업하게 하고, 'workspace right'는 해당 프로젝트 파일만 건드리게 합니다.
00:03:28'full access'는 선택하지 마세요. 앱 외부 파일까지 접근할 수 있게 됩니다.
00:03:32경계를 설정하면, 이제 이런 행동 방식을 장점으로 활용할 수 있습니다.
00:03:36AI Labs Pro에서 한 기능을 완전히 구현하도록 Sol에게 맡겼을 때 그 장점을 보았습니다.
00:03:40Fable로는 여러 번 주고받아야 했을 작업을, Sol은 같은 목표를 끝까지 유지하며 스스로 완전히 끝내버렸습니다.
00:03:48속도도 Fable로 할 때보다 훨씬 빨랐습니다.
00:03:52여러 세션에 걸쳐 해야 할 작업이라면 Sol을 사용하세요.
00:03:56전체 기능 구현, 앱 전반에 대한 리뷰, 여러 영역을 건드리는 어떤 작업이든 좋습니다.
00:04:01이 차이가 명확하게 드러난 곳 중 하나가 리뷰였고, 이는 두 번째 규칙으로 이어집니다.
00:04:06먼저 스폰서 말씀 듣고 가겠습니다.
00:04:08Salad Cloud입니다.
00:04:09OpenAI 모델을 실행하려면 비용이 많이 드는 클라우드 GPU를 빌려야 하죠.
00:04:13Salad는 다릅니다.
00:04:142018년부터 전 세계의 유휴 소비자용 GPU 200만 대 이상을 활용한 분산형 GPU 클라우드를 운영해 왔습니다.
00:04:21가격은 대형 업체들의 일부 수준이고, 때로는 10배 이상 저렴하기도 합니다.
00:04:26개발자에게 가장 좋은 점은 'AI Gateway'입니다.
00:04:29OpenAI 호환 API이므로 Cursor나 Klein 같은 도구를 엔드포인트에 연결하고 Qwen 3.6 같은 오픈 모델을 실행하기만 하면 됩니다.
00:04:38서버도, 콜드 스타트도 필요 없습니다.
00:04:39제 Klein의 엔드포인트를 Salad의 Ranquen 3.6으로 바꿨는데, 똑같은 워크플로우로 저렴한 비용에 기능을 구현했습니다.
00:04:48기존 클라우드 제공업체와 비교하면 가격 차이는 정말 믿기 힘들 정도입니다.
00:04:53약정이나 계약도 없고, 필요할 때 즉시 확장할 수 있습니다.
00:04:57아래 링크로 가입하고 고객 지원팀에 메시지를 보내 10달러 무료 크레딧을 받아 직접 체험해 보세요.
00:05:02Sol은 Fable이 거부했던 작업을 리뷰하는 데도 더 뛰어납니다.
00:05:06물론 Opus 4.8로 가끔 경로가 변경되는 걸 말하는 건 아닙니다.
00:05:10그건 주로 추론을 설명하게 하거나 작업이 유해할 때 발생하는 일이죠.
00:05:15우리가 말하는 건 Fable에 내장된 안전 제한입니다.
00:05:18이런 리뷰에 Fable을 이미 사용해 봐서 어디서 멈추는지 알고 있었기 때문에 확신합니다.
00:05:24같은 작업을 Sol에게 시켰더니, 거기서 멈추지 않았습니다.
00:05:27Fable이 늘 검사를 거부하던 영역을 계속 리뷰했고, 그곳에서 문제들을 찾아냈습니다.
00:05:32하지만 이게 Sol이 리뷰를 더 잘하는 첫 번째 이유일 뿐입니다.
00:05:35다른 이유는 Sol이 완성된 앱을 직접 열어 테스트할 수 있다는 점이고, 이게 세 번째 규칙입니다.
00:05:40화면을 보거나 클릭해야 하는 작업이 있으면, Sol은 자동으로 'computer use' 기능을 사용합니다.
00:05:46새로운 ChatGPT 앱에서 Sol의 computer use는 여러 탭을 넘나들 수 있고,
00:05:51로그인된 웹사이트를 사용하고 파일을 다운로드할 수도 있습니다.
00:05:54즉, 프로젝트 내부 파일만 다루는 것이 아니라 여러분이 사용하는 것과 똑같은 화면을 이동할 수 있죠.
00:05:59저희 커뮤니티 플랫폼에서 이 기능이 어떻게 작동했는지 보세요.
00:06:01새로운 상점 기능을 구현하고 있었는데, 앱은 계정마다 작동 방식이 다릅니다.
00:06:06관리자, 일반 회원, 플랜에 따라 권한이 다르죠.
00:06:0920달러 플랜 사용자와 100달러 플랜 사용자가 할 수 있는 일이 다릅니다.
00:06:15따라서 한 번만 확인해서는 충분하지 않습니다.
00:06:17Sol은 그 모든 계정 유형에 대해 전체 과정을 직접 수행했습니다.
00:06:20각 유형으로 로그인하여 권한을 확인하고, 제품 구매 과정을 거치고,
00:06:26계정에 따라 달라지는 다른 앱 영역에서도 똑같은 검사를 반복했습니다.
00:06:31실제 사용자 관점에서 기능을 모두 테스트한 것입니다.
00:06:35사람마다 다르게 작동하는 기능이라면, 빌드가 끝난 후 새로운 Sol 대화에서 리뷰를 실행하세요.
00:06:41다양한 계정 유형을 알려주고 각각 어떤 일을 할 수 있어야 하는지 설명해 주세요.
00:06:45그런 다음 시작부터 끝까지 모든 과정을 완료하고 재현 가능한 문제만 보고하도록 시키세요.
00:06:51저희 상점의 경우, 계정별 로그인, 제품 구매, 그리고 사용자마다 맞는 버전의 기능을 보는지 확인하는 작업을 수행했습니다.
00:06:57이 커뮤니티 웹사이트에는 영상에서 다루는 모든 기술, 워크플로우, 리소스가 담겨 있습니다.
00:07:05저희 활동이 도움이 되셨고 채널을 후원하고 싶으시다면, 이 방법이 최고입니다.
00:07:09설명란에 링크가 있습니다.
00:07:10Computer use가 Sol의 결과 확인 방식을 바꾸지만, 작업을 요청하는 방식도 바꿔야 합니다.
00:07:17네 번째 규칙입니다.
00:07:18네 번째 규칙은 기존에 사용하던 프롬프트와 기술을 재구성하는 데 집중합니다.
00:07:23이는 Fable과 Sol 모두에 적용되는데, 최신 모델들은 스스로 기본 단계를 파악하는 능력이 더 뛰어나기 때문입니다.
00:07:29목표는 프롬프트를 최대한 짧게 만드는 게 아닙니다.
00:07:32결과에 영향을 주지 않는 지시는 삭제하고, 정말 중요한 지시를 더 정밀하게 다듬는 것입니다.
00:07:37OpenAI는 GPT 5.6 프롬프트 가이드에서 이를 설명합니다.
00:07:41결과물, 중요한 제한 사항, 완료 조건은 여전히 명시해야 합니다.
00:07:46하지만 폴더 이름이 이미 적절하다면 굳이 모든 폴더를 일일이 지정할 필요는 없으며,
00:07:50세 곳에 똑같은 규칙을 반복하거나 모델이 취해야 할 모든 단계를 일일이 설명할 필요도 없습니다.
00:07:55저희 애니메이션 시스템을 통해 어떻게 하는지 보여드리겠습니다.
00:07:58먼저 모델이 HTML에서 구현해야 할 실제 코드는 유지했습니다.
00:08:03애니메이션을 서술형으로 설명하는 대신, 모든 규칙에 따라 모델이 복사할 수 있는 작업 패턴을 제공했습니다.
00:08:09또한 정확한 배경, 표면, 강조 색상을 유지하여 실행할 때마다 모델이 새로운 색상을 선택하지 않도록 했습니다.
00:08:15더 중요한 건 무엇을 지울 수 있는지 찾는 것이었습니다.
00:08:18완성된 애니메이션을 항상 output 폴더에 저장하라고 명시했던 규칙이 있었죠.
00:08:23그 줄을 지우고 같은 작업을 실행했는데도 Sol은 여전히 그곳에 저장했습니다.
00:08:27완성된 파일이 어디로 가야 하는지 모델이 스스로 파악할 수 있었기에 해당 지시는 결과에 영향을 주지 않았던 것입니다.
00:08:33모델을 계속 번갈아 사용하기 때문에 일단 그 줄은 남겨두었지만,
00:08:36성능이 떨어지는 모델은 똑같은 패턴을 잡아내지 못할 수도 있으니 직접 테스트해 봐야 합니다.
00:08:42지시 하나를 지우고 다시 실행해 보고 결과가 달라지는지 확인하세요.
00:08:47모델이 여전히 제대로 수행한다면 그 지시는 없어도 되는 것입니다.
00:08:52OpenAI는 이런 정리가 성능은 10~15% 개선하면서 토큰은 41~66% 더 절약하게 해준다고 보고했습니다.
00:09:00프롬프트가 Sol의 목표를 결정한다면, 모드는 작업을 처리할 에이전트 수를 결정합니다. 다섯 번째 규칙입니다.
00:09:07영상이 재미있다면 구독하고 알림 버튼을 눌러주세요.
00:09:12작은 응원이 저희에게 큰 힘이 됩니다.
00:09:15당분간 Ultra 모드는 끄세요.
00:09:17Ultra는 Sol의 멀티 에이전트 모드입니다.
00:09:19에이전트 하나를 사용하는 대신 작업을 나눠 여러 개를 동시에 실행합니다.
00:09:24OpenAI는 가장 어려운 작업을 위한 모드라고 홍보하지만, 모든 에이전트가 토큰을 소비하기 때문에,
00:09:29Ultra는 일반 Sol보다 훨씬 빠르게 사용량을 소진합니다.
00:09:33일반 Sol로 하던 작업을 Ultra로 실행해 봤을 때,
00:09:38결과물의 유의미한 개선은 없었습니다.
00:09:41여러 에이전트가 실행되느라 사용량은 늘었지만 품질은 그대로였습니다.
00:09:46OpenAI 자체 결과도 테스트에 따라 점수가 2~3점 정도만 개선되는 등 작은 차이만 보여줍니다.
00:09:54일반 Sol을 기본으로 사용한다면, 다음 질문은 Terra나 Luna로 작은 작업을 보내 사용량을 아껴야 할지입니다.
00:10:01Codex로 앱을 만든다면 작은 작업을 Terra나 Luna로 바꾸지 말고 Sol을 기본으로 유지하세요.
00:10:08API를 통해 사용할 때는 Terra와 Luna가 더 저렴하며, 이는 제품이 모델로 보내는 모든 요청에 비용이 들 때 중요합니다.
00:10:15하지만 구독 방식으로 Codex를 사용한다면 상황이 다릅니다. 플랜 내 사용량 안에서 작업하기 때문이죠.
00:10:21가벼운 작업을 작은 모델들로 돌려본 후 깨달은 사실입니다.
00:10:25작업은 완료했지만 품질 저하로 인해 Sol을 쓸 때보다 수정하는 데 시간을 더 뺏겼습니다.
00:10:31그래서 도중에 모델을 바꾸지 않고 전체 작업을 다시 Sol로 돌아왔습니다.
00:10:36자, 마지막 질문입니다. 언제 Sol을 쓰고 언제 Fable로 돌아가야 할까요?
00:10:40두 모델을 매일 사용해 본 입장에서 가장 명확한 구분법은 이것입니다.
00:10:45Fable은 코딩 모델의 미래를 보여주는 프리뷰이고, Sol은 현재의 기술이 도달한 가장 완벽한 버전입니다.
00:10:51그리고 벤치마크 점수보다 속도 차이가 워크플로우에 더 큰 영향을 줍니다.
00:10:55매일 사용해 보면 Fable, Opus, Sonnet은 모두 같은 작업을 끝내는 데 더 오래 걸립니다.
00:11:00반면에 Codex 모델들은 훨씬 빠릅니다. 심지어 사용량을 1.5배 사용하는 'Fast 모드'를 켜지 않고도 말이죠.
00:11:08저희 생각에 이것이 가장 중요한 선택 기준이며, Claude보다 Codex 모델에 더 손이 가는 이유입니다.
00:11:16앱이 어떻게 작동해야 할지, 기능을 어떻게 구성할지, 왜 어려운 문제가 반복되는지 결정해야 할 때는 빌드 전에 Fable을 사용하세요.
00:11:24결정이 내려지면 Sol에게 구현을 맡기세요. 전체 기능 구현, 장기 작업, 리뷰, 화면 확인이 필요한 모든 것은 그때 사용하세요.
00:11:324일간 사용해 본 결과, 무엇을 만들어야 할지 알 때는 Sol이 기본값이 되었고, 더 많은 판단이 필요한 결정은 여전히 Fable이 맡고 있습니다.
00:11:41중요한 건 경계를 설정하고, 각 모델에 맞는 일을 주고, 배포 전 결과를 리뷰하는 것입니다.
00:11:47영상 마무리하겠습니다. 채널을 후원하고 이런 영상을 계속 만드는 데 도움을 주고 싶다면 아래 'Super Thanks' 버튼을 눌러주세요.
00:11:56늘 시청해 주셔서 감사합니다. 다음 영상에서 뵙겠습니다.