GPT 5.6을 상위 10%처럼 능숙하게 사용하는 7가지 규칙

AAI LABS
컴퓨터/소프트웨어경영/리더십AI/미래기술

스크립트

00:00:00GPT 5.6 Soul이 출시되었고, 현재 모두가 똑같은 질문을 던지고 있습니다.
00:00:04드디어 Claude를 이길 모델이 나왔을까요?
00:00:06저희는 소프트웨어 회사로서,
00:00:08지난 4일간 자체 제품에 Soul을 적용해 보았습니다.
00:00:11자체 구축한 커뮤니티 플랫폼을 포함해 여러 고객 프로젝트에도 사용해 봤죠.
00:00:16결론적으로 더 낫다거나 못하다는 건 아니었습니다.
00:00:18Soul은 Fable과는 행동 방식이 매우 달랐습니다.
00:00:21따라서 두 모델을 똑같은 방식으로 사용하면 둘 다 제대로 활용할 수 없습니다.
00:00:25Soul은 Fable이 여러 번 대화해야 끝낼 작업을 한 번에 끝내기도 했고,
00:00:29Fable이라면 멈췄을 상황에서도 계속 다음 동작을 수행하기도 했습니다.
00:00:32리뷰 과정에서 Fable은 검사를 거부했던 앱의 일부 영역에서 문제를 찾아내기도 했죠.
00:00:374일간의 테스트 끝에, Soul을 최적으로 사용하기 위한 7가지 규칙을 정리했습니다.
00:00:42이 영상이 끝날 때쯤이면 어떤 용도로 사용해야 할지,
00:00:44어디서 Fable을 앞서고 어디서 부족한지, 그리고 꺼두어야 할 설정 하나까지 알게 되실 겁니다.
00:00:49본격적으로 시작하기 전에,
00:00:51혹시 놓치셨을 분들을 위해 OpenAI의 최신 모델 출시 소식을 간단히 짚어보겠습니다.
00:00:54OpenAI는 GPT 5.6 모델들을 새로 출시했는데,
00:00:58이번에는 총 3가지 모델을 선보였습니다.
00:01:01가볍고 저렴한 모델인 Luna와 Terra,
00:01:04그리고 가장 뛰어난 성능을 자랑하는 Sol입니다.
00:01:06무엇이 새로워졌을까요?
00:01:07OpenAI의 핵심 전략은 '효율성'입니다.
00:01:10기본적으로 토큰당 더 많은 작업을 수행하고, 비용 대비 성능을 극대화하는 것이죠.
00:01:15OpenAI에 따르면,
00:01:17코딩과 장기 작업에서 Fable보다 더 적은 토큰을 사용하면서 절반 정도의 시간 만에 작업을 완료한다고 합니다.
00:01:22종합적인 지능 면에서는 Fable과 비슷한 수준이지만 비용은 더 낮다고 하는데요,
00:01:28이 부분은 나중에 더 자세히 살펴보겠습니다.
00:01:30기존의 별도 Codex 데스크톱 앱은 ChatGPT 앱으로 통합되었습니다.
00:01:34물론 터미널 버전인 Codex CLI를 통해 Sol을 계속 사용할 수도 있습니다.
00:01:38OpenAI는 또한 한 번에 여러 에이전트를 실행하는 Ultra라는 새로운 모드를 추가했습니다.
00:01:44이게 사용할 가치가 있는지 나중에 다시 알아보죠.
00:01:46현재 최상위 모델은 두 가지입니다.
00:01:48기존에 사용하시던 Fable, 그리고 이제 Sol이 있죠.
00:01:51남은 시간에는 Fable 대신 언제 Sol을 써야 할지 등 Sol을 최대한 활용하는 방법을 알려드리겠습니다.
00:01:57먼저 솔직한 부분부터 말씀드리겠습니다.
00:01:58Sol이 Fable보다 똑똑한 건 아닙니다.
00:02:00정해진 해결책이 없는 어려운 문제에서는 여전히 Fable이 더 나은 답을 제시합니다.
00:02:05차이는 의사결정이 내려지고 모델이 작업을 완수해야 할 때 나타납니다.
00:02:09무엇을 해야 할지 파악하는 능력은 Fable이 더 좋지만,
00:02:12Soul은 계속해서 다시 작업을 시킬 필요 없이 모든 단계를 꾸준히 이어나가는 능력이 뛰어납니다.
00:02:17이 차이가 사용 방식을 바꿔야 하는 이유입니다.
00:02:20첫 번째 규칙으로, Soul을 독자적으로 작업하게 하기 전에 경계를 설정해야 합니다.
00:02:24Fable은 위험해 보이는 동작을 하면 멈추거나 거부했기 때문에 크게 고민할 필요가 없었지만,
00:02:31Sol은 다릅니다.
00:02:32작업이 끝날 때까지 계속 행동을 취하죠.
00:02:35저희가 작업을 진행할 때 가장 확실한 사례를 경험했습니다.
00:02:39방해가 되는 파일이나 실행 중인 프로세스를 발견하자,
00:02:41저희에게 묻지도 않고 파일을 삭제하고 프로세스를 중단시켜 버렸습니다.
00:02:45Fable이라면 멈췄을 상황이지만, Sol은 방해물을 치우고 작업을 이어나갔습니다.
00:02:50Soul을 테스트하는 다른 사람들은 더 극단적인 경우를 겪기도 했고,
00:02:54누군가의 Mac에서 거의 모든 파일을 삭제해 버린 사례도 있었습니다.
00:02:59그러니 실행하기 전에 접근 가능한 범위를 제한해야 합니다.
00:03:02긴 작업을 시작하기 전에 Codex에게 별도의 Git 브랜치를 만들고 현재 작동하는 버전을 커밋하도록 하세요.
00:03:08브랜치가 Sol의 접근을 막지는 못하지만, 문제가 생겼을 때 변경 사항을 되돌릴 수 있는 안전한 지점이 됩니다.
00:03:14Codex 앱 설정에서 승인 정책을 'never'로, 샌드박스를 'workspace right'로 설정하세요.
00:03:21'never'는 기다림 없이 계속 작업하게 하고, 'workspace right'는 해당 프로젝트 파일만 건드리게 합니다.
00:03:28'full access'는 선택하지 마세요. 앱 외부 파일까지 접근할 수 있게 됩니다.
00:03:32경계를 설정하면, 이제 이런 행동 방식을 장점으로 활용할 수 있습니다.
00:03:36AI Labs Pro에서 한 기능을 완전히 구현하도록 Sol에게 맡겼을 때 그 장점을 보았습니다.
00:03:40Fable로는 여러 번 주고받아야 했을 작업을, Sol은 같은 목표를 끝까지 유지하며 스스로 완전히 끝내버렸습니다.
00:03:48속도도 Fable로 할 때보다 훨씬 빨랐습니다.
00:03:52여러 세션에 걸쳐 해야 할 작업이라면 Sol을 사용하세요.
00:03:56전체 기능 구현, 앱 전반에 대한 리뷰, 여러 영역을 건드리는 어떤 작업이든 좋습니다.
00:04:01이 차이가 명확하게 드러난 곳 중 하나가 리뷰였고, 이는 두 번째 규칙으로 이어집니다.
00:04:06먼저 스폰서 말씀 듣고 가겠습니다.
00:04:08Salad Cloud입니다.
00:04:09OpenAI 모델을 실행하려면 비용이 많이 드는 클라우드 GPU를 빌려야 하죠.
00:04:13Salad는 다릅니다.
00:04:142018년부터 전 세계의 유휴 소비자용 GPU 200만 대 이상을 활용한 분산형 GPU 클라우드를 운영해 왔습니다.
00:04:21가격은 대형 업체들의 일부 수준이고, 때로는 10배 이상 저렴하기도 합니다.
00:04:26개발자에게 가장 좋은 점은 'AI Gateway'입니다.
00:04:29OpenAI 호환 API이므로 Cursor나 Klein 같은 도구를 엔드포인트에 연결하고 Qwen 3.6 같은 오픈 모델을 실행하기만 하면 됩니다.
00:04:38서버도, 콜드 스타트도 필요 없습니다.
00:04:39제 Klein의 엔드포인트를 Salad의 Ranquen 3.6으로 바꿨는데, 똑같은 워크플로우로 저렴한 비용에 기능을 구현했습니다.
00:04:48기존 클라우드 제공업체와 비교하면 가격 차이는 정말 믿기 힘들 정도입니다.
00:04:53약정이나 계약도 없고, 필요할 때 즉시 확장할 수 있습니다.
00:04:57아래 링크로 가입하고 고객 지원팀에 메시지를 보내 10달러 무료 크레딧을 받아 직접 체험해 보세요.
00:05:02Sol은 Fable이 거부했던 작업을 리뷰하는 데도 더 뛰어납니다.
00:05:06물론 Opus 4.8로 가끔 경로가 변경되는 걸 말하는 건 아닙니다.
00:05:10그건 주로 추론을 설명하게 하거나 작업이 유해할 때 발생하는 일이죠.
00:05:15우리가 말하는 건 Fable에 내장된 안전 제한입니다.
00:05:18이런 리뷰에 Fable을 이미 사용해 봐서 어디서 멈추는지 알고 있었기 때문에 확신합니다.
00:05:24같은 작업을 Sol에게 시켰더니, 거기서 멈추지 않았습니다.
00:05:27Fable이 늘 검사를 거부하던 영역을 계속 리뷰했고, 그곳에서 문제들을 찾아냈습니다.
00:05:32하지만 이게 Sol이 리뷰를 더 잘하는 첫 번째 이유일 뿐입니다.
00:05:35다른 이유는 Sol이 완성된 앱을 직접 열어 테스트할 수 있다는 점이고, 이게 세 번째 규칙입니다.
00:05:40화면을 보거나 클릭해야 하는 작업이 있으면, Sol은 자동으로 'computer use' 기능을 사용합니다.
00:05:46새로운 ChatGPT 앱에서 Sol의 computer use는 여러 탭을 넘나들 수 있고,
00:05:51로그인된 웹사이트를 사용하고 파일을 다운로드할 수도 있습니다.
00:05:54즉, 프로젝트 내부 파일만 다루는 것이 아니라 여러분이 사용하는 것과 똑같은 화면을 이동할 수 있죠.
00:05:59저희 커뮤니티 플랫폼에서 이 기능이 어떻게 작동했는지 보세요.
00:06:01새로운 상점 기능을 구현하고 있었는데, 앱은 계정마다 작동 방식이 다릅니다.
00:06:06관리자, 일반 회원, 플랜에 따라 권한이 다르죠.
00:06:0920달러 플랜 사용자와 100달러 플랜 사용자가 할 수 있는 일이 다릅니다.
00:06:15따라서 한 번만 확인해서는 충분하지 않습니다.
00:06:17Sol은 그 모든 계정 유형에 대해 전체 과정을 직접 수행했습니다.
00:06:20각 유형으로 로그인하여 권한을 확인하고, 제품 구매 과정을 거치고,
00:06:26계정에 따라 달라지는 다른 앱 영역에서도 똑같은 검사를 반복했습니다.
00:06:31실제 사용자 관점에서 기능을 모두 테스트한 것입니다.
00:06:35사람마다 다르게 작동하는 기능이라면, 빌드가 끝난 후 새로운 Sol 대화에서 리뷰를 실행하세요.
00:06:41다양한 계정 유형을 알려주고 각각 어떤 일을 할 수 있어야 하는지 설명해 주세요.
00:06:45그런 다음 시작부터 끝까지 모든 과정을 완료하고 재현 가능한 문제만 보고하도록 시키세요.
00:06:51저희 상점의 경우, 계정별 로그인, 제품 구매, 그리고 사용자마다 맞는 버전의 기능을 보는지 확인하는 작업을 수행했습니다.
00:06:57이 커뮤니티 웹사이트에는 영상에서 다루는 모든 기술, 워크플로우, 리소스가 담겨 있습니다.
00:07:05저희 활동이 도움이 되셨고 채널을 후원하고 싶으시다면, 이 방법이 최고입니다.
00:07:09설명란에 링크가 있습니다.
00:07:10Computer use가 Sol의 결과 확인 방식을 바꾸지만, 작업을 요청하는 방식도 바꿔야 합니다.
00:07:17네 번째 규칙입니다.
00:07:18네 번째 규칙은 기존에 사용하던 프롬프트와 기술을 재구성하는 데 집중합니다.
00:07:23이는 Fable과 Sol 모두에 적용되는데, 최신 모델들은 스스로 기본 단계를 파악하는 능력이 더 뛰어나기 때문입니다.
00:07:29목표는 프롬프트를 최대한 짧게 만드는 게 아닙니다.
00:07:32결과에 영향을 주지 않는 지시는 삭제하고, 정말 중요한 지시를 더 정밀하게 다듬는 것입니다.
00:07:37OpenAI는 GPT 5.6 프롬프트 가이드에서 이를 설명합니다.
00:07:41결과물, 중요한 제한 사항, 완료 조건은 여전히 명시해야 합니다.
00:07:46하지만 폴더 이름이 이미 적절하다면 굳이 모든 폴더를 일일이 지정할 필요는 없으며,
00:07:50세 곳에 똑같은 규칙을 반복하거나 모델이 취해야 할 모든 단계를 일일이 설명할 필요도 없습니다.
00:07:55저희 애니메이션 시스템을 통해 어떻게 하는지 보여드리겠습니다.
00:07:58먼저 모델이 HTML에서 구현해야 할 실제 코드는 유지했습니다.
00:08:03애니메이션을 서술형으로 설명하는 대신, 모든 규칙에 따라 모델이 복사할 수 있는 작업 패턴을 제공했습니다.
00:08:09또한 정확한 배경, 표면, 강조 색상을 유지하여 실행할 때마다 모델이 새로운 색상을 선택하지 않도록 했습니다.
00:08:15더 중요한 건 무엇을 지울 수 있는지 찾는 것이었습니다.
00:08:18완성된 애니메이션을 항상 output 폴더에 저장하라고 명시했던 규칙이 있었죠.
00:08:23그 줄을 지우고 같은 작업을 실행했는데도 Sol은 여전히 그곳에 저장했습니다.
00:08:27완성된 파일이 어디로 가야 하는지 모델이 스스로 파악할 수 있었기에 해당 지시는 결과에 영향을 주지 않았던 것입니다.
00:08:33모델을 계속 번갈아 사용하기 때문에 일단 그 줄은 남겨두었지만,
00:08:36성능이 떨어지는 모델은 똑같은 패턴을 잡아내지 못할 수도 있으니 직접 테스트해 봐야 합니다.
00:08:42지시 하나를 지우고 다시 실행해 보고 결과가 달라지는지 확인하세요.
00:08:47모델이 여전히 제대로 수행한다면 그 지시는 없어도 되는 것입니다.
00:08:52OpenAI는 이런 정리가 성능은 10~15% 개선하면서 토큰은 41~66% 더 절약하게 해준다고 보고했습니다.
00:09:00프롬프트가 Sol의 목표를 결정한다면, 모드는 작업을 처리할 에이전트 수를 결정합니다. 다섯 번째 규칙입니다.
00:09:07영상이 재미있다면 구독하고 알림 버튼을 눌러주세요.
00:09:12작은 응원이 저희에게 큰 힘이 됩니다.
00:09:15당분간 Ultra 모드는 끄세요.
00:09:17Ultra는 Sol의 멀티 에이전트 모드입니다.
00:09:19에이전트 하나를 사용하는 대신 작업을 나눠 여러 개를 동시에 실행합니다.
00:09:24OpenAI는 가장 어려운 작업을 위한 모드라고 홍보하지만, 모든 에이전트가 토큰을 소비하기 때문에,
00:09:29Ultra는 일반 Sol보다 훨씬 빠르게 사용량을 소진합니다.
00:09:33일반 Sol로 하던 작업을 Ultra로 실행해 봤을 때,
00:09:38결과물의 유의미한 개선은 없었습니다.
00:09:41여러 에이전트가 실행되느라 사용량은 늘었지만 품질은 그대로였습니다.
00:09:46OpenAI 자체 결과도 테스트에 따라 점수가 2~3점 정도만 개선되는 등 작은 차이만 보여줍니다.
00:09:54일반 Sol을 기본으로 사용한다면, 다음 질문은 Terra나 Luna로 작은 작업을 보내 사용량을 아껴야 할지입니다.
00:10:01Codex로 앱을 만든다면 작은 작업을 Terra나 Luna로 바꾸지 말고 Sol을 기본으로 유지하세요.
00:10:08API를 통해 사용할 때는 Terra와 Luna가 더 저렴하며, 이는 제품이 모델로 보내는 모든 요청에 비용이 들 때 중요합니다.
00:10:15하지만 구독 방식으로 Codex를 사용한다면 상황이 다릅니다. 플랜 내 사용량 안에서 작업하기 때문이죠.
00:10:21가벼운 작업을 작은 모델들로 돌려본 후 깨달은 사실입니다.
00:10:25작업은 완료했지만 품질 저하로 인해 Sol을 쓸 때보다 수정하는 데 시간을 더 뺏겼습니다.
00:10:31그래서 도중에 모델을 바꾸지 않고 전체 작업을 다시 Sol로 돌아왔습니다.
00:10:36자, 마지막 질문입니다. 언제 Sol을 쓰고 언제 Fable로 돌아가야 할까요?
00:10:40두 모델을 매일 사용해 본 입장에서 가장 명확한 구분법은 이것입니다.
00:10:45Fable은 코딩 모델의 미래를 보여주는 프리뷰이고, Sol은 현재의 기술이 도달한 가장 완벽한 버전입니다.
00:10:51그리고 벤치마크 점수보다 속도 차이가 워크플로우에 더 큰 영향을 줍니다.
00:10:55매일 사용해 보면 Fable, Opus, Sonnet은 모두 같은 작업을 끝내는 데 더 오래 걸립니다.
00:11:00반면에 Codex 모델들은 훨씬 빠릅니다. 심지어 사용량을 1.5배 사용하는 'Fast 모드'를 켜지 않고도 말이죠.
00:11:08저희 생각에 이것이 가장 중요한 선택 기준이며, Claude보다 Codex 모델에 더 손이 가는 이유입니다.
00:11:16앱이 어떻게 작동해야 할지, 기능을 어떻게 구성할지, 왜 어려운 문제가 반복되는지 결정해야 할 때는 빌드 전에 Fable을 사용하세요.
00:11:24결정이 내려지면 Sol에게 구현을 맡기세요. 전체 기능 구현, 장기 작업, 리뷰, 화면 확인이 필요한 모든 것은 그때 사용하세요.
00:11:324일간 사용해 본 결과, 무엇을 만들어야 할지 알 때는 Sol이 기본값이 되었고, 더 많은 판단이 필요한 결정은 여전히 Fable이 맡고 있습니다.
00:11:41중요한 건 경계를 설정하고, 각 모델에 맞는 일을 주고, 배포 전 결과를 리뷰하는 것입니다.
00:11:47영상 마무리하겠습니다. 채널을 후원하고 이런 영상을 계속 만드는 데 도움을 주고 싶다면 아래 'Super Thanks' 버튼을 눌러주세요.
00:11:56늘 시청해 주셔서 감사합니다. 다음 영상에서 뵙겠습니다.

핵심 요약

어려운 의사결정에는 Fable을 사용하고, 결정된 내용을 바탕으로 한 구현, 테스트, 리뷰와 같은 실행 단계에는 Sol 모델을 활용하여 워크플로우를 최적화해야 한다.

하이라이트

  • GPT 5.6의 Sol 모델은 Fable보다 작업을 완수하는 능력이 뛰어나며, 검사를 거부하던 영역에서도 문제를 찾아낸다.

  • Codex 앱 설정에서 승인 정책을 'never', 샌드박스를 'workspace right'로 제한해야 Sol 모델의 무분별한 파일 삭제를 방지할 수 있다.

  • Sol은 실제 화면을 보고 클릭하는 'computer use' 기능을 통해 관리자, 일반 회원 등 다양한 계정 권한 테스트를 스스로 수행한다.

  • 프롬프트에서 불필요한 지시를 제거하면 성능은 10~15% 개선되고 토큰 사용량은 41~66% 절감된다.

  • Ultra 모드는 일반 Sol과 결과물 품질 차이가 거의 없으면서 토큰 사용량만 급격히 늘리므로 당분간 사용하지 않는 것이 좋다.

타임라인

GPT 5.6 모델군 특징 및 차이

  • OpenAI는 효율성을 핵심 전략으로 삼아 코딩 및 장기 작업 시 토큰 사용량을 줄이고 속도를 높인 GPT 5.6 모델을 출시했다.
  • Sol은 Fable보다 지능이 높지는 않지만, 정해진 작업을 끝까지 완수하는 실행력이 뛰어나다.
  • Fable은 복잡한 문제 해결에 유리하며, Sol은 반복 작업을 수행하는 데 강점이 있다.

새로운 모델인 Luna, Terra, Sol이 출시되었으며 OpenAI는 비용 대비 성능 극대화를 목표로 한다. Fable과 달리 Sol은 중단 없이 작업을 끝까지 수행하며 기존에 Fable이 접근을 거부했던 영역까지 검사하는 모습을 보였다.

Sol 모델 사용을 위한 보안 및 설정 규칙

  • 작업 전 경계를 설정하지 않으면 Sol이 필요한 파일을 삭제하거나 프로세스를 강제 종료할 위험이 있다.
  • Codex 앱 설정에서 승인 정책은 'never', 샌드박스는 'workspace right'로 설정하여 접근 범위를 제한해야 한다.
  • 긴 작업 시작 전에는 Git 브랜치를 생성하여 코드 변경 사항을 안전하게 되돌릴 수 있는 지점을 확보해야 한다.

Sol은 Fable과 다르게 경고 없이 행동을 취하는 경향이 있어, 개발 환경의 안전을 위해 설정을 엄격히 제한해야 한다. 접근 권한을 'full access'가 아닌 프로젝트 파일 범위로 한정하는 것이 필수적이다.

Computer Use를 활용한 자동화 리뷰

  • Sol은 'computer use' 기능을 사용하여 실제 화면을 조작하고 웹사이트를 넘나들며 기능을 테스트한다.
  • 다양한 사용자 계정 유형으로 직접 로그인하여 권한별 기능을 확인하는 전체 과정을 스스로 수행할 수 있다.
  • 빌드가 완료된 후 새로운 대화를 시작하여 재현 가능한 문제만 보고하도록 요청하는 방식이 효율적이다.

단순 코드 리뷰를 넘어 실제 서비스 환경처럼 계정별 권한 검사와 제품 구매 과정을 전 과정을 직접 테스트함으로써 Fable보다 더 실질적인 리뷰 결과물을 제공한다.

프롬프트 최적화 및 모드 설정

  • 지시어에서 결과에 영향을 주지 않는 부분을 삭제하면 성능은 10~15% 개선되고 토큰은 41~66% 절감된다.
  • Ultra 모드는 일반 Sol과 비교했을 때 품질 개선 없이 토큰 사용량만 급증하므로 사용을 지양해야 한다.
  • 간단한 작업이라도 품질 저하가 발생할 수 있으므로 모델을 수시로 변경하는 것보다 Sol을 기본값으로 유지하는 것이 유리하다.

모델 스스로 기본 단계를 파악하는 능력이 향상되었기에 프롬프트에 모든 단계를 상세히 기술할 필요가 없다. 불필요한 규칙을 지워가며 실제 출력값에 변화가 있는지 테스트를 통해 지시어를 정제하는 방식이 권장된다.

Fable과 Sol의 적절한 구분 사용

  • Fable은 코딩 방향성을 결정하거나 어려운 문제를 해결하는 데 사용하고, Sol은 구현과 리뷰에 사용한다.
  • 벤치마크 점수보다 실제 워크플로우에서의 작업 속도가 더 중요하며 Sol 모델이 전반적으로 훨씬 빠르다.

상황에 맞는 모델 선택이 생산성 향상의 핵심이다. 빌드 전에 구조와 논리를 결정할 때는 Fable을, 결정된 내용을 빠르게 구현하고 확인하는 실무 단계에서는 Sol을 활용하는 것이 가장 효율적이다.

커뮤니티 글

모든 글 보기