스크립트
00:00:00안녕하세요 여러분. 제 이름은 샌디입니다. 그리고 오늘 제 공동 진행자인 스카우트를 소개합니다. 제 친근한
00:00:21로봇 로버죠. 보통 로봇은 스스로 생각할 수 없다고 생각하기 쉽잖아요? 우리는 로봇에게
00:00:29무엇을 해야 할지 알려주거나, 생각하는 방식을 아주 구체적으로 프로그래밍해야 하죠. 하지만
00:00:35여기 이 작은 친구는 실제로 두뇌가 있어서 스스로 생각할 수 있습니다. 제 화면을 보여
00:00:42드릴게요. 아, 아니요, 엉뚱한 화면으로 가고 있네요. 이걸 어떻게 멈출 수 있는지 확인하고,
00:00:46제 화면으로 어떻게 이동할 수 있는지 보겠습니다. 잠시만요. 슬라이드 쇼를 종료한 다음,
00:00:55이 화면으로 넘어가겠습니다. 자, 이게 바로 스카우트가 보고 있는 화면입니다. 그리고 스카우트는 작고
00:01:03귀여운 두뇌를 가지고 있죠. 스카우트는 제가 자연어로 하는 말을 이해할 수 있습니다. 예를 들어, 제
00:01:10화면을 보시면, 스카우트에게 이렇게 타이핑해서 말해 볼게요. 스카우트, 헤드라이트를 켜고
00:01:18모두에게 인사하라고 해보죠. 이 친구는 실제로 그 지시를 이해하고
00:01:30행동으로 옮길 수 있습니다. 하지만 어떻게 이런 일을 할 수 있는 걸까요? 생각을 정리하는 데
00:01:35몇 초 정도 걸릴 겁니다. 왜냐하면 이 시스템은 라즈베리 파이가
00:01:42설치된 상태로 작동하도록 설정되어 있기 때문입니다. 그리고 그 라즈베리 파이는 실제로 뉴욕시의 한 작은 장소에
00:01:50있습니다. 거기에 SIM 카드가 있어서 라즈베리 파이에 연결되고 신호를 받고 있는 것이죠.
00:01:56즉 4G 연결을 통해 이루어집니다. 그래서 로봇은 “알겠어, 바로 진행할게”라고 반응하죠. 보시다시피
00:02:01이번에는 이렇게 말해볼게요. 제자리에서 한 바퀴 돌아봐. 아, 아니, 실제로 저에게 말을 걸고 있네요. 이렇게 말해요.
00:02:07무대와 멋진 풍경이 보이네요. 왼쪽에는 커다란 프레젠테이션 화면, 밝은 무대 조명, 그리고
00:02:12관객석 좌석들이 있어요. 사람들이 몇 명이나 보이나요? 이 질문에 대답하도록 가르친 적은 한 번도 없는데요.
00:02:23하지만 제대로 맞추는지 봅시다. 1~2초 동안 생각하고 있네요. 자세히 좀 살펴볼게요. 전면 카메라로
00:02:34보니 두 사람이 보입니다. 한 사람은 무대 뒤쪽에 설치된 스피커 모니터 근처에 있고,
00:02:39다른 한 사람은 더 오른쪽에 있네요. 나참. 360도 회전해.
00:02:51그리고 이 친구는 “세션이 곧 시작되나요?”라고도 묻고 있어요. 맞죠? 곧 360도 회전을
00:02:57시작할 겁니다. 그러고 나서는 아마 “와, 해냈어”라고 할 거예요. 그래서 이 작은 로봇은
00:03:04차세대 로봇입니다. 아, 자 보시다시피요. 지금 360도 회전하고 있죠. 그리고 아마
00:03:12자기가 무엇을 보고 있는지 말해줄 겁니다. “돌아보자”라고 하고 있네요. 자, 이 차세대
00:03:22로봇은 전통적인 로봇 훈련 방식과는 다릅니다. 제가 이 친구에게 작은
00:03:30두뇌를 심어주었기 때문이죠. 두뇌를 심어주었다는 게 무슨 뜻이냐면, 이 로봇에게 에이전트를 부여했다는 뜻입니다.
00:03:38AWS에서 빌드한 오픈 소스 프레임워크인 '스트랜즈 에이전트(Strands Agents)'라는 것인데요. 이제
00:03:45다시 슬라이드 덱으로 빠르게 돌아가겠습니다. 화면으로 볼 수 있죠? 자, 여기서는 어떤 일이 일어나냐면, 로봇이 수행할 수 있는 기존 도구들이 있습니다.
00:03:54로봇은 혼자서 특정 작업을 수행할 수 있지만, 오직 미리 정해진 그 작업들만 혼자서 할 수 있습니다.
00:04:01따라서 여기에 LLM 레이어를 추가하거나, 더 나아가 에이전트 레이어를 추가함으로써 에이전트가 어떤 도구를 호출할지
00:04:09조율하고, 우리가 원하는 작업을 로봇이 실제로 수행하도록 만들 수 있습니다.
00:04:16전통적인 소프트웨어와 AI 엔지니어링 같은 전통적인 AI 환경에서 에이전트에 소프트웨어 도구를 제공할 수 있는 것처럼,
00:04:25마찬가지로 동일한 AI 에이전트에 미리 설정된 기능이나 프로그래밍 가능한 정책에 액세스할 수 있는
00:04:33'로봇'이라는 하드웨어 도구를 제공할 수 있습니다. 그러면 에이전트는 언제 어떤 정책을 실행할지 결정할 수 있죠.
00:04:42즉, 단 하나의 로봇 에이전트만 있으면 수많은 새로운 작업을 수행할 수 있으며, 우리가 자연어로 가르치는 내용을
00:04:50로봇이 이해하도록 만들 수 있습니다. 그렇다면 어떻게 시작할 수 있을까요? 단 5줄의 코드면 충분합니다.
00:04:58이것은 '스트랜즈(Strands)'라는 에이전트 하네스를 통해 가능합니다. 우리가 해야 할 일은 단지 스트랜즈 에이전트를 임포트하고
00:05:07로봇 도구를 호출하는 것뿐입니다. 그리고 `tools = robot`이라고 지정합니다. 그런 다음 “빨간색 큐브를 집어 들어”라고 말하면,
00:05:14로봇에게 그런 능력이 있다는 가정하에 빨간색 큐브를 집어 들 수 있게 됩니다. 네, 지금 이 친구는 누군가를 보고
00:05:20저 사람에게 다가가야겠다고 생각하고 있네요. 꽤 신나 보이죠. 이 친구가 꽤 특별한 이유는
00:05:25에이전트가 하나만 있는 게 아니기 때문입니다. 무려 세 개의 서로 다른 에이전트를 가지고 있어요. 그 세 개 전부
00:05:31스트랜즈 기반이며, 동시에 작동합니다. 그중 하나는 '싱커(Thinker) 에이전트'입니다.
00:05:37이 에이전트는 끊임없이 생각하고 주변 환경을 평가하며
00:05:41“다음에 뭘 해야 하지?” 같은 고민을 담당하는 부분입니다. 두뇌의 이 부분은 쉼 없이 생각하고 있죠. 그리고 또 다른
00:05:47통신 담당 부분이 있습니다. 곧 보여드리겠습니다. 저는 이 로봇을 텔레그램 앱과
00:05:53웹앱에도 연결해 두었습니다. 덕분에 로봇은 자연어로 저와 대화를 나눌 수 있으며,
00:06:00제가 지시하는 내용에 따라 행동을 취할 수 있습니다. 단순히 주변을 지각하고 생각하며 무엇을 할지 알아내는 것 외에도 말이죠.
00:06:05그리고 세 번째 에이전트, 즉 이 로봇이 사용할 수 있는 세 번째 유형의 에이전트는 '음성 에이전트'입니다.
00:06:11제가 말을 할 때마다 로봇은 제가 자기한테 말하는 줄 알고 착각하기 때문에 이 기능은 꺼두어야 했습니다.
00:06:16그렇지 않으면 계속 저와 수다를 떨려고 할 테니까요. 그렇게 되면 별로 재미가 없겠죠,
00:06:21공동 진행자가 계속 제 말을 끊게 될 테니까요. 그래서 일단은 그 기능을 비활성화해 두었습니다.
00:06:26하지만 본질적으로 이 세 가지 에이전트 모두 이 하나의 로봇과 긴밀하게 연동되어 작동합니다. 그리하여
00:06:36로봇은 단순히 훈련받은 작업이나 학습된 정책을 수행하는 것을 넘어, 훨씬 더 많은 일을 할 수 있는 능력을 갖추게 됩니다.
00:06:42자, 이제 스트랜즈 패키지 자체에 대한 간략한 개요를 살펴보겠습니다. 스트랜즈 패키지는 8개 카테고리에 걸쳐
00:06:5340개가 넘는 서로 다른 로봇을 지원합니다. 그리고 이 모든 것들은 간단한 로봇 도구 호출을 통해 이루어집니다.
00:07:00이 모든 것은 어떻게 구성되어 있을까요? 총 4개의 레이어로 이루어져 있습니다. 첫 번째는 가장 상위에 있는 에이전트 레이어입니다.
00:07:08여기에는 두 가지 부분이 있습니다. 하나는 명령이 입력되는 방식이고, 다른 하나는 로봇이 관측하고
00:07:14그 관측 결과가 위로 전달되는 방식입니다. 눈치채셨겠지만, 매우 양방향적이죠. 먼저 우리가 지시를 내릴 때,
00:07:21우리는 에이전틱 레이어인 스트랜즈 에이전트와 대화하게 됩니다. 그러면 스트랜즈 에이전트가 어떤
00:07:28정책을 호출할지 결정합니다. 정책 제공자 역시 — 스트랜즈 에이전트는 다양한 정책 제공자를 지원합니다.
00:07:35우리는 전통적인 로봇 훈련 방식을 바탕으로 정책을 훈련할 수 있습니다. 즉, 정책 내부에서 데이터를 수집하고,
00:07:42그것을 바탕으로 훈련을 진행하며, 더 많은 시뮬레이션 데이터를 생성합니다. 그리고 그
00:07:48정책은 VLA 모델이 되며, 로봇과 스트랜즈 에이전트가 이에 접근할 수 있게 됩니다.
00:07:55그러면 우리가 던지는 질문이나 내리는 명령에 따라 특정 정책을 호출하게 되는 것입니다.
00:08:01그리고 그 정책은 어딘가에 존재해야 하겠죠? 그것은 백엔드에 위치하며,
00:08:07시뮬레이션 환경일 수도 있고 실제 하드웨어 칩이나 하드웨어 환경일 수도 있습니다.
00:08:14그것이 바로 정책이 실행되는 백엔드이자 인터페이스입니다. 마지막으로,
00:08:20출력은 실제 물리적 하드웨어인 로봇에서 일어납니다. 자, 로봇이 — 아,
00:08:26보세요! 지금 반응하고 있잖아요. 넘어져도 괜찮도록 설계되어 있습니다. 기술적으로는 다치지 않아야 해요.
00:08:34멈췄던 자리에서 다시 일어날 수 있어야 합니다. 아, 알겠습니다. 지금 로봇에게
00:08:42뒤로 조금 가라고 지시하고 있어요. 물러서. 실제로 뒤로 물러나는지 봅시다. 이것이 바로 빌드하기 위한 4가지 레이어이며,
00:08:52내부에서 어떤 일이 벌어지는지 보여줍니다. 내부 아키텍처를 좀 더
00:08:58시각적으로 살펴보자면, 기본적으로 모든 것은 엣지와 클라우드 양쪽에 존재하는 스트랜즈 에이전트입니다.
00:09:04우리는 에이전트 코어를 사용하여 VLA와 정책을 클라우드 환경에서 훈련시키고자 합니다.
00:09:12하지만 동시에 엣지 환경에서 직접 호출하여 로봇이 기능과 정책을 더 빠르게 실행할 수 있기를 원합니다.
00:09:20그래서 이것은 일부는 클라우드에서 처리되고 다른 일부는 엣지에서 처리되는 하이브리드 모델과 같습니다.
00:09:28그리고 스트랜즈는 이 중 어느 부분을 언제 호출할지 스스로 결정할 수 있습니다.
00:09:34이러한 방식은 로봇이 끊임없이 정보를 수집할 때 방대한 양의 훈련을 처리하는 데 큰 도움이 됩니다.
00:09:41그 정보를 바탕으로 훈련하고 스스로 학습할 수 있으면서도,
00:09:47런타임 시에는 아주아주 빠르게 실행할 수 있습니다. 자, 앞서 말씀드린 것처럼
00:09:53에이전트는 무엇을 할지 결정하고, 정책은 그것을 어떻게 수행할지 결정합니다. 하지만 이 친구는 꽤 영리해서
00:10:01완전히 넘어지지 않았다면 스스로 일어날 수 있어야 합니다. 그리고 계속해서 이동할 수 있어야죠.
00:10:07자, 그럼 이게 우리에게 무엇을 의미할까요? 그리고 왜 이것이 그토록 특별할까요?
00:10:17우리는 아주 전통적인 로봇부터 시작했습니다. 로봇은 옛날부터 늘 존재해 왔고,
00:10:25항상 자동화되도록 사전 프로그래밍되어 일련의 작업을 자율적으로 수행해 왔습니다. 하지만 이 세상에는
00:10:36이러한 로봇 정책과 VLA 모델이 너무나도 발전해서 우리가 이런 작업을 할 필요조차 없어지는 미래가 존재합니다.
00:10:46대규모 언어 모델만큼이나 거대해질 수 있죠. 잠깐만요. 또 뒤로 넘어지고 있네요.
00:10:53다시 일으켜 세울 수 있는지 봐야겠어요. 착하지. 멈춰. 그러다 또 넘어져 버렸네요.
00:11:04이러한 대형 언어 모델들이 우리의 거대 언어 모델들만큼이나 크고 놀라운 수준에 도달하는 시점이 올 것입니다.
00:11:13세상의 모든 정보를 다 가지고 있어서 우리가 이런 작업을 할 필요조차 없을 수도 있어요.
00:11:18단 하나의 간단한 모델만 주입해 주면 될지도 모릅니다. 그걸 로봇에게 건네주면 로봇이 정확히
00:11:23무엇을 해야 할지 알게 되겠죠. 하지만 기존 VLA와 기존 정책 위에 파인튜닝을 할 필요가 없어지는 그 시점이 오기 전까지는,
00:11:30우리는 이렇게 할 수 있습니다. 그리고 이것은 더 이상 로봇을 훈련할 필요가 없는 미래를 향한 디딤돌입니다.
00:11:39자, 이제 훈련된 작업 외에 더 많은 일을 하고 싶다면 로봇에게 에이전트를 부여하고
00:11:46어떤 일을 할 수 있는지 지켜보면 됩니다. 그럼 빠르게 제 데모 화면으로 돌아가서,
00:11:53실제로 어떻게 작동하고 있는지 보여드리겠습니다.
00:11:58좋습니다. 자, 이게 제 화면입니다. 여기는 스트랜즈, 여기는 스카우트입니다. 저는 그동안 로봇에게 여러 가지
00:12:06작업을 지시해 왔습니다. “이봐, 좀 복잡한 걸 해봐”라고 말할 수도 있죠. 복잡한 건 아니지만요. 로봇이 지금 생각하고 있네요.
00:12:17좋습니다. 떨어질 뻔했네요. “회전하자”라고 말하고 있습니다. 360도 완벽하게 완료. 여전히 무대 위에 안전하게 있어요.
00:12:26밝은 무대 조명과 관객석이 보이네요. 모두 좋습니다. 뭐가 있죠? 오, 도전 과제군요.
00:12:34로봇이 말하고 있습니다.
00:12:35이걸 저의 시그니처 퍼포먼스라고 부르죠.
00:12:40아무것도 안 하고 있네요. 뭐 하는 거예요?
00:12:45분명히 말을 하고 있는 것 같은데, 뭐 하는 거죠? 뭐 좀 해봐요. 방금 헤드라인을
00:12:51껐어요. 좋습니다. 자, 이제 호출하네요. '복잡한 걸 해줘'라는 요청 때문에 실행했던 '말하기' 대신
00:12:58'호출'이라는 기능이 실행된 게 보이죠? 방금 말을 했고요. 이제는 뭔가
00:13:03동작을 시도하려고 했어야 할 것 같아요. 무언가를 하려다가 떨어져 버렸네요.
00:13:08예전에 꽤 멋진 춤을 추는 걸 본 적이 있어요. 이런 독특한 춤 동작 말이죠. 하지만 얘도 자기만의 고집이
00:13:15있어요. 그쵸? 자, 이 내부에서는 어떤 일들이 일어나고 있을까요? 몇 가지가 있습니다. 첫 번째로는
00:13:21이걸 활용할 수 있다는 점입니다. 얘를 만드는 이유가 뭘까요? 제 데이터셋을 구축하는 데 쓸 수 있어요. 제가 직접
00:13:28수동으로 조작할 수도 있기 때문에, 원하는 방향으로 이동시키면서
00:13:33훈련 에피소드를 만들 수 있죠. 그리고 제가 던지는 질문에 얘가 어떻게 반응하고 어떻게
00:13:40추론하는지에 대한 정보를 얻을 수 있습니다. 이건 제가 더 나은 성능을 내도록
00:13:46만드는 데 매우 유용한 정보가 됩니다. 이것이 전체 과정이자 실험의 한 부분입니다.
00:13:53즉, 자율성을 부여하고 여러 작업을 시키면서 더 많은 데이터를 수집하는 것이죠. 그 외에도 이것은 제
00:14:03통합 시스템입니다. 내부적으로는, 여러분의 하니스 SDK인 스트랜즈 에이전트들이
00:14:10현재 앤스로픽 클로드 오푸스 4.8을 브레인으로 사용하고 있습니다. 그것이 바로 두뇌인 셈이죠. 그리고 이건
00:14:16제가 무엇을 해야 하는지 지시하는 간단한 시스템 프롬프트입니다. 모든
00:14:23규칙들을 알려주고 있죠. 또한 이미 가지고 있는 모든 규칙들에 접근할 수 권한도 부여했습니다. 즉, 각각의
00:14:29규칙이 어떤 용도로 쓰이는지 알려주는 식입니다. 그래서 스트랜즈가 제가 요청하는 작업에 맞춰 어떤 도구를 호출할지 결정하게 됩니다.
00:14:36사용하는 음성은 오픈AI 리얼타임의 음성입니다. 그리고 제대로 동작할 수 있도록
00:14:44안전 장치나 가이드라인 같은 추가적인 정보도 부여해 두었습니다. 자, 이렇게 에이전트가 두 개 있고요.
00:14:51또 한 가지 할 수 있는 일은 텔레그램으로 저와 대화하는 것입니다. 이게 정말 놀라운 게, 집에 없을 때도
00:14:59얘와 대화하고 싶을 때 이렇게 말할 수 있죠.
00:15:04헤이 스카우트, 뒤돌아서 회전하고 분석해 봐—떨어지지 말고. 방을 분석하고
00:15:17누가 제일 인물이 좋은지 말해줘. 이건 늘 성공할 수도 있고 아닐 수도 있어요. 스카우트가
00:15:26편파적으로 변한다고 저를 원망하진 마세요. 이걸 가지고 놀아보는 게 백설공주와
00:15:31왕비가 “거울아, 거울아, 세상에서 누가 제일 예쁘니?”라고 묻는 것 같아서 이렇게 해봤거든요. 자, 스트랜즈가
00:15:37어떤 대답을 내놓는지 볼까요? '하하, 알겠어요'라고 하네요. 방을 스캔하기 위해 몸을 회전하고 있어요. 돌고 있나요?
00:15:42돌고 있죠. 뭘 보고 있는지 볼까요? 여전히
00:15:47무대를 보고 있네요. 이게 다른 거울이에요. 저를 보고 있어요. 안녕. 내가 제일 예뻐? 오, 과찬이십니다.
00:15:54하지만 아니죠. 한 번 더 돌아줘요. 조금만 더 회전해 주세요. 더 돌지 않기로 결정했나 봐요. 뭐라고 하는지 들어봅시다.
00:16:06회전 완료. 방에 대한 제 분석 결과입니다. 제 화면 보이시죠? 화면을 확대할 방법이 없네요.
00:16:12총 여섯 일곱 명 정도가 보입니다. 밝은 무대 우측 근처 정면 앞쪽에 몇 명이 앉아 있고,
00:16:19객석에 몇 명이 더 있네요. 무대 위에는 어두운 의상을 입은 사람이 한 명 있습니다. 멋진 청바지에
00:16:25운동화를 신었군요. 대단히 감사합니다. 아, 아니 아니 아니. 내 앞에 있는 사람 말이에요. 청바지에 운동화를 신은 사람.
00:16:31무대 위에서 분명 목적을 가지고 걷고 있군요. 누가 제일 잘생겼냐고요? 솔직히 제 낮은 앵글의 시선으로는 구별하기 힘들지만,
00:16:39지금 무대 위에 있는 분은 자신감 넘치는 발걸음과 극적인
00:16:45파란색 커튼 배경 덕분에 스타일 점수를 드리고 싶습니다. 대단히 감사합니다. 자신감이 필요할 때마다 방에 혼자 남아
00:16:51이 친구에게 세상에서 누가 제일 예쁘냐고 물어볼 수 있겠어요. 그럼 이 친구는 언제나 저를
00:16:58정답으로 선택해 줄 테니까요. 대단히 감사합니다.
00:17:09정말 감사합니다.