로봇에게 원하는 것을 말하세요 — Sandhya Subramani, AWS

AAI Engineer
컴퓨터/소프트웨어가전제품/카메라

스크립트

00:00:00안녕하세요 여러분. 제 이름은 샌디입니다. 그리고 오늘 제 공동 진행자인 스카우트를 소개합니다. 제 친근한
00:00:21로봇 로버죠. 보통 로봇은 스스로 생각할 수 없다고 생각하기 쉽잖아요? 우리는 로봇에게
00:00:29무엇을 해야 할지 알려주거나, 생각하는 방식을 아주 구체적으로 프로그래밍해야 하죠. 하지만
00:00:35여기 이 작은 친구는 실제로 두뇌가 있어서 스스로 생각할 수 있습니다. 제 화면을 보여
00:00:42드릴게요. 아, 아니요, 엉뚱한 화면으로 가고 있네요. 이걸 어떻게 멈출 수 있는지 확인하고,
00:00:46제 화면으로 어떻게 이동할 수 있는지 보겠습니다. 잠시만요. 슬라이드 쇼를 종료한 다음,
00:00:55이 화면으로 넘어가겠습니다. 자, 이게 바로 스카우트가 보고 있는 화면입니다. 그리고 스카우트는 작고
00:01:03귀여운 두뇌를 가지고 있죠. 스카우트는 제가 자연어로 하는 말을 이해할 수 있습니다. 예를 들어, 제
00:01:10화면을 보시면, 스카우트에게 이렇게 타이핑해서 말해 볼게요. 스카우트, 헤드라이트를 켜고
00:01:18모두에게 인사하라고 해보죠. 이 친구는 실제로 그 지시를 이해하고
00:01:30행동으로 옮길 수 있습니다. 하지만 어떻게 이런 일을 할 수 있는 걸까요? 생각을 정리하는 데
00:01:35몇 초 정도 걸릴 겁니다. 왜냐하면 이 시스템은 라즈베리 파이가
00:01:42설치된 상태로 작동하도록 설정되어 있기 때문입니다. 그리고 그 라즈베리 파이는 실제로 뉴욕시의 한 작은 장소에
00:01:50있습니다. 거기에 SIM 카드가 있어서 라즈베리 파이에 연결되고 신호를 받고 있는 것이죠.
00:01:56즉 4G 연결을 통해 이루어집니다. 그래서 로봇은 “알겠어, 바로 진행할게”라고 반응하죠. 보시다시피
00:02:01이번에는 이렇게 말해볼게요. 제자리에서 한 바퀴 돌아봐. 아, 아니, 실제로 저에게 말을 걸고 있네요. 이렇게 말해요.
00:02:07무대와 멋진 풍경이 보이네요. 왼쪽에는 커다란 프레젠테이션 화면, 밝은 무대 조명, 그리고
00:02:12관객석 좌석들이 있어요. 사람들이 몇 명이나 보이나요? 이 질문에 대답하도록 가르친 적은 한 번도 없는데요.
00:02:23하지만 제대로 맞추는지 봅시다. 1~2초 동안 생각하고 있네요. 자세히 좀 살펴볼게요. 전면 카메라로
00:02:34보니 두 사람이 보입니다. 한 사람은 무대 뒤쪽에 설치된 스피커 모니터 근처에 있고,
00:02:39다른 한 사람은 더 오른쪽에 있네요. 나참. 360도 회전해.
00:02:51그리고 이 친구는 “세션이 곧 시작되나요?”라고도 묻고 있어요. 맞죠? 곧 360도 회전을
00:02:57시작할 겁니다. 그러고 나서는 아마 “와, 해냈어”라고 할 거예요. 그래서 이 작은 로봇은
00:03:04차세대 로봇입니다. 아, 자 보시다시피요. 지금 360도 회전하고 있죠. 그리고 아마
00:03:12자기가 무엇을 보고 있는지 말해줄 겁니다. “돌아보자”라고 하고 있네요. 자, 이 차세대
00:03:22로봇은 전통적인 로봇 훈련 방식과는 다릅니다. 제가 이 친구에게 작은
00:03:30두뇌를 심어주었기 때문이죠. 두뇌를 심어주었다는 게 무슨 뜻이냐면, 이 로봇에게 에이전트를 부여했다는 뜻입니다.
00:03:38AWS에서 빌드한 오픈 소스 프레임워크인 '스트랜즈 에이전트(Strands Agents)'라는 것인데요. 이제
00:03:45다시 슬라이드 덱으로 빠르게 돌아가겠습니다. 화면으로 볼 수 있죠? 자, 여기서는 어떤 일이 일어나냐면, 로봇이 수행할 수 있는 기존 도구들이 있습니다.
00:03:54로봇은 혼자서 특정 작업을 수행할 수 있지만, 오직 미리 정해진 그 작업들만 혼자서 할 수 있습니다.
00:04:01따라서 여기에 LLM 레이어를 추가하거나, 더 나아가 에이전트 레이어를 추가함으로써 에이전트가 어떤 도구를 호출할지
00:04:09조율하고, 우리가 원하는 작업을 로봇이 실제로 수행하도록 만들 수 있습니다.
00:04:16전통적인 소프트웨어와 AI 엔지니어링 같은 전통적인 AI 환경에서 에이전트에 소프트웨어 도구를 제공할 수 있는 것처럼,
00:04:25마찬가지로 동일한 AI 에이전트에 미리 설정된 기능이나 프로그래밍 가능한 정책에 액세스할 수 있는
00:04:33'로봇'이라는 하드웨어 도구를 제공할 수 있습니다. 그러면 에이전트는 언제 어떤 정책을 실행할지 결정할 수 있죠.
00:04:42즉, 단 하나의 로봇 에이전트만 있으면 수많은 새로운 작업을 수행할 수 있으며, 우리가 자연어로 가르치는 내용을
00:04:50로봇이 이해하도록 만들 수 있습니다. 그렇다면 어떻게 시작할 수 있을까요? 단 5줄의 코드면 충분합니다.
00:04:58이것은 '스트랜즈(Strands)'라는 에이전트 하네스를 통해 가능합니다. 우리가 해야 할 일은 단지 스트랜즈 에이전트를 임포트하고
00:05:07로봇 도구를 호출하는 것뿐입니다. 그리고 `tools = robot`이라고 지정합니다. 그런 다음 “빨간색 큐브를 집어 들어”라고 말하면,
00:05:14로봇에게 그런 능력이 있다는 가정하에 빨간색 큐브를 집어 들 수 있게 됩니다. 네, 지금 이 친구는 누군가를 보고
00:05:20저 사람에게 다가가야겠다고 생각하고 있네요. 꽤 신나 보이죠. 이 친구가 꽤 특별한 이유는
00:05:25에이전트가 하나만 있는 게 아니기 때문입니다. 무려 세 개의 서로 다른 에이전트를 가지고 있어요. 그 세 개 전부
00:05:31스트랜즈 기반이며, 동시에 작동합니다. 그중 하나는 '싱커(Thinker) 에이전트'입니다.
00:05:37이 에이전트는 끊임없이 생각하고 주변 환경을 평가하며
00:05:41“다음에 뭘 해야 하지?” 같은 고민을 담당하는 부분입니다. 두뇌의 이 부분은 쉼 없이 생각하고 있죠. 그리고 또 다른
00:05:47통신 담당 부분이 있습니다. 곧 보여드리겠습니다. 저는 이 로봇을 텔레그램 앱과
00:05:53웹앱에도 연결해 두었습니다. 덕분에 로봇은 자연어로 저와 대화를 나눌 수 있으며,
00:06:00제가 지시하는 내용에 따라 행동을 취할 수 있습니다. 단순히 주변을 지각하고 생각하며 무엇을 할지 알아내는 것 외에도 말이죠.
00:06:05그리고 세 번째 에이전트, 즉 이 로봇이 사용할 수 있는 세 번째 유형의 에이전트는 '음성 에이전트'입니다.
00:06:11제가 말을 할 때마다 로봇은 제가 자기한테 말하는 줄 알고 착각하기 때문에 이 기능은 꺼두어야 했습니다.
00:06:16그렇지 않으면 계속 저와 수다를 떨려고 할 테니까요. 그렇게 되면 별로 재미가 없겠죠,
00:06:21공동 진행자가 계속 제 말을 끊게 될 테니까요. 그래서 일단은 그 기능을 비활성화해 두었습니다.
00:06:26하지만 본질적으로 이 세 가지 에이전트 모두 이 하나의 로봇과 긴밀하게 연동되어 작동합니다. 그리하여
00:06:36로봇은 단순히 훈련받은 작업이나 학습된 정책을 수행하는 것을 넘어, 훨씬 더 많은 일을 할 수 있는 능력을 갖추게 됩니다.
00:06:42자, 이제 스트랜즈 패키지 자체에 대한 간략한 개요를 살펴보겠습니다. 스트랜즈 패키지는 8개 카테고리에 걸쳐
00:06:5340개가 넘는 서로 다른 로봇을 지원합니다. 그리고 이 모든 것들은 간단한 로봇 도구 호출을 통해 이루어집니다.
00:07:00이 모든 것은 어떻게 구성되어 있을까요? 총 4개의 레이어로 이루어져 있습니다. 첫 번째는 가장 상위에 있는 에이전트 레이어입니다.
00:07:08여기에는 두 가지 부분이 있습니다. 하나는 명령이 입력되는 방식이고, 다른 하나는 로봇이 관측하고
00:07:14그 관측 결과가 위로 전달되는 방식입니다. 눈치채셨겠지만, 매우 양방향적이죠. 먼저 우리가 지시를 내릴 때,
00:07:21우리는 에이전틱 레이어인 스트랜즈 에이전트와 대화하게 됩니다. 그러면 스트랜즈 에이전트가 어떤
00:07:28정책을 호출할지 결정합니다. 정책 제공자 역시 — 스트랜즈 에이전트는 다양한 정책 제공자를 지원합니다.
00:07:35우리는 전통적인 로봇 훈련 방식을 바탕으로 정책을 훈련할 수 있습니다. 즉, 정책 내부에서 데이터를 수집하고,
00:07:42그것을 바탕으로 훈련을 진행하며, 더 많은 시뮬레이션 데이터를 생성합니다. 그리고 그
00:07:48정책은 VLA 모델이 되며, 로봇과 스트랜즈 에이전트가 이에 접근할 수 있게 됩니다.
00:07:55그러면 우리가 던지는 질문이나 내리는 명령에 따라 특정 정책을 호출하게 되는 것입니다.
00:08:01그리고 그 정책은 어딘가에 존재해야 하겠죠? 그것은 백엔드에 위치하며,
00:08:07시뮬레이션 환경일 수도 있고 실제 하드웨어 칩이나 하드웨어 환경일 수도 있습니다.
00:08:14그것이 바로 정책이 실행되는 백엔드이자 인터페이스입니다. 마지막으로,
00:08:20출력은 실제 물리적 하드웨어인 로봇에서 일어납니다. 자, 로봇이 — 아,
00:08:26보세요! 지금 반응하고 있잖아요. 넘어져도 괜찮도록 설계되어 있습니다. 기술적으로는 다치지 않아야 해요.
00:08:34멈췄던 자리에서 다시 일어날 수 있어야 합니다. 아, 알겠습니다. 지금 로봇에게
00:08:42뒤로 조금 가라고 지시하고 있어요. 물러서. 실제로 뒤로 물러나는지 봅시다. 이것이 바로 빌드하기 위한 4가지 레이어이며,
00:08:52내부에서 어떤 일이 벌어지는지 보여줍니다. 내부 아키텍처를 좀 더
00:08:58시각적으로 살펴보자면, 기본적으로 모든 것은 엣지와 클라우드 양쪽에 존재하는 스트랜즈 에이전트입니다.
00:09:04우리는 에이전트 코어를 사용하여 VLA와 정책을 클라우드 환경에서 훈련시키고자 합니다.
00:09:12하지만 동시에 엣지 환경에서 직접 호출하여 로봇이 기능과 정책을 더 빠르게 실행할 수 있기를 원합니다.
00:09:20그래서 이것은 일부는 클라우드에서 처리되고 다른 일부는 엣지에서 처리되는 하이브리드 모델과 같습니다.
00:09:28그리고 스트랜즈는 이 중 어느 부분을 언제 호출할지 스스로 결정할 수 있습니다.
00:09:34이러한 방식은 로봇이 끊임없이 정보를 수집할 때 방대한 양의 훈련을 처리하는 데 큰 도움이 됩니다.
00:09:41그 정보를 바탕으로 훈련하고 스스로 학습할 수 있으면서도,
00:09:47런타임 시에는 아주아주 빠르게 실행할 수 있습니다. 자, 앞서 말씀드린 것처럼
00:09:53에이전트는 무엇을 할지 결정하고, 정책은 그것을 어떻게 수행할지 결정합니다. 하지만 이 친구는 꽤 영리해서
00:10:01완전히 넘어지지 않았다면 스스로 일어날 수 있어야 합니다. 그리고 계속해서 이동할 수 있어야죠.
00:10:07자, 그럼 이게 우리에게 무엇을 의미할까요? 그리고 왜 이것이 그토록 특별할까요?
00:10:17우리는 아주 전통적인 로봇부터 시작했습니다. 로봇은 옛날부터 늘 존재해 왔고,
00:10:25항상 자동화되도록 사전 프로그래밍되어 일련의 작업을 자율적으로 수행해 왔습니다. 하지만 이 세상에는
00:10:36이러한 로봇 정책과 VLA 모델이 너무나도 발전해서 우리가 이런 작업을 할 필요조차 없어지는 미래가 존재합니다.
00:10:46대규모 언어 모델만큼이나 거대해질 수 있죠. 잠깐만요. 또 뒤로 넘어지고 있네요.
00:10:53다시 일으켜 세울 수 있는지 봐야겠어요. 착하지. 멈춰. 그러다 또 넘어져 버렸네요.
00:11:04이러한 대형 언어 모델들이 우리의 거대 언어 모델들만큼이나 크고 놀라운 수준에 도달하는 시점이 올 것입니다.
00:11:13세상의 모든 정보를 다 가지고 있어서 우리가 이런 작업을 할 필요조차 없을 수도 있어요.
00:11:18단 하나의 간단한 모델만 주입해 주면 될지도 모릅니다. 그걸 로봇에게 건네주면 로봇이 정확히
00:11:23무엇을 해야 할지 알게 되겠죠. 하지만 기존 VLA와 기존 정책 위에 파인튜닝을 할 필요가 없어지는 그 시점이 오기 전까지는,
00:11:30우리는 이렇게 할 수 있습니다. 그리고 이것은 더 이상 로봇을 훈련할 필요가 없는 미래를 향한 디딤돌입니다.
00:11:39자, 이제 훈련된 작업 외에 더 많은 일을 하고 싶다면 로봇에게 에이전트를 부여하고
00:11:46어떤 일을 할 수 있는지 지켜보면 됩니다. 그럼 빠르게 제 데모 화면으로 돌아가서,
00:11:53실제로 어떻게 작동하고 있는지 보여드리겠습니다.
00:11:58좋습니다. 자, 이게 제 화면입니다. 여기는 스트랜즈, 여기는 스카우트입니다. 저는 그동안 로봇에게 여러 가지
00:12:06작업을 지시해 왔습니다. “이봐, 좀 복잡한 걸 해봐”라고 말할 수도 있죠. 복잡한 건 아니지만요. 로봇이 지금 생각하고 있네요.
00:12:17좋습니다. 떨어질 뻔했네요. “회전하자”라고 말하고 있습니다. 360도 완벽하게 완료. 여전히 무대 위에 안전하게 있어요.
00:12:26밝은 무대 조명과 관객석이 보이네요. 모두 좋습니다. 뭐가 있죠? 오, 도전 과제군요.
00:12:34로봇이 말하고 있습니다.
00:12:35이걸 저의 시그니처 퍼포먼스라고 부르죠.
00:12:40아무것도 안 하고 있네요. 뭐 하는 거예요?
00:12:45분명히 말을 하고 있는 것 같은데, 뭐 하는 거죠? 뭐 좀 해봐요. 방금 헤드라인을
00:12:51껐어요. 좋습니다. 자, 이제 호출하네요. '복잡한 걸 해줘'라는 요청 때문에 실행했던 '말하기' 대신
00:12:58'호출'이라는 기능이 실행된 게 보이죠? 방금 말을 했고요. 이제는 뭔가
00:13:03동작을 시도하려고 했어야 할 것 같아요. 무언가를 하려다가 떨어져 버렸네요.
00:13:08예전에 꽤 멋진 춤을 추는 걸 본 적이 있어요. 이런 독특한 춤 동작 말이죠. 하지만 얘도 자기만의 고집이
00:13:15있어요. 그쵸? 자, 이 내부에서는 어떤 일들이 일어나고 있을까요? 몇 가지가 있습니다. 첫 번째로는
00:13:21이걸 활용할 수 있다는 점입니다. 얘를 만드는 이유가 뭘까요? 제 데이터셋을 구축하는 데 쓸 수 있어요. 제가 직접
00:13:28수동으로 조작할 수도 있기 때문에, 원하는 방향으로 이동시키면서
00:13:33훈련 에피소드를 만들 수 있죠. 그리고 제가 던지는 질문에 얘가 어떻게 반응하고 어떻게
00:13:40추론하는지에 대한 정보를 얻을 수 있습니다. 이건 제가 더 나은 성능을 내도록
00:13:46만드는 데 매우 유용한 정보가 됩니다. 이것이 전체 과정이자 실험의 한 부분입니다.
00:13:53즉, 자율성을 부여하고 여러 작업을 시키면서 더 많은 데이터를 수집하는 것이죠. 그 외에도 이것은 제
00:14:03통합 시스템입니다. 내부적으로는, 여러분의 하니스 SDK인 스트랜즈 에이전트들이
00:14:10현재 앤스로픽 클로드 오푸스 4.8을 브레인으로 사용하고 있습니다. 그것이 바로 두뇌인 셈이죠. 그리고 이건
00:14:16제가 무엇을 해야 하는지 지시하는 간단한 시스템 프롬프트입니다. 모든
00:14:23규칙들을 알려주고 있죠. 또한 이미 가지고 있는 모든 규칙들에 접근할 수 권한도 부여했습니다. 즉, 각각의
00:14:29규칙이 어떤 용도로 쓰이는지 알려주는 식입니다. 그래서 스트랜즈가 제가 요청하는 작업에 맞춰 어떤 도구를 호출할지 결정하게 됩니다.
00:14:36사용하는 음성은 오픈AI 리얼타임의 음성입니다. 그리고 제대로 동작할 수 있도록
00:14:44안전 장치나 가이드라인 같은 추가적인 정보도 부여해 두었습니다. 자, 이렇게 에이전트가 두 개 있고요.
00:14:51또 한 가지 할 수 있는 일은 텔레그램으로 저와 대화하는 것입니다. 이게 정말 놀라운 게, 집에 없을 때도
00:14:59얘와 대화하고 싶을 때 이렇게 말할 수 있죠.
00:15:04헤이 스카우트, 뒤돌아서 회전하고 분석해 봐—떨어지지 말고. 방을 분석하고
00:15:17누가 제일 인물이 좋은지 말해줘. 이건 늘 성공할 수도 있고 아닐 수도 있어요. 스카우트가
00:15:26편파적으로 변한다고 저를 원망하진 마세요. 이걸 가지고 놀아보는 게 백설공주와
00:15:31왕비가 “거울아, 거울아, 세상에서 누가 제일 예쁘니?”라고 묻는 것 같아서 이렇게 해봤거든요. 자, 스트랜즈가
00:15:37어떤 대답을 내놓는지 볼까요? '하하, 알겠어요'라고 하네요. 방을 스캔하기 위해 몸을 회전하고 있어요. 돌고 있나요?
00:15:42돌고 있죠. 뭘 보고 있는지 볼까요? 여전히
00:15:47무대를 보고 있네요. 이게 다른 거울이에요. 저를 보고 있어요. 안녕. 내가 제일 예뻐? 오, 과찬이십니다.
00:15:54하지만 아니죠. 한 번 더 돌아줘요. 조금만 더 회전해 주세요. 더 돌지 않기로 결정했나 봐요. 뭐라고 하는지 들어봅시다.
00:16:06회전 완료. 방에 대한 제 분석 결과입니다. 제 화면 보이시죠? 화면을 확대할 방법이 없네요.
00:16:12총 여섯 일곱 명 정도가 보입니다. 밝은 무대 우측 근처 정면 앞쪽에 몇 명이 앉아 있고,
00:16:19객석에 몇 명이 더 있네요. 무대 위에는 어두운 의상을 입은 사람이 한 명 있습니다. 멋진 청바지에
00:16:25운동화를 신었군요. 대단히 감사합니다. 아, 아니 아니 아니. 내 앞에 있는 사람 말이에요. 청바지에 운동화를 신은 사람.
00:16:31무대 위에서 분명 목적을 가지고 걷고 있군요. 누가 제일 잘생겼냐고요? 솔직히 제 낮은 앵글의 시선으로는 구별하기 힘들지만,
00:16:39지금 무대 위에 있는 분은 자신감 넘치는 발걸음과 극적인
00:16:45파란색 커튼 배경 덕분에 스타일 점수를 드리고 싶습니다. 대단히 감사합니다. 자신감이 필요할 때마다 방에 혼자 남아
00:16:51이 친구에게 세상에서 누가 제일 예쁘냐고 물어볼 수 있겠어요. 그럼 이 친구는 언제나 저를
00:16:58정답으로 선택해 줄 테니까요. 대단히 감사합니다.
00:17:09정말 감사합니다.

핵심 요약

스트랜즈 에이전트와 클로드 오푸스 4.8 기반의 멀티 에이전트 아키텍처를 적용하면 단 5줄의 코드로 로봇에 자연어 이해 및 자율 판단 능력을 부여할 수 있다.

하이라이트

  • 라스베이거스나 뉴욕 등 원격지에 위치한 라즈베리 파이와 4G SIM 카드 연결을 통해 로봇이 자연어 명령을 실시간으로 수신하고 처리한다.

  • AWS 오픈소스 프레임워크인 스트랜즈 에이전트를 활용하면 단 5줄의 코드만으로 로봇 하드웨어 도구를 에이전트에 연결할 수 있다.

  • 싱커 에이전트, 통신 에이전트, 음성 에이전트 등 3개의 스트랜즈 기반 에이전트가 동시에 작동하여 주변 환경을 평가하고 대화를 수행한다.

  • 스트랜즈 패키지는 8개 카테고리에 걸쳐 40개가 넘는 서로 다른 로봇을 지원하며 앤스로픽 클로드 오푸스 4.8을 브레인으로 사용한다.

  • 클라우드와 엣지 환경을 모두 활용하는 하이브리드 모델 구조를 통해 방대한 훈련 데이터를 처리하면서도 런타임 시 빠른 실행 속도를 유지한다.

타임라인

자연어 기반 로봇 제어와 원격 연결 구조

  • 스카우트 로봇은 자연어 지시를 이해하고 헤드라이트 켜기나 360도 회전 등의 행동을 수행한다.
  • 뉴욕시에 위치한 라즈베리 파이에 4G SIM 카드를 연결하여 원격으로 신호를 송수신한다.
  • 로봇은 주변 환경을 인식하고 관객 수나 무대 상황에 관한 질문에 스스로 대답할 수 있다.

전통적인 사전 프로그래밍 방식과 달리 로봇에 두뇌를 부여하여 스스로 생각하고 행동하도록 만든다. 4G 연결을 통한 원격 통신으로 무대 위에서 실시간 대화와 물리적 동작을 동시에 처리하는 과정을 시연한다.

스트랜즈 에이전트 아키텍처와 5줄 코드 구현

  • AWS 오픈소스 프레임워크인 스트랜즈 에이전트를 통해 LLM 레이어와 로봇 하드웨어 도구를 연결한다.
  • 단 5줄의 코드를 통해 로봇 도구를 에이전트에 호출하고 지정할 수 있다.
  • 싱커 에이전트, 통신 에이전트, 음성 에이전트 등 3개의 에이전트가 동시에 구동되어 주변을 평가하고 대화를 나눈다.

전통적인 소프트웨어 도구처럼 로봇 하드웨어를 AI 에이전트에 연결하는 방식을 설명한다. 3개의 에이전트가 각각 사고, 통신, 음성 인식을 나누어 담당하며, 텔레그램과 웹앱 연동을 통해 사용자와 자연스럽게 상호작용한다.

4레이어 구조와 엣지-클라우드 하이브리드 모델

  • 에이전트 레이어, 정책 제공자, 백엔드 인터페이스, 물리적 하드웨어의 4가지 레이어로 시스템이 구성된다.
  • 클라우드 환경에서 VLA와 정책을 훈련하고 엣지 환경에서 빠르게 실행하는 하이브리드 모델을 사용한다.
  • 로봇은 스스로 일어나는 등의 물리적 회복 능력을 갖추고 대규모 언어 모델의 발전에 발맞추어 진화한다.

시스템 내부의 4레이어 구조를 분석하여 명령 입력부터 백엔드 실행까지의 흐름을 설명한다. 클라우드의 대규모 훈련 능력과 엣지의 빠른 런타임 속도를 결합하여 로봇의 자율성과 효율성을 극대화한다.

텔레그램 연동과 방 분석 실습 데모

  • 앤스로픽 클로드 오푸스 4.8을 브레인으로 사용하고 오픈AI 리얼타임 음성 모델을 연동한다.
  • 텔레그램을 통해 원격지에서도 로봇에게 방을 스캔하고 분석하도록 지시할 수 있다.
  • 로봇은 시각 정보를 분석하여 주변 인물의 옷차림과 특징을 자연어로 설명한다.

실제 구동 화면과 텔레그램 연동을 통해 로봇이 원격 명령을 수행하는 모습을 보여준다. 클로드 오푸스 4.8을 두뇌로 삼아 방 안의 인물을 인식하고 스타일을 평가하는 등 고차원적인 상호작용 결과를 입증한다.

커뮤니티 글

모든 글 보기