Pinecone 2.0 — 에도 리버티(Edo Liberty), 파인콘(Pinecone)

AAI Engineer
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00인터페이스에 대해 말씀드리자면, 이걸 작동하게 만드는 멋진 아이디어가 정말 많지만
00:00:06그중 딱 하나만 이야기해 드리고 싶습니다. 지금 보고 계신 것은
00:00:11Nexus의 인터페이스입니다. 맨 위에는 에이전트가
00:00:17제시한 질문이 보이고, 왼쪽에는 거쳐 온
00:00:23다양한 단계들이 보입니다. 오른쪽 아래에 있는 게 아마 가장 흥미로울 텐데요,
00:00:28오른쪽 아래에서 생성된 코드가 보입니다. Nexus가 하는 방식은 매우 다른데,
00:00:34다른 시스템과는 완전히 다릅니다. 저희는 이걸 런타임 코딩 에이전트라고 부릅니다.
00:00:40기존에 익숙하신 다른 코딩 시스템처럼 거대한 코드베이스를 받아서
00:00:49수정을 도와주는 방식과는 다릅니다. 보통 수정이 끝나면 하나의 소프트웨어가 완성되고
00:00:55그것이 배포되며 산출물이 되죠. 그리고 실행되는 프로그램에는
00:01:00더 이상 모델이 포함되지 않고 코드만 남게 됩니다. 하지만
00:01:05여기서는 그런 방식이 아닙니다. 쿼리 시점에 엔젠이 기본적으로
00:01:10Jupyter Notebook이나 Python 저장소 같은 것을 구축한다고 생각하시면 됩니다.
00:01:16그리고 실제로 코드를 작성하고 실행하며, 다시 코드를 쓰고 실행합니다. 답을 얻으면
00:01:20어떻게 처리할지 알게 되고, 만약 예상과 다른 결과가 나오면
00:01:24해당 코드 부분을 다시 작성합니다. 그리하여 최종적으로 얻게 되는 것은
00:01:30작업을 완료하고 원하는 정보를 가져오는 하나의 코드 조각입니다.
00:01:36저장도 가능하고 재실행도 가능하죠. 게다가 믿기지 않을 정도로 유연합니다.
00:01:42이제 답변을 데이터베이스 쿼리로 얻는 것이 아니라,
00:01:50당연히 엄청나게 유연한 코드로 직접 작성해내기 때문입니다. 참고로 이 코드는
00:01:57흥미롭게도, 이런 방식으로 소프트웨어를 작성하면 필요로 하는
00:02:05프롬프트의 양이 획기적으로 줄어듭니다. 에이전트에게 필요한 모든 툴링을 제공하기 위해
00:02:08약 15만 토큰이 필요했던 것에서,
00:02:12Nexus에서 정보를 추출하는 데 필요한 인터페이스를 명시하기 위한 토큰이
00:02:161,000토큰 미만으로 줄어들었습니다. 그래서 실제로 실행했을 때
00:02:23어떤 식으로 작동하는지 보여드리겠습니다. 왼쪽에는 물론
00:02:29no QL이 적용된 Nexus가 질문에 답변하고 있고, 오른쪽은 같은 작업이
00:02:38작업 완수를 위한 모든 툴링을 갖춘 에이전트에게 주어진 모습입니다.
00:02:43하지만 오른쪽은 상당한 불이익을 안고 있습니다. 첫 출근한 직원처럼
00:02:48많은 내용을 읽어야 하고, 데이터가 어디 있는지 찾아야 하며
00:02:51작업이 무엇인지 파악하고 수많은 코드를 직접 작성해야 합니다.
00:02:55매우 불리한 조건이죠. 방금 멈췄는지는 모르겠지만,
00:03:02말할 것도 없이 이 방식이 훨씬 느리고, 토큰 소비 측면에서도
00:03:08훨씬 비용이 많이 듭니다. 하지만 흥미롭게도 정확도 역시
00:03:12훨씬 떨어집니다. 적절한 컨텍스트와 올바른 목표가 없기 때문입니다.
00:03:17여러분의 기업에서도 마찬가지일 것입니다. 저희는 이미 수많은
00:03:25얼리 액세스 고객들과 협력하고 있으며, 몇 가지 결과를 보고 계시지만 굵직하게 언급하고 넘어가자면
00:03:30다양한 도메인, 다양한
00:03:35기업, 그리고 다양한 종류의 작업 전반에 걸쳐 예외 없이 동일한
00:03:40결과를 확인하실 수 있습니다. 이 패러다임으로 전환하면 상당한 비용 절감 효과를 얻게 되며, 77~90%
00:03:50수준의 토큰 감소는 흔하게 일어납니다. 또한 처리 속도도
00:03:5820~30%에서 때로는 77%까지 훨씬 빨라집니다.
00:04:07그리고 가장 중요한 점은, 동시에 실제 정확도도
00:04:11훨씬 더 높아진다는 사실입니다. 그야말로 확실한 성공인 셈이죠. 마지막으로
00:04:20Nexus가 얼리 액세스를 마치고 바로 내일 퍼블릭 프리뷰로 출시되니 꼭 이용해 보시길 바라며 마치겠습니다.
00:04:50감사합니다.

핵심 요약

Nexus는 쿼리 시점에 코드를 직접 작성 및 실행하는 런타임 코딩 방식을 통해 프롬프트 토큰을 90% 절감하고 처리 속도와 정확도를 대폭 향상시킨다.

하이라이트

  • Nexus는 기존과 달리 쿼리 시점에 Python 저장소 환경을 구축하고 코드를 직접 작성·실행하는 런타임 코딩 에이전트 방식을 사용한다.

  • Nexus 인터페이스 적용 시 에이전트에 필요한 프롬프트 양이 기존 15만 토큰에서 1,000토큰 미만으로 급감한다.

  • 새로운 패러다임 적용을 통해 전체 토큰 소비량을 77%에서 최대 90%까지 절감할 수 있다.

  • 작업 처리 속도는 최소 20%에서 최고 77%까지 향상된다.

  • 토큰 사용량 단축과 속도 향상 외에도 컨텍스트와 목표 명확화를 통해 응답 정확도가 상승한다.

타임라인

런타임 코딩 에이전트 Nexus의 작동 방식과 프롬프트 감축

  • Nexus는 거대한 코드베이스를 수정 후 단일 소프트웨어로 배포하는 기존 코딩 에이전트와 구조가 다르다.
  • 쿼리 시점에 Python 환경을 구축해 코드를 작성, 실행, 수정하는 과정을 거쳐 최종 실행 코드를 생성한다.
  • 에이전트 인터페이스 명시화로 기존 15만 토큰에 달하던 필요 프롬프트 양을 1,000토큰 미만으로 줄인다.

배포 후 모델이 제거되는 기존 방식과 달리 Nexus는 쿼리 시점에 실행 환경을 생성한다. 원하는 답을 얻을 때까지 스스로 코드를 수정하며 작동하므로 재실행 가능한 코드 조각을 결과물로 얻게 된다. 데이터베이스를 단순 조회하는 대신 유연한 코드를 직접 생성하기에 프롬프트 토큰 사용량이 획기적으로 줄어든다.

기존 에이전트 방식과의 성능 및 비용 비교 분석

  • 모든 툴링을 탑재한 기존 에이전트는 데이터 탐색과 코드 작성 과정에서 큰 비용 손실이 발생한다.
  • 기존 방식은 처리 속도가 느리고 많은 토큰을 소비한다.
  • 명확한 컨텍스트 부재로 인해 기존 방식의 답변 정확도가 대폭 떨어진다.

no QL 기반 Nexus와 기존 툴링 탑재 에이전트를 비교하면 기존 방식은 첫 출근한 직원처럼 과도한 정보를 탐색해야 한다. 이로 인해 작업 수행 속도가 느려지고 토큰 비용이 상승한다. 목표 지점과 컨텍스트가 명확하지 않은 기존 방식은 결과적으로 답변의 정확도마저 크게 저하된다.

Nexus 도입 효과 및 퍼블릭 프리뷰 일정

  • 다양한 도메인과 기업 실증에서 77%~90%의 토큰 절감률을 기록한다.
  • 작업 처리 속도가 20%에서 최대 77%까지 빨라진다.
  • Nexus는 얼리 액세스 단계를 마치고 퍼블릭 프리뷰로 정식 전환된다.

다양한 분야의 얼리 액세스 기업 검증을 거친 결과 모든 항목에서 일관된 성능 향상이 나타난다. 비용 단축과 속도 향상뿐만 아니라 실제 정확도 측면에서도 상승 결과가 도출된다. 퍼블릭 프리뷰 전환을 통해 보다 넓은 사용자 환경을 지원한다.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기