Beri saya 9 menit untuk menunjukkan alasan Anda benar-benar tidak boleh meremehkan Jev

MMaximilian Schwarzmüller
컴퓨터/소프트웨어창업/스타트업AI/미래기술

스크립트

00:00:00Beberapa jam lalu, model AI baru baru saja dirilis, dan saya benar-benar percaya ini bisa menjadi pengubah permainan.
00:00:07Saya tahu, saya tahu kita mendapatkan model baru hampir setiap minggu, tetapi saya tidak sedang membicarakan
00:00:13Large Language Model baru di sini. Sebaliknya, saya membicarakan JEFF dari TypeSafe AI, dan saya tahu ini terdengar
00:00:19seperti asisten pribadi seperti Grokbot, seperti JEFF, bukan? Dan TypeSafe AI terdengar
00:00:25seperti pustaka TypeScript, tetapi bukan itu masalahnya. Ini adalah jenis model AI baru, ini bukan
00:00:31Large Language Model, tetapi sepertinya model yang cukup pintar, dan memberikan sesuatu yang biasanya hanya bisa diberikan
00:00:39secara terbatas oleh Large Language Model. Dan agar tidak salah paham sejak awal, video ini sama sekali tidak
00:00:44disponsori. Anda bisa membuka situs web mereka di typesafe.ai, dan di sana Anda bisa
00:00:51bergabung dengan daftar tunggu. Saya melakukan itu seperti orang lain kemarin malam waktu Jerman, dan saya mendapatkan akses
00:00:56pagi ini, jadi inilah saya sekarang. Lalu, apa sebenarnya ini? Ide utamanya adalah Anda memiliki model yang bukan untuk
00:01:04menghasilkan teks, melainkan dapat memahami teks. Anda bisa memasukkan teks apa pun yang Anda inginkan, lalu memberikan beberapa
00:01:12pilihan. Misalnya, ini contoh dasarnya: saya memiliki beberapa contoh teks, dan itu bisa berupa email atau
00:01:21pesan obrolan dari pelanggan, bukan? Anda punya layanan obrolan di situs web Anda, tempat pelanggan dapat mengirim pesan,
00:01:28dan bisa jadi pesannya seperti ini. Lalu Anda ingin menentukan apa yang harus dilakukan dengan pesan tersebut. Tentu saja,
00:01:34Anda bisa menyalurkannya melalui Large Language Model, tetapi ada beberapa masalah. Pertama, Prompt Injection.
00:01:40Masalah kedua, harganya bisa cukup mahal karena Anda memerlukan model yang relatif pintar. Jadi,
00:01:48Anda akan membakar banyak token di sana, karena harus meneruskan semua deskripsi alat ke model tersebut,
00:01:54dan memasukkan beberapa informasi tambahan ke model, termasuk pesan pelanggan tentu saja.
00:02:00Anda pun akan membakar token sepanjang prosesnya. Dan ketiga, performanya relatif lambat, bukan? Large Language Model tingkat teratas
00:02:06membutuhkan waktu untuk merespons. JEFF justru sangat cepat; kita berbicara dalam hitungan milidetik
00:02:12di sini. Ini tidak berjalan di mesin Anda, melainkan masih di cloud, tetapi sangat cepat. Dan konsepnya adalah
00:02:18Anda memberikan pesan tersebut kepada JEFF. Di sini, “ask JEFF” ini sebenarnya hanya saya yang menggunakan klien ini dan berbicara dengan AI.
00:02:26Jadi Anda memberikan pesan itu padanya, dan Anda bahkan bisa memasukkan data terstruktur yang lebih kompleks. Jadi tidak
00:02:32harus sekadar string, lalu Anda memberikan informasi tentang apa yang harus dilakukan dengan
00:02:39pesan tersebut. Tepatnya, Anda memberikan pertanyaan Anda padanya, dan ada tiga jenis pertanyaan:
00:02:46Choices, Scoring, dan Now. Nah, Choices itu persis seperti kedengarannya: Anda memberikan beberapa opsi,
00:02:53lalu model AI memberikan tingkat keyakinan tentang pilihan atau opsi mana yang paling tepat.
00:02:58Scoring berarti Anda membiarkan model memberikan penilaian: Anda menentukan beberapa
00:03:02tingkatan, dan model membuat skor berdasarkan tingkatan tersebut. Sedangkan Now adalah pertanyaan ya atau tidak.
00:03:10Jadi pada contoh dasar ini, misalnya, saya menerima beberapa pesan pengguna, lalu membagikannya ke model.
00:03:15Di sini saya mendefinisikan pertanyaan saya. Pertanyaan pertama adalah tim mana yang harus menangani pesan ini, dan saya
00:03:21memberikan tiga opsi. Ini sepenuhnya terserah Anda, jadi Anda bisa mendefinisikan apa pun yang dibutuhkan di sini.
00:03:26Anda bisa menambahkan lebih banyak opsi, sepertinya hingga 10 untuk saat ini, dan Anda menjelaskan tugas setiap opsi. Jadi
00:03:33saya punya tim penagihan, dan saya memperjelas bahwa tim ini bertugas menangani biaya, faktur, dan sebagainya.
00:03:38Saya juga punya beberapa tim lain di demo ini. Jadi itulah pertanyaan pertama yang saya kirimkan ke JEFF berdasarkan
00:03:44pesan pelanggan tersebut. Namun itu belum semuanya, karena Anda dapat mengajukan beberapa pertanyaan dalam satu putaran.
00:03:49Kita bisa memiliki beberapa pertanyaan pilihan, tetapi di sini saya ingin menunjukkan satu dari setiap kategori. Jadi saya punya satu pertanyaan
00:03:53pilihan, dan satu pertanyaan jenis Now untuk menanyakan “Apakah pesan ini mengekspresikan urgensi?”. Kita akan menyalurkan ketiga
00:04:00pesan melalui pertanyaan ini agar bisa melihat tingkat urgensi setiap pesan. Jenis pertanyaan ketiga
00:04:07yang saya kirimkan di sini adalah pertanyaan penilaian (scoring), tempat saya ingin mengetahui seberapa frustrasi pelanggan tersebut.
00:04:11Jika saya menjalankannya di sini seperti ini, kita dapat melihat ini tereksekusi dengan sangat cepat.
00:04:20Pesan ini dikirim ke cloud ke model AI dan diproses semuanya, tetapi tidak ada Large Language Model
00:04:25yang terlibat. Sebaliknya, Anda dapat melihat untuk pesan pelanggan pertama di sini, pilihannya adalah bahwa
00:04:30tim teknis yang harus menanganinya, dengan tingkat keyakinan yang dibuat secara otomatis oleh JEFF.
00:04:36Untuk pertanyaan ya/tidak apakah ini mendesak: ya, ini cukup mendesak. Di sini kita memiliki skor yang sangat yakinkan,
00:04:42hampir 1, bahwa ini mendesak, dan tingkat frustrasinya cukup tinggi seperti yang bisa kita lihat. Pertanyaan kedua
00:04:49adalah bahwa kita ditagih dua kali dan menginginkan pengembalian dana segera. Jadi itu harus disalurkan
00:04:56ke tim penagihan. JEFF memutuskan bahwa ini agak mendesak dan tingkat frustrasinya juga lumayan tinggi. Lalu
00:05:03pertanyaan ketiga adalah untuk tim penjualan, tidak mendesak, dan tidak ada rasa frustrasi di sana.
00:05:09Seperti yang bisa Anda lihat, atau setidaknya apa yang saya lihat di sini, ini bisa sangat berguna. Kita bisa membangun ini
00:05:18menggunakan Large Language Model, tetapi saya sudah memaparkan apa kekurangannya. Pendekatan ini cepat dan sangat
00:05:24murah. Kita harus membicarakan harga: ini berbiaya 42 dolar per satu miliar—miliar, bukan juta seperti model lainnya—
00:05:33token input, dan token output-nya gratis! Token output tidak dikenakan biaya apa pun. Jadi ini jauh lebih
00:05:40murah daripada semua Large Language Model tersebut. Anda dapat mengirim banyak pertanyaan kompleks ke JEFF dan itu hampir tidak memakan biaya
00:05:49apa pun. Dan sekali lagi, token output sama sekali tidak membebani biaya. Performa ini sangat cepat dan memang dirancang khusus
00:05:56untuk pengambilan keputusan ini. Dan jika Anda memikirkannya—inilah alasan saya sangat antusias tentang ini—jika Anda
00:06:02memikirkannya, sebagian besar dari apa yang kita bangun berujung pada pengambilan keputusan. Setiap AI agent yang Anda buat penuh dengan
00:06:08keputusan: kapan harus memanggil alat tertentu, semuanya adalah keputusan. Seperti yang saya sebutkan, Anda tentu bisa menggabungkannya
00:06:15dengan Large Language Model. Di sini saya punya contoh lain tempat saya membangun asisten, dan di sana saya punya
00:06:22beberapa pemanggilan alat yang sangat sederhana di mana kita katakanlah ini adalah asisten rumah tangga untuk
00:06:29mematikan atau menyalakan lampu di ruangan tertentu. Jadi itu adalah fungsi dummy/alat dummy untuk
00:06:35hal itu. Namun kita mungkin juga ingin memakai Large Language Model untuk tugas tertentu, karena sekali lagi, JEFF tidak bisa
00:06:42menyusun teks. Jadi setiap kali Anda ingin menghasilkan teks, misalnya balasan email untuk pelanggan atau semacamnya,
00:06:48Anda perlu melibatkan Large Language Model, dan Anda bisa melakukannya. Di sini saya menggunakan Large Language Model
00:06:54menggunakan AI SDK dari Vercel. Saya memakai GPT-4.5 Turbo dengan tingkat pemikiran menengah, jadi
00:07:02relatif terjangkau. Kemudian saya membiarkan JEFF membuat pilihan tentang alat mana yang akan digunakan. Sekali lagi, itu JEFF, bukan
00:07:10Large Language Model. Lalu saya mengeksekusi alat-alat itu; pada beberapa alat, Large Language Model digunakan,
00:07:15sementara di alat lainnya tidak. Dan itulah bagian yang luar biasa: kita membangun sistem tempat kita
00:07:21harus membuat keputusan setiap saat, di mana kita perlu memberi skor atau menjawab pertanyaan ya dan tidak sepanjang
00:07:26waktu. Dan saat ini kita sering menggunakan Large Language Model untuk tugas-tugas tersebut. Mereka memang
00:07:31bagus, jangan salah paham. Salah satu keunggulan yang pasti masih mereka miliki adalah misalnya context window.
00:07:36Dokumentasinya menyebutkan batas sekitar 32.000 token teks yang dapat Anda masukkan dalam
00:07:45pertanyaan Anda di sini. Jadi Anda memiliki keterbatasan seperti ini. Di dalam dokumentasi juga ada seluruh artikel tentang
00:07:50keterbatasan model tercanggih mereka saat ini, di mana model ini kurang baik dalam matematika atau angka, misalnya perbandingan
00:07:56tanggal dan waktu. Jadi ada aspek-aspek yang memang belum optimal. Pertama, saya berharap seperti semua model AI
00:08:05lainnya, kemampuannya akan meningkat di masa mendatang dan masalah ini dapat teratasi. Selain itu, sekali lagi, ini bukan tentang pilih salah satu;
00:08:12ini adalah pelengkap. Ini bisa menjadi alat tambahan yang bagus di samping Large Language Model. Jika
00:08:18performanya sama lambat dan mahalnya, saya tidak melihat adanya manfaat yang berarti, tetapi dengan
00:08:24keunggulan yang ditawarkannya, ini terlihat sangat menjanjikan. Sekarang kita harus melakukan pengujian jangka panjang, melihatnya dalam
00:08:32lingkungan produksi, dan pada kasus penggunaan yang lebih kompleks untuk mengevaluasi apakah model ini sangat rentan terhadap kesalahan, atau mungkin sangat
00:08:40rentan terhadap Prompt Injection atau hal sejenisnya, serta apakah model ini mengalami masalah seperti itu. Namun sejauh ini kelihatannya
00:08:47sangat berguna. Tidak seperti kehebohan tren subkuadratik yang terjadi beberapa bulan
00:08:53lalu, ini adalah sesuatu yang benar-benar bisa Anda gunakan dan uji. Ini tersedia sekarang, setidaknya jika Anda mendapat akses.
00:08:57Anda bisa mendaftar ke daftar tunggu, dan bagi saya prosesnya hanya memakan waktu beberapa jam. Kelihatannya benar-benar
00:09:03berguna. Saya pikir kita bisa membangun program dan sistem yang sangat luar biasa dengan menggabungkan JEFF dengan pemrograman tradisional,
00:09:12yaitu kode deterministik biasa, lalu dipadukan dengan Large Language Model, untuk membuat hal-hal yang benar-benar menakjubkan
00:09:20dari semua itu. Ya, saya harap ini menjadi gambaran umum awal yang baik tentang apa itu JEFF. Daftarkan diri Anda ke
00:09:27daftar tunggu jika ingin mencobanya sendiri, lalu pelajari lebih dalam dan mulailah bereksperimen!

핵심 요약

JEFF dari TypeSafe AI menawarkan alternatif efisien non-LLM seharga 42 dolar per miliar token input untuk menangani tugas klasifikasi, scoring, dan pemanggilan fungsi dengan kecepatan milidetik.

하이라이트

  • JEFF dari TypeSafe AI adalah model pemaham teks non-LLM yang berfokus pada pengambilan keputusan dengan waktu respons hitungan milidetik.

  • Biaya penggunaan JEFF berada di angka 42 dolar per satu miliar token input, sementara token output disediakan secara gratis tanpa biaya.

  • Model JEFF mendukung tiga jenis format pertanyaan: Choices (opsi hingga 10 pilihan), Scoring (penilaian tingkatan), dan Now (pertanyaan ya/tidak).

  • Kapasitas context window JEFF dibatasi hingga 32.000 token teks dan saat ini memiliki keterbatasan pada operasi matematika serta perbandingan tanggal.

  • Penggunaan JEFF dapat dipadukan dengan LLM seperti GPT-4.5 Turbo melalui Vercel AI SDK untuk menangani routing fungsi sebelum generasi teks dilakukan.

타임라인

Pengenalan Arsitektur Pemaham Teks JEFF

  • TypeSafe AI merilis JEFF sebagai kategori model AI pemaham teks dan bukan sebagai Large Language Model generator.
  • Proses klasifikasi data teks pelanggan via LLM tradisional terhalang oleh kendala Prompt Injection, pemborosan token deskripsi alat, dan latensi tinggi.

Penggunaan LLM untuk tugas klasifikasi sederhana membutuhkan pengiriman deskripsi sistem dan instruksi alat yang membakar token input secara berulang. Latensi respons LLM juga memperlambat alur kerja otomatisasi. JEFF hadir untuk mengatasi keterbatasan ini dengan memproses teks input langsung di cloud tanpa memuat beban sintesis bahasa.

Tiga Mekanisme Evaluasi dan Struktur Pertanyaan

  • Sistem evaluasi JEFF terbagi menjadi tiga opsi pertanyaan: Choices, Scoring, dan Now.
  • Format Choices mendukung hingga 10 opsi pemetaan tugas beserta nilai keyakinan (confidence score) otomatis.
  • Skema evaluasi dapat mengeksekusi analisis tim tujuan, tingkat urgensi, dan skor frustrasi pelanggan secara bersamaan dalam satu siklus panggil.

Pengujian pada pesan layanan pelanggan menunjukkan kemampuan JEFF dalam memilah rute penanganan ke tim teknis, penagihan, atau penjualan secara instan. Pada pesan mengenai masalah tagihan ganda, model memberikan skor indikasi urgensi mendekati nilai 1 serta tingkat frustrasi tinggi. Seluruh parameter evaluasi dikembalikan dalam bentuk data terstruktur tanpa memunculkan karakter teks bebas.

Struktur Biaya dan Penggabungan dengan LLM

  • Biaya pemrosesan JEFF dipatok sebesar 42 dolar per satu miliar token input tanpa memungut biaya untuk token output.
  • JEFF berfungsi sebagai pengambil keputusan alur kerja sebelum memanggil LLM untuk tugas generasi teks.
  • Penggabungan dilakukan menggunakan Vercel AI SDK bersama GPT-4.5 Turbo untuk menangani respons akhir ke pengguna.

Sebagian besar arsitektur AI agent berorientasi pada logika logika penentuan keputusan seperti kapan harus memanggil fungsi tertentu. Pemisahan peran antara JEFF sebagai pengambil keputusan dan LLM sebagai penyusun kalimat menekan biaya operasional secara drastis. Pemanggilan alat fisik seperti sakelar lampu rumah tangga diatur sepenuhnya oleh JEFF tanpa membebankan pembuatan instruksi ke LLM.

Batasan Teknis dan Potensi Integrasi Sistem

  • Dokumentasi resmi mencatat batas batasan context window sebesar 32.000 token teks.
  • Model ini masih memiliki kelemahan pada kalkulasi angka dan pemrosesan urutan tanggal/waktu.
  • Kombinasi kode deterministik tradisional, JEFF, dan LLM membentuk struktur pemrograman sistem yang efisien.

JEFF dirancang bukan untuk menggantikan LLM sepenuhnya, melainkan bertindak sebagai komponen pelengkap dalam arsitektur perangkat lunak. Evaluasi jangka panjang pada lingkungan produksi masih diperlukan untuk menguji ketahanan model terhadap manipulasi prompt injection. Akses sistem saat ini dibuka melalui mekanisme daftar tunggu di platform TypeSafe AI.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기