스크립트
00:00:00نجح نموذج تحويل النص إلى كلام مفتوح الأوزان للتو في تفوقه على ElevenLabs في التحليل الاصطناعي.
00:00:05هذا هو نموذج Breeze.
00:00:07حجم التحميل هو 3 جيجابايت.
00:00:09وهو يعمل على جهاز MacBook الخاص بك، وإذا كنت تريد حقاً استخدام ما يولده للعمل،
00:00:13فمن المحتمل ألا يُسمح لك بذلك أصلاً.
00:00:15المشكلة ليست في أن النتائج سيئة للغاية.
00:00:17حسنًا، النتيجة جيدة نوعاً ما.
00:00:18إنها جيدة حقاً.
00:00:19لكن الترخيص الفعلي هو المشكلة.
00:00:21لذا أريد أن أريكم ما يمكن لـ Breeze فعله أولاً، ثم كيف يمكننا استخدامه حقاً.
00:00:30هذا هو نموذج Breeze TTS 2.
00:00:33تم إصداره لأول مرة في 25 أغسطس من قبل شركة تسمى Breeze Blue.
00:00:37الآن، نتائج الاختبار رائعة، لكن طريقة إنشاء الصوت أفضل بكثير.
00:00:41معظم نماذج تحويل النص إلى كلام المفتوحة اليوم تحتوي على استنساخ الأصوات.
00:00:45حيث تمنحها حوالي 10 ثوانٍ من الصوت المرجعي، وعادةً مع النص الدقيق المقابل له،
00:00:50وتحاول تلك النماذج تقليد ذلك الصوت.
00:00:52هذا يعمل بالطبع، لكننا نحتاج بوضوح إلى صوت مرجعي منذ البداية.
00:00:56أما نموذج Breeze فلا يحتاج إلى ذلك.
00:00:58عليك فقط وصف الصوت الذي تريد استخدامه بالفعل.
00:01:01لذا يمكن أن يكون الوصف شيئاً مثل
00:01:03رجل عجوز دافئ، حكيم ومفكر، ذو نبرة هادئة ومتأملة.
00:01:08فكر في مورجان فريمان.
00:01:09وهو يولد ذلك الصوت بناءً على الوصف وحده.
00:01:12لا يوجد تسجيل مرجعي.
00:01:14في الوقت الحاضر، يُعرف هذا بتصميم الأصوات،
00:01:16ونبدأ في رؤية المزيد والمزيد من النماذج الصوتية مفتوحة الأوزان
00:01:19بقدرات تتزايد تحسناً في مجال تصميم الأصوات.
00:01:23وهذا يملأ فراغاً حقيقياً في مجال تقنيات تحويل النص إلى كلام المفتوحة.
00:01:26نموذج Kokoro يمنحك أصواتاً مسبقة الضبط وثابتة.
00:01:29بينما نموذج Chatterbox يحتاج إلى صوت مرجعي.
00:01:31أما Breeze فيمكنه بناء الصوت من جملة واحدة.
00:01:34لذا دعنا نسمعه بأنفسنا.
00:01:35إذا كنت تستمتع بأدوات البرمجة التي تسرع سير عملك، فلا تنسَ الاشتراك.
00:01:39لدينا مقاطع فيديو تصدر طوال الوقت.
00:01:41تشغيل هذا النموذج يتم غالباً مباشرة داخل واجهة الأوامر الخاصة بي.
00:01:45لقد أنشأت بيئة افتراضية فقط، ثم قمت بتثبيت حزمة MLX audio عبر pip.
00:01:49هذا يعمل على جهاز Mac الخاص بي، ولهذا احتجت إلى MLX هنا.
00:01:53إذا كنت تستخدم نظام Linux أو تملك وحدة معالجة رسومية من NVIDIA،
00:01:56فستكون طريقة الإعداد مختلفة قليلاً، لكنها بنفس القدر من السهولة.
00:02:00لذا أنشأت نفس الجملة، وأقوم بتشغيلها هنا في واجهة الأوامر
00:02:03باستخدام تعليمات صوتية مختلفة.
00:02:05دعنا نشغل الصوت الأول.
00:02:06مرحباً بك في قناة BetterStack.
00:02:09لكل ما يتعلق بالتكنولوجيا والذكاء الاصطناعي، هل اشتركت حتى الآن؟
00:02:13والآن نفس الجملة تماماً مرة أخرى بنبرة مختلفة قليلاً.
00:02:19مرحباً بك في قناة BetterStack.
00:02:21لكل ما يتعلق بالتكنولوجيا والذكاء الاصطناعي، هل اشتركت حتى الآن؟
00:02:27كانت هاتان هما نفس الكلمات، لشخصين مختلفين تماماً، أو لنقل صوتين اصطناعيين.
00:02:33على الرغم من أن هذا يحتل مرتبة متقدمة، إلا أنه لا يزال بإمكاني تمييز أنه صوت اصطناعي، أليس كذلك؟
00:02:37إنه جيد إذاً.
00:02:38أداؤه لائق جداً، ومقدرة تحديد المشاعر متوفرة فيه بالفعل أيضاً.
00:02:42الآن يوجد إعداد واحد هنا يعد أساسياً لكل هذا، ويسمى مقياس CFG.
00:02:47وهو يتحكم في مدى دقة اتباع النموذج لوصف الصوت الخاص بك.
00:02:51إذا قمت بتقليله، سيبدأ النموذج في الانحراف مجدداً نحو صوت أكثر عمومية.
00:02:55الرقم أربعة هو الموصى به في وثائقهم، وهو ما أستخدمه هنا أيضاً لعدد من الأصوات.
00:03:00لكن دعني أخفض هذا القيمة إلى واحد سريعاً، فقط للحصول على صوت اصطناعي بحت.
00:03:05ها نحن ذا.
00:03:05مرحباً بك في قناة BetterStack.
00:03:08هذا الصوت يبدو اصطناعياً بوضوح.
00:03:10أنت تفهم ما أعنيه هنا، أليس كذلك؟
00:03:11لقد بدا صوتاً اصطناعياً بحتاً.
00:03:12لذا يمكنك الآن أيضاً إدراج أحداث صوتية مباشرة داخل النص، وهو أمر رائع حقاً.
00:03:18يمكنني كتابة ذلك حرفياً، ويمكنني وضع أقواس.
00:03:20يمكنني وضع كلمة تنهد وإغلاق تلك الأقواس.
00:03:23وفي النهاية، يمكنني وضع ضحك أو بكاء في منتصف الجملة، أو في نهايتها، أو في البداية.
00:03:28دعنا نسمع ذلك.
00:03:30عندما أُحاول أن أروي لك نكتة، لا أستطيع أن أتمالك نفسي من الضحك.
00:03:35هذا جزء من النص، وهي ميزة لطيفة.
00:03:38لكن العديد من النماذج الصوتية مفتوحة الأوزان تصدر بهذه الميزة الآن أيضاً.
00:03:42لذا اترك لك الحكم على مدى جودة صوت Breeze في الواقع.
00:03:46بالنسبة للذكاء الاصطناعي، هل هو جيد؟
00:03:47هل يستحق الترتيب الذي يحظى به حقاً؟
00:03:50الآن، تم بناء نموذج Breeze من مجموعة أجزاء قد تعرفها بالفعل.
00:03:54هيكل نموذج Qwen 3 يتعامل مع النمذجة اللغوية.
00:03:57وهناك مشفر نصوص T5 Gemma 2.
00:03:59بينما يتولى نموذج MIMI معالجة ترميز الصوت.
00:04:01يحتوي النموذج على حوالي 3 مليارات معامل، ويُخرج صوتاً أحادي القناة بتردد 24 كيلوهرتز.
00:04:07ولكن هناك تفصيل واحد هنا أريدك أن تتذكره.
00:04:09مجزئ الرموز الصوتي مأخوذ من Qwen 3 TTS، ونموذج Qwen 3 TTS مرخص برخصة Apache 2.0.
00:04:16إذن جزء من هذا النموذج مبني على عمل مفتوح حقيقي.
00:04:19ضع ذلك في اعتبارك، لأنه بعد دقيقة سيبدو الأمر مثيراً للسخرية بعض الشيء.
00:04:23ولكن أولاً، نحتاج إلى الحديث عن الادعاء الذي جعل نموذج Breeze يحقق شهرة واسعة.
00:04:27نموذج Breeze تفوق على ElevenLabs.
00:04:29نعم، لقد تفوقوا عليهم.
00:04:30هذا صحيح من الناحية الفنية، ولكن بناءً على المخرج الصوتي، لست متأكداً كيف حدث ذلك.
00:04:36وهنا أيضاً يصبح الأمر أكثر تعقيداً من مجرد قول ذلك.
00:04:40تُدير منصة Artificial Analysis ساحة تقييم صوتي تعتمد على تصويت بشري أعمى ومزدوج.
00:04:45إنها شركة تقييم مستقلة، وليست شركة Breeze Blue.
00:04:49على لوحة صدارة أصوات المزودين الخاصة بهم، يقع نموذج Breeze عند 1215 نقطة.
00:04:53هذه هي نقاط تقييم ELO.
00:04:54بينما نموذج المحادثة لـ 11 labs يقع عند 1210 نقطة.
00:04:57إذن نعم، من الناحية الفنية، لقد تفوقوا عليهم بخمس نقاط.
00:05:00نموذج Breeze يتفوق على ElevenLabs.
00:05:01حسناً، ولكن الآن، إذا تعمقت في هذا الأمر أكثر، تبدأ المشاكل في الظهور.
00:05:06أولاً، يمتلك نموذج Breeze أقل عدد من الأصوات بالقرب من القمة.
00:05:09حوالي 1200 صوت.
00:05:11بينما يمتلك نموذج 11 labs أكثر من 4500 صوت.
00:05:14لذا فإن نموذج Breeze لديه التقييم الأقل استقراراً في ذلك الجزء من اللوحة.
00:05:17وعادة ما تحصل النماذج الجديدة على دفعة ترحيبية بسيطة.
00:05:21ثانياً، نموذج Breeze ليس هو المركز الأول في الواقع.
00:05:24فنموذج Cartesia Sonic 3.6 يسجل 1282 نقطة.
00:05:27لذا فإن القول بأن Breeze يتفوق على الأنظمة الاحتكارية الرائدة صحيح من جانب واحد.
00:05:32وهو أيضاً أمر انتقائي للغاية.
00:05:33لكن المشكلة الثالثة هي الأساس في كل هذا.
00:05:36تلك لوحة الصدارة تسمح لكل نموذج باستخدام أصواته الخاصة.
00:05:39بينما تمتلك Artificial Analysis لوحة صدارة أخرى تُعطى فيها النماذج نفس النص الموجه تماماً.
00:05:45نفس الاختبار.
00:05:46وهي مقارنة عادلة تماماً ومباشرة.
00:05:49وهنا يختلف وضع نموذج Breeze تماماً.
00:05:51في ذلك التصنيف، يحقق 1002 نقطة.
00:05:54وهو في المركز الثالث بين النماذج مفتوحة الأوزان.
00:05:56والمركز السادس عشر من بين 39 نموذجاً إجمالاً.
00:05:59ويأتي خلف نموذج Vox Troll من Mistral.
00:06:01إذن نموذج Breeze جيد جداً لدرجة تنافس العديد من هذه النماذج.
00:06:04لكنه ليس المركز الأول.
00:06:05ويبدو أنه يكون جيداً بشكل خاص عندما يُسمح له باختيار الأصوات التي تتم مقارنتها.
00:06:10هذا يغير كيف يجب أن ننظر إلى هذا الأمر في الواقع.
00:06:13ولكن مع ذلك، لم يكن هذا أكبر أمر وجدته.
00:06:16المشكلة الكبرى في هذا كله هي الترخيص.
00:06:19وهذا هو الجزء الذي يتخطاه الكثير من الناس ببساطة.
00:06:22نعم، الشفرة البرمجية مرخصة برخصة Apache 2.0.
00:06:24لا توجد مشكلة هناك.
00:06:26أما الأوزان ليست كذلك.
00:06:27تستخدم الأوزان ترخيصاً يسمى ترخيص الأبحاث والاستخدام غير التجاري لـ Breeze Blue.
00:06:33وأريد استخدام صياغتهم الدقيقة هنا لأن هذا التمييز مهم بالفعل.
00:06:38ما سيقوله هذا الترخيص، وما ينصه بالفعل هو،
00:06:42تسمح هذه الاتفاقية بالأبحاث واللاستخدام غير التجاري لمواد النموذج مجاناً.
00:06:47وهي لا تمنح أي حقوق تجارية وليست ترخيصاً مفتوح المصدر.
00:06:52تلك هي كلماتهم.
00:06:53ليست ترخيصاً مفتوح المصدر.
00:06:55حسناً.
00:06:56أحياناً ترى عبارة “غير تجاري” على نموذج ما، وغالباً ما تعني لا تقم بإعادة بيع أوزاننا.
00:07:02نعم، حسناً.
00:07:02هذا منطقي.
00:07:04لكن ليس هذا ما يقوله هذا الترخيص.
00:07:05تعريفهم للغرض التجاري يتضمن استخدام الإنتاج،
00:07:09واستخدامه في منتج أو خدمة، أو استضافته خلف واجهة برمجة تطبيقات API.
00:07:13وهناك الجزء الذي يفرض قيوداً حقيقية هنا.
00:07:16وكأن ذلك لم يكن كافياً بالفعل،
00:07:17فإنه يشمل أيضاً استخدام المخرجات لأي عمليات داخلية تتجاوز نطاق التقييم المحدود.
00:07:23المخرجات ذاتها.
00:07:24حسناً، إذن ماذا يعني هذا في الواقع؟
00:07:26لا يقتصر الأمر على النموذج نفسه، بل يشمل حتى الصوت الذي يولده.
00:07:29وهذا الأمر برمته مستمر في فرض القيود.
00:07:31لا يوجد استثناء لصانعي المحتوى، ولا استثناء للشركات الصغيرة.
00:07:35ولا يوجد حد أدنى للعائدات المالية.
00:07:37لا يوجد شيء هنا.
00:07:38الكثير من التراخيص غير التجارية تترك بعض المساحات الرمادية.
00:07:42هذه الرخصة تبذل قصارى جهدها لمنع الكثير من ذلك.
00:07:45إذن، دعنا نجعل الأمر أكثر عملية الآن.
00:07:47متى يمكنك استخدام هذا؟
00:07:48هل تضع صوتاً مولداً من بريز داخل منتج ما؟
00:07:51كلا.
00:07:52لن يحدث ذلك.
00:07:53استخدامه في فيديو على يوتيوب يحقق ربحاً؟
00:07:56هذا الفيديو يحقق دخلاً.
00:07:58نعم، أممم.
00:07:58لن يحدث ذلك.
00:07:59في نوع ما من البودكاست؟
00:08:00مرة أخرى، لن يحدث ذلك.
00:08:02لذا، فهذا يحظر كل شيء تقريباً.
00:08:04تذكر الرخصة تحديداً عائدات الرعاية وعائدات الاشتراكات.
00:08:0934 دولاراً لكل مليون حرف بمجرد أن تبدأ الدفع مقابل هذا.
00:08:12ولكن حتى هناك، توضح الرخصة أمراً جلياً للغاية.
00:08:15الدفع مقابل واجهة برمجة التطبيقات لا يمنحك حقوقاً تجارية للنماذج المستضافة ذاتياً
00:08:19أو النتائج الصادرة عن نموذجهم المستضاف ذاتياً.
00:08:22وبمجرد أن تدرك ذلك، يصبح النظام بأكمله منطقياً للغاية.
00:08:25الأوزان المفتوحة هي النسخة التجريبية.
00:08:27واجهة برمجة التطبيقات هي منتجهم الأساسي.
00:08:30إذن، إلى أي مدى تعتبر تلك الأوزان المفتوحة قابلة للاستخدام في المقام الأول؟
00:08:33سأترك لك الحكم على ذلك.
00:08:34الآن، كان هذا رائعاً حقاً.
00:08:36الذكاء الاصطناعي الصوتي أمر رائع حقاً.
00:08:37لكنني قدمت تحليلاً مفصلاً لـ Vox CPM2 منذ فترة قصيرة.
00:08:41كان Vox CPM2 مذهلاً بصراحة.
00:08:43لقد كان مثيراً للإعجاب للغاية، وأعني ذلك حقاً.
00:08:45لذا، إذا قارنت بريز في مواجهة Vox CPM،
00:08:48فستخسر بريز هذه المعركة في لمح البصر.
00:08:50ويتعلق الأمر كله بتلك الرخصة.
00:08:52يا للروعة.
00:08:53لذا، إذا كنت تريد ذكاءً اصطناعياً صوتياً حقيقياً ومفتوحاً لاستنساخ الأصوات،
00:08:56فلا زلت أفضّل الالتزام بـ Vox CPM2.
00:08:58نظراً لأنه يحتوي على نفس ميزات بريز تماماً،
00:09:00وقد يكون أفضل منها أيضاً.
00:09:02هل يجب عليك استخدام بريز؟
00:09:03هذا هو السؤال.
00:09:04أعتقد أنني أجبت على ذلك، ولكن دعنا نلقي نظرة هنا.
00:09:06بالنسبة لتجربة الذكاء الاصطناعي الصوتي للمسليّة، نعم، يمكنك ذلك.
00:09:09من الرائع أن ترى إلى أين يتجه الذكاء الاصطناعي الصوتي.
00:09:12بريز جيد جداً، أليس كذلك؟
00:09:14اختبار النماذج أمر ممتع،
00:09:16خاصة وأنها تصبح أفضل فأفضل.
00:09:18إلى أين تتجه الأمور؟
00:09:19تصميم الأصوات بناءً على وصف نصي
00:09:21هو حقاً ميزة رائعة جداً.
00:09:23ولكن إذا كنت تطرح أي شيء تجاري،
00:09:25فلا تستخدم هذا.
00:09:26كنت لأستخدم شيئاً آخر،
00:09:27بغض النظر عن مكانة بريز في قائمة الترتيب.
00:09:30نموذج Kokoro مرخص برخصة Apache 2.0.
00:09:32ونموذج Chatterbox مرخص برخصة MIT.
00:09:34أما Vox CPM، فسنقوم بالتحقق منه،
00:09:35لأنه قد يسحقهم جميعا.
00:09:36لقد توقفت الأوزان المفتوحة والمصادر المفتوحة
00:09:38عن تعبيرهما عن نفس الشيء منذ فترة.
00:09:40تعلّم بريز يجعل هذا الاختلاف مستحيلاً على التجاوز.
00:09:43يخبرك معيار الأداء بما يمكن أن يفعله النموذج.
00:09:45وتخبرك الرخصة بما يمكنك أنت فعله.
00:09:48أنا جوش من BetterStack.
00:09:49إذا كنت تستمتع بنصائح وحيل البرمجة كهذه،
00:09:51فتأكد من الاشتراك.
00:09:53سنراك في فيديو آخر.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기