هذا النموذج المفتوح للأوزان تفوق على ElevenLabs... ثم قرأت الترخيص

BBetter Stack
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00نجح نموذج تحويل النص إلى كلام مفتوح الأوزان للتو في تفوقه على ElevenLabs في التحليل الاصطناعي.
00:00:05هذا هو نموذج Breeze.
00:00:07حجم التحميل هو 3 جيجابايت.
00:00:09وهو يعمل على جهاز MacBook الخاص بك، وإذا كنت تريد حقاً استخدام ما يولده للعمل،
00:00:13فمن المحتمل ألا يُسمح لك بذلك أصلاً.
00:00:15المشكلة ليست في أن النتائج سيئة للغاية.
00:00:17حسنًا، النتيجة جيدة نوعاً ما.
00:00:18إنها جيدة حقاً.
00:00:19لكن الترخيص الفعلي هو المشكلة.
00:00:21لذا أريد أن أريكم ما يمكن لـ Breeze فعله أولاً، ثم كيف يمكننا استخدامه حقاً.
00:00:30هذا هو نموذج Breeze TTS 2.
00:00:33تم إصداره لأول مرة في 25 أغسطس من قبل شركة تسمى Breeze Blue.
00:00:37الآن، نتائج الاختبار رائعة، لكن طريقة إنشاء الصوت أفضل بكثير.
00:00:41معظم نماذج تحويل النص إلى كلام المفتوحة اليوم تحتوي على استنساخ الأصوات.
00:00:45حيث تمنحها حوالي 10 ثوانٍ من الصوت المرجعي، وعادةً مع النص الدقيق المقابل له،
00:00:50وتحاول تلك النماذج تقليد ذلك الصوت.
00:00:52هذا يعمل بالطبع، لكننا نحتاج بوضوح إلى صوت مرجعي منذ البداية.
00:00:56أما نموذج Breeze فلا يحتاج إلى ذلك.
00:00:58عليك فقط وصف الصوت الذي تريد استخدامه بالفعل.
00:01:01لذا يمكن أن يكون الوصف شيئاً مثل
00:01:03رجل عجوز دافئ، حكيم ومفكر، ذو نبرة هادئة ومتأملة.
00:01:08فكر في مورجان فريمان.
00:01:09وهو يولد ذلك الصوت بناءً على الوصف وحده.
00:01:12لا يوجد تسجيل مرجعي.
00:01:14في الوقت الحاضر، يُعرف هذا بتصميم الأصوات،
00:01:16ونبدأ في رؤية المزيد والمزيد من النماذج الصوتية مفتوحة الأوزان
00:01:19بقدرات تتزايد تحسناً في مجال تصميم الأصوات.
00:01:23وهذا يملأ فراغاً حقيقياً في مجال تقنيات تحويل النص إلى كلام المفتوحة.
00:01:26نموذج Kokoro يمنحك أصواتاً مسبقة الضبط وثابتة.
00:01:29بينما نموذج Chatterbox يحتاج إلى صوت مرجعي.
00:01:31أما Breeze فيمكنه بناء الصوت من جملة واحدة.
00:01:34لذا دعنا نسمعه بأنفسنا.
00:01:35إذا كنت تستمتع بأدوات البرمجة التي تسرع سير عملك، فلا تنسَ الاشتراك.
00:01:39لدينا مقاطع فيديو تصدر طوال الوقت.
00:01:41تشغيل هذا النموذج يتم غالباً مباشرة داخل واجهة الأوامر الخاصة بي.
00:01:45لقد أنشأت بيئة افتراضية فقط، ثم قمت بتثبيت حزمة MLX audio عبر pip.
00:01:49هذا يعمل على جهاز Mac الخاص بي، ولهذا احتجت إلى MLX هنا.
00:01:53إذا كنت تستخدم نظام Linux أو تملك وحدة معالجة رسومية من NVIDIA،
00:01:56فستكون طريقة الإعداد مختلفة قليلاً، لكنها بنفس القدر من السهولة.
00:02:00لذا أنشأت نفس الجملة، وأقوم بتشغيلها هنا في واجهة الأوامر
00:02:03باستخدام تعليمات صوتية مختلفة.
00:02:05دعنا نشغل الصوت الأول.
00:02:06مرحباً بك في قناة BetterStack.
00:02:09لكل ما يتعلق بالتكنولوجيا والذكاء الاصطناعي، هل اشتركت حتى الآن؟
00:02:13والآن نفس الجملة تماماً مرة أخرى بنبرة مختلفة قليلاً.
00:02:19مرحباً بك في قناة BetterStack.
00:02:21لكل ما يتعلق بالتكنولوجيا والذكاء الاصطناعي، هل اشتركت حتى الآن؟
00:02:27كانت هاتان هما نفس الكلمات، لشخصين مختلفين تماماً، أو لنقل صوتين اصطناعيين.
00:02:33على الرغم من أن هذا يحتل مرتبة متقدمة، إلا أنه لا يزال بإمكاني تمييز أنه صوت اصطناعي، أليس كذلك؟
00:02:37إنه جيد إذاً.
00:02:38أداؤه لائق جداً، ومقدرة تحديد المشاعر متوفرة فيه بالفعل أيضاً.
00:02:42الآن يوجد إعداد واحد هنا يعد أساسياً لكل هذا، ويسمى مقياس CFG.
00:02:47وهو يتحكم في مدى دقة اتباع النموذج لوصف الصوت الخاص بك.
00:02:51إذا قمت بتقليله، سيبدأ النموذج في الانحراف مجدداً نحو صوت أكثر عمومية.
00:02:55الرقم أربعة هو الموصى به في وثائقهم، وهو ما أستخدمه هنا أيضاً لعدد من الأصوات.
00:03:00لكن دعني أخفض هذا القيمة إلى واحد سريعاً، فقط للحصول على صوت اصطناعي بحت.
00:03:05ها نحن ذا.
00:03:05مرحباً بك في قناة BetterStack.
00:03:08هذا الصوت يبدو اصطناعياً بوضوح.
00:03:10أنت تفهم ما أعنيه هنا، أليس كذلك؟
00:03:11لقد بدا صوتاً اصطناعياً بحتاً.
00:03:12لذا يمكنك الآن أيضاً إدراج أحداث صوتية مباشرة داخل النص، وهو أمر رائع حقاً.
00:03:18يمكنني كتابة ذلك حرفياً، ويمكنني وضع أقواس.
00:03:20يمكنني وضع كلمة تنهد وإغلاق تلك الأقواس.
00:03:23وفي النهاية، يمكنني وضع ضحك أو بكاء في منتصف الجملة، أو في نهايتها، أو في البداية.
00:03:28دعنا نسمع ذلك.
00:03:30عندما أُحاول أن أروي لك نكتة، لا أستطيع أن أتمالك نفسي من الضحك.
00:03:35هذا جزء من النص، وهي ميزة لطيفة.
00:03:38لكن العديد من النماذج الصوتية مفتوحة الأوزان تصدر بهذه الميزة الآن أيضاً.
00:03:42لذا اترك لك الحكم على مدى جودة صوت Breeze في الواقع.
00:03:46بالنسبة للذكاء الاصطناعي، هل هو جيد؟
00:03:47هل يستحق الترتيب الذي يحظى به حقاً؟
00:03:50الآن، تم بناء نموذج Breeze من مجموعة أجزاء قد تعرفها بالفعل.
00:03:54هيكل نموذج Qwen 3 يتعامل مع النمذجة اللغوية.
00:03:57وهناك مشفر نصوص T5 Gemma 2.
00:03:59بينما يتولى نموذج MIMI معالجة ترميز الصوت.
00:04:01يحتوي النموذج على حوالي 3 مليارات معامل، ويُخرج صوتاً أحادي القناة بتردد 24 كيلوهرتز.
00:04:07ولكن هناك تفصيل واحد هنا أريدك أن تتذكره.
00:04:09مجزئ الرموز الصوتي مأخوذ من Qwen 3 TTS، ونموذج Qwen 3 TTS مرخص برخصة Apache 2.0.
00:04:16إذن جزء من هذا النموذج مبني على عمل مفتوح حقيقي.
00:04:19ضع ذلك في اعتبارك، لأنه بعد دقيقة سيبدو الأمر مثيراً للسخرية بعض الشيء.
00:04:23ولكن أولاً، نحتاج إلى الحديث عن الادعاء الذي جعل نموذج Breeze يحقق شهرة واسعة.
00:04:27نموذج Breeze تفوق على ElevenLabs.
00:04:29نعم، لقد تفوقوا عليهم.
00:04:30هذا صحيح من الناحية الفنية، ولكن بناءً على المخرج الصوتي، لست متأكداً كيف حدث ذلك.
00:04:36وهنا أيضاً يصبح الأمر أكثر تعقيداً من مجرد قول ذلك.
00:04:40تُدير منصة Artificial Analysis ساحة تقييم صوتي تعتمد على تصويت بشري أعمى ومزدوج.
00:04:45إنها شركة تقييم مستقلة، وليست شركة Breeze Blue.
00:04:49على لوحة صدارة أصوات المزودين الخاصة بهم، يقع نموذج Breeze عند 1215 نقطة.
00:04:53هذه هي نقاط تقييم ELO.
00:04:54بينما نموذج المحادثة لـ 11 labs يقع عند 1210 نقطة.
00:04:57إذن نعم، من الناحية الفنية، لقد تفوقوا عليهم بخمس نقاط.
00:05:00نموذج Breeze يتفوق على ElevenLabs.
00:05:01حسناً، ولكن الآن، إذا تعمقت في هذا الأمر أكثر، تبدأ المشاكل في الظهور.
00:05:06أولاً، يمتلك نموذج Breeze أقل عدد من الأصوات بالقرب من القمة.
00:05:09حوالي 1200 صوت.
00:05:11بينما يمتلك نموذج 11 labs أكثر من 4500 صوت.
00:05:14لذا فإن نموذج Breeze لديه التقييم الأقل استقراراً في ذلك الجزء من اللوحة.
00:05:17وعادة ما تحصل النماذج الجديدة على دفعة ترحيبية بسيطة.
00:05:21ثانياً، نموذج Breeze ليس هو المركز الأول في الواقع.
00:05:24فنموذج Cartesia Sonic 3.6 يسجل 1282 نقطة.
00:05:27لذا فإن القول بأن Breeze يتفوق على الأنظمة الاحتكارية الرائدة صحيح من جانب واحد.
00:05:32وهو أيضاً أمر انتقائي للغاية.
00:05:33لكن المشكلة الثالثة هي الأساس في كل هذا.
00:05:36تلك لوحة الصدارة تسمح لكل نموذج باستخدام أصواته الخاصة.
00:05:39بينما تمتلك Artificial Analysis لوحة صدارة أخرى تُعطى فيها النماذج نفس النص الموجه تماماً.
00:05:45نفس الاختبار.
00:05:46وهي مقارنة عادلة تماماً ومباشرة.
00:05:49وهنا يختلف وضع نموذج Breeze تماماً.
00:05:51في ذلك التصنيف، يحقق 1002 نقطة.
00:05:54وهو في المركز الثالث بين النماذج مفتوحة الأوزان.
00:05:56والمركز السادس عشر من بين 39 نموذجاً إجمالاً.
00:05:59ويأتي خلف نموذج Vox Troll من Mistral.
00:06:01إذن نموذج Breeze جيد جداً لدرجة تنافس العديد من هذه النماذج.
00:06:04لكنه ليس المركز الأول.
00:06:05ويبدو أنه يكون جيداً بشكل خاص عندما يُسمح له باختيار الأصوات التي تتم مقارنتها.
00:06:10هذا يغير كيف يجب أن ننظر إلى هذا الأمر في الواقع.
00:06:13ولكن مع ذلك، لم يكن هذا أكبر أمر وجدته.
00:06:16المشكلة الكبرى في هذا كله هي الترخيص.
00:06:19وهذا هو الجزء الذي يتخطاه الكثير من الناس ببساطة.
00:06:22نعم، الشفرة البرمجية مرخصة برخصة Apache 2.0.
00:06:24لا توجد مشكلة هناك.
00:06:26أما الأوزان ليست كذلك.
00:06:27تستخدم الأوزان ترخيصاً يسمى ترخيص الأبحاث والاستخدام غير التجاري لـ Breeze Blue.
00:06:33وأريد استخدام صياغتهم الدقيقة هنا لأن هذا التمييز مهم بالفعل.
00:06:38ما سيقوله هذا الترخيص، وما ينصه بالفعل هو،
00:06:42تسمح هذه الاتفاقية بالأبحاث واللاستخدام غير التجاري لمواد النموذج مجاناً.
00:06:47وهي لا تمنح أي حقوق تجارية وليست ترخيصاً مفتوح المصدر.
00:06:52تلك هي كلماتهم.
00:06:53ليست ترخيصاً مفتوح المصدر.
00:06:55حسناً.
00:06:56أحياناً ترى عبارة “غير تجاري” على نموذج ما، وغالباً ما تعني لا تقم بإعادة بيع أوزاننا.
00:07:02نعم، حسناً.
00:07:02هذا منطقي.
00:07:04لكن ليس هذا ما يقوله هذا الترخيص.
00:07:05تعريفهم للغرض التجاري يتضمن استخدام الإنتاج،
00:07:09واستخدامه في منتج أو خدمة، أو استضافته خلف واجهة برمجة تطبيقات API.
00:07:13وهناك الجزء الذي يفرض قيوداً حقيقية هنا.
00:07:16وكأن ذلك لم يكن كافياً بالفعل،
00:07:17فإنه يشمل أيضاً استخدام المخرجات لأي عمليات داخلية تتجاوز نطاق التقييم المحدود.
00:07:23المخرجات ذاتها.
00:07:24حسناً، إذن ماذا يعني هذا في الواقع؟
00:07:26لا يقتصر الأمر على النموذج نفسه، بل يشمل حتى الصوت الذي يولده.
00:07:29وهذا الأمر برمته مستمر في فرض القيود.
00:07:31لا يوجد استثناء لصانعي المحتوى، ولا استثناء للشركات الصغيرة.
00:07:35ولا يوجد حد أدنى للعائدات المالية.
00:07:37لا يوجد شيء هنا.
00:07:38الكثير من التراخيص غير التجارية تترك بعض المساحات الرمادية.
00:07:42هذه الرخصة تبذل قصارى جهدها لمنع الكثير من ذلك.
00:07:45إذن، دعنا نجعل الأمر أكثر عملية الآن.
00:07:47متى يمكنك استخدام هذا؟
00:07:48هل تضع صوتاً مولداً من بريز داخل منتج ما؟
00:07:51كلا.
00:07:52لن يحدث ذلك.
00:07:53استخدامه في فيديو على يوتيوب يحقق ربحاً؟
00:07:56هذا الفيديو يحقق دخلاً.
00:07:58نعم، أممم.
00:07:58لن يحدث ذلك.
00:07:59في نوع ما من البودكاست؟
00:08:00مرة أخرى، لن يحدث ذلك.
00:08:02لذا، فهذا يحظر كل شيء تقريباً.
00:08:04تذكر الرخصة تحديداً عائدات الرعاية وعائدات الاشتراكات.
00:08:0934 دولاراً لكل مليون حرف بمجرد أن تبدأ الدفع مقابل هذا.
00:08:12ولكن حتى هناك، توضح الرخصة أمراً جلياً للغاية.
00:08:15الدفع مقابل واجهة برمجة التطبيقات لا يمنحك حقوقاً تجارية للنماذج المستضافة ذاتياً
00:08:19أو النتائج الصادرة عن نموذجهم المستضاف ذاتياً.
00:08:22وبمجرد أن تدرك ذلك، يصبح النظام بأكمله منطقياً للغاية.
00:08:25الأوزان المفتوحة هي النسخة التجريبية.
00:08:27واجهة برمجة التطبيقات هي منتجهم الأساسي.
00:08:30إذن، إلى أي مدى تعتبر تلك الأوزان المفتوحة قابلة للاستخدام في المقام الأول؟
00:08:33سأترك لك الحكم على ذلك.
00:08:34الآن، كان هذا رائعاً حقاً.
00:08:36الذكاء الاصطناعي الصوتي أمر رائع حقاً.
00:08:37لكنني قدمت تحليلاً مفصلاً لـ Vox CPM2 منذ فترة قصيرة.
00:08:41كان Vox CPM2 مذهلاً بصراحة.
00:08:43لقد كان مثيراً للإعجاب للغاية، وأعني ذلك حقاً.
00:08:45لذا، إذا قارنت بريز في مواجهة Vox CPM،
00:08:48فستخسر بريز هذه المعركة في لمح البصر.
00:08:50ويتعلق الأمر كله بتلك الرخصة.
00:08:52يا للروعة.
00:08:53لذا، إذا كنت تريد ذكاءً اصطناعياً صوتياً حقيقياً ومفتوحاً لاستنساخ الأصوات،
00:08:56فلا زلت أفضّل الالتزام بـ Vox CPM2.
00:08:58نظراً لأنه يحتوي على نفس ميزات بريز تماماً،
00:09:00وقد يكون أفضل منها أيضاً.
00:09:02هل يجب عليك استخدام بريز؟
00:09:03هذا هو السؤال.
00:09:04أعتقد أنني أجبت على ذلك، ولكن دعنا نلقي نظرة هنا.
00:09:06بالنسبة لتجربة الذكاء الاصطناعي الصوتي للمسليّة، نعم، يمكنك ذلك.
00:09:09من الرائع أن ترى إلى أين يتجه الذكاء الاصطناعي الصوتي.
00:09:12بريز جيد جداً، أليس كذلك؟
00:09:14اختبار النماذج أمر ممتع،
00:09:16خاصة وأنها تصبح أفضل فأفضل.
00:09:18إلى أين تتجه الأمور؟
00:09:19تصميم الأصوات بناءً على وصف نصي
00:09:21هو حقاً ميزة رائعة جداً.
00:09:23ولكن إذا كنت تطرح أي شيء تجاري،
00:09:25فلا تستخدم هذا.
00:09:26كنت لأستخدم شيئاً آخر،
00:09:27بغض النظر عن مكانة بريز في قائمة الترتيب.
00:09:30نموذج Kokoro مرخص برخصة Apache 2.0.
00:09:32ونموذج Chatterbox مرخص برخصة MIT.
00:09:34أما Vox CPM، فسنقوم بالتحقق منه،
00:09:35لأنه قد يسحقهم جميعا.
00:09:36لقد توقفت الأوزان المفتوحة والمصادر المفتوحة
00:09:38عن تعبيرهما عن نفس الشيء منذ فترة.
00:09:40تعلّم بريز يجعل هذا الاختلاف مستحيلاً على التجاوز.
00:09:43يخبرك معيار الأداء بما يمكن أن يفعله النموذج.
00:09:45وتخبرك الرخصة بما يمكنك أنت فعله.
00:09:48أنا جوش من BetterStack.
00:09:49إذا كنت تستمتع بنصائح وحيل البرمجة كهذه،
00:09:51فتأكد من الاشتراك.
00:09:53سنراك في فيديو آخر.

핵심 요약

يتفوق نموذج Breeze TTS 2 المفتوح للأوزان على ElevenLabs في تقييمات ELO العمياء، لكن ترخيصه الصارم يمنع الاستخدام التجاري أو الإنتاجي بالكامل.

하이라이트

  • يأتي نموذج Breeze TTS 2 بحجم تحميل يبلغ 3 جيجابايت ويعمل بشكل مباشر على أجهزة أبل ماك عبر حزمة MLX audio.

  • يعتمد تصميم الأصوات في نموذج Breeze على الوصف النصي وحده دون الحاجة إلى تسجيل مرجعي أو عينة صوتية.

  • يتفوق نموذج Breeze طفيفاً على ElevenLabs في لوحة صدارة Artificial Analysis بنقاط تقييم ELO تبلغ 1215 نقطة مقابل 1210 نقاط.

  • يفرض ترخيص نموذج Breeze قيوداً صارمة تمنع الاستخدام التجاري وإنتاج المنتجات والخدمات واستضافة واجهات برمجة التطبيقات.

  • يحقق نموذج Breeze 1002 نقطة فقط ويحتل المركز السادس عشر عندما يخضع لنفس النص الموجه تماماً في المقارنة العادلة.

타임라인

قدرات تصميم الأصوات وآلية التشغيل في نموذج Breeze

  • يبلغ حجم تحميل نموذج Breeze TTS 2 ثلاثة جيجابايت ويعمل محلياً على أجهزة ماك باستخدام حزمة MLX audio.
  • ينشئ النموذج أصواتاً مخصصة بناءً على الوصف النصي فقط دون الحاجة إلى عينة صوتية مرجعية مسبقة.
  • يدعم النموذج إدراج أحداث صوتية مباشرة داخل النص مثل التنهد والضحك والبكاء في مواضع مختلفة.

يقدم نموذج Breeze طريقة متقدمة لتوليد الصوت عبر الوصف النصي مثل وصف شخصية عجوز دافئ بنبرة هادئة. يعتمد التشغيل على واجهة الأوامر وإنشاء بيئة افتراضية لتثبيت الحزم المناسبة. يتحكم مقياس CFG في مدى دقة اتباع النموذج للوصف الصوتي، حيث يوصى برقم أربعة للحصول على نتائج طبيعية مقابل الأصوات الاصطناعية البحتة عند القيم المنخفضة.

مقارنة الأداء والترتيب في منصة التحليل الاصطناعي

  • يتكون هيكل نموذج Breeze من نموذج Qwen 3 للنمذجة اللغوية ومشفر تصوص T5 Gemma 2 وموديل MIMI لترميز الصوت.
  • يسجل نموذج Breeze 1215 نقطة في تقييم ELO متفوقاً بفارق خمس نقاط على نموذج المحادثة لـ ElevenLabs.
  • يهبط ترتيب نموذج Breeze إلى المركز السادس عشر بنقطة 1002 عندما يتم اختبار جميع النماذج باستخدام نفس النص الموجه.

يعتمد التفوق على ساحة تقييم تعتمد على تصويت بشري أعمى ومزدوج تديرها منصة Artificial Analysis المستقلة. يمتلك نموذج Breeze عدد أصوات أقل مقارنة بالمنافسين وتستفيد النماذج الجديدة غالباً من دفعة ترحيبية مؤقتة. تظهر المقارنة العادلة والمباشرة باستخدام نفس النص أن النماذج الأخرى مثل Cartesia Sonic تتفوق بوضوح على نتائج Breeze.

القيود القانونية لشروط ترخيص الأوزان

  • تستخدم شفرة نموذج Breeze رخصة Apache 2.0 بينما تخضع الأوزان لترخيص الأبحاث والاستخدام غير التجاري.
  • يمنع الترخيص بوضوح الاستخدام التجاري أو الإنتاجي أو استضافة النماذج خلف واجهات برمجة التطبيقات أو الاستفادة من المخرجات.
  • يفضل البديل مثل نموذج Vox CPM2 أو Kokoro وChatterbox لمن يبحث عن حرية الاستخدام التجاري والعمل الحقيقي.

يمنع الترخيص الجديد استخدامه في فيديوهات يوتيوب المحققة للدخل أو البودكاست أو أي منتج تجاري دون استثناء لصانعي المحتوى أو الشركات الصغيرة. تظهر هذه القيود أن النسخة ذات الأوزان المفتوحة تخدم غرضاً تجريبياً بينما يظل الهدف الأساسي دفع ثمن واجهات برمجة التطبيقات. تختلف الأوزان المفتوحة عن المصادر المفتوحة الحقيقية التي تمنح المستخدم حقوقاً كاملة للاستخدام والإنتاج.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기