نفيديا تطلق نموذج Nemotron 3 لفصل المتكلمين بدقة فائقة
يقدّم نموذج Nemotron 3 Diarization من نفيديا حلاً متقدماً لتحديد هوية المتكلمين في المحادثات المتداخلة، مما يعزز دقة أنظمة الذكاء الاصطناعي الصوتية.

تصدر تصنيفات الدقة العالمية
أطلقت شركة نفيديا نموذجاً جديداً مفتوح الأوزان باسم Nemotron 3 Diarization، مصمماً خصيصاً لتحديد هوية المتكلمين في المحادثات الصوتية. يتفوق هذا النموذج، الذي يضم 100 مليون معامل، على المنافسين بتصدّره قائمة VoiceArena Diarization-Bench بمعدل خطأ (DER) قدره 14.72%، مما يجعله الخيار الأمثل للتطبيقات التي تتطلب دقة عالية في ربط الكلمات بالمتحدثين. ويمكن الرجوع إلى Hugging Face Blog للاطلاع على التفاصيل الأصلية للمصدر.
تحدي تحديد المتحدث في المحادثات
تواجه أنظمة التعرف على الصوت تحدياً كبيراً في تمييز من قال ماذا، خاصة في الاجتماعات أو المكالمات التي يتداخل فيها الكلام. بينما تلتقط أنظمة التعرف الآلي على الكلام (ASR) الكلمات بدقة، فإنها غالباً تفشل في إسناد هذه الكلمات إلى المتحدث الصحيح. يؤدي هذا النقص إلى تقليل فائدة الملخصات التلقائية، وعناصر العمل، وتحليلات المحادثات، حيث يصبح من الصعب تتبع من اتخذ قراراً أو من اعترض على نقطة معينة.
آلية عمل النموذج وتقنياته
يعتمد Nemotron 3 Diarization على نهج Sortformer لترتيب المتحدثين بناءً على وقت ظهورهم الأول في المحادثة. هذا الترتيب الزمني يضمن استقرار التسميات العامة للمتحدثين عبر المقاطع الصوتية المتتالية، مما يلغي الحاجة لحل معادلات إعادة ترتيب المتحدثين في كل مقطع جديد. يستقبل النموذج صوتاً بتكرار 16 كيلوهيرتز ويحوّله إلى ميزات طيفية (Mel-spectrogram) مع خطوة إطار 10 مللي ثانية، ثم يجمعها في إطارات مدتها 80 مللي ثانية لمعالجتها بواسطة مشفر Transformer من 31 طبقة.
الدعم للبث المباشر والتسجيلات الطويلة
يتميز النموذج بقدرته على العمل في وضعي التسجيل المسبق والبث المباشر. في وضع البث، يستخدم النموذج ذاكرتين: ذاكرة وصول مرتبة حسب الوصول (AOSC) لتتبع المتحدثين السابقين، وذاكرة FIFO لتوفير سياق الإطارات الأخيرة. يسمح هذا التصميم بمعالجة المقاطع الصوتية الطويلة دون حدود زمنية صارمة، مع إمكانية ضبط زمن الاستجابة (Latency) بين 0.32 ثانية و30.4 ثانية حسب متطلبات التطبيق، مما يوفر مرونة عالية في الأداء.
تحسين التدريب بالبيانات المرخصة
تم تدريب النموذج باستخدام بيانات صوتية عامة ومرخصة، بما في ذلك محادثات حقيقية متعددة المتحدثين من شركة David AI. ساهمت إضافة هذه البيانات في خفض معدل خطأ الفصل المركب (DER) بمقدار 0.77 نقطة مئوية، من 11.19% إلى 10.42%، في كل من نقاط التشغيل المسبقة ومنخفضة الكمون. كما شملت البيانات المرخصة خلطات محاكاة واسعة النطاق تغطي 21 لغة، مما عزز قدرة النموذج على التعامل مع التنوع اللغوي والصوتي.
الفرق بين الفصل والتعرف على الكلام
من المهم التمييز بين مهمة الفصل (Diarization) ومهمة التعرف على الكلام (ASR). ينتج الفصل عن النموذج فترات زمنية لنشاط كل متحدث، بينما ينتج ASR النص المكتوب. للحصول على نص منسوب للمتحدثين، يجب دمج المخرجات في خط أنابيب واحد. يجب على المطورين تقييم كل مكون على حدة بالإضافة إلى النظام المدمج، حيث أن أخطاء الفصل (مثل فقدان الكلام أو سوء الإسناد) مختلفة عن أخطاء ASR (مثل أخطاء النطق).
المصادر
- Hugging Face Blog**Know Who Spoke When: Build Real-Time, Multi-Speaker AI with NVIDIA Nemotron 3 Diarization**