كيف يعمل تمييز المتحدثين — وأين يخطئ
تقسيم التسجيل حسب من يتكلم مسألة مختلفة عن كتابة ما قيل. إليك ما ينصت إليه النموذج فعلاً.
في هذه الصفحة 3
ما الذي ينصت إليه النموذج فعلاً
نموذج التفريغ يحوّل الصوت إلى كلمات. أما تمييز المتحدثين فيجيب عن سؤال آخر: من كان يتكلم في كل لحظة. يقطّع النظام الصوت إلى مقاطع قصيرة، ويحوّل كل مقطع إلى بصمة رقمية للصوت، ثم يجمع البصمات المتشابهة. كل مجموعة تصبح تسمية متحدث. لا يعرف النظام في أي مرحلة اسم أحد؛ يعرف فقط أن هذا الصوت ليس ذاك الصوت.
أين يخطئ
ثلاث حالات تفسّر معظم الأخطاء.
- التداخل. حين يتكلم شخصان معًا، يحمل المقطع صوتين ويقع في المجموعة الأقرب شبهًا.
- الأدوار القصيرة. كلمة واحدة مثل «نعم» لا تمنح النموذج مادة كافية للبصمة، والمداخلات القصيرة أول ما يُسمّى خطأً.
- الأصوات المتشابهة. متحدثان من العمر نفسه والجنس نفسه واللهجة نفسها، مسجَّلان عبر الميكروفون نفسه، قد ينصهران في تسمية واحدة.
ظروف التسجيل أهم من النموذج. اجتماع سُجّل بميكروفون حاسوب محمول واحد في غرفة يتردد فيها الصدى أصعب بكثير من الاجتماع نفسه مسجَّلًا بقناة مستقلة لكل مشارك.
ما العمل
تصحيح التسميات لاحقًا أسرع من مصارعة التسجيل. في WhoScribe تعيد تسمية المتحدث مرة واحدة فتحمل كل أسطره الاسم الجديد.
اقرأ الدقيقة الأولى بتمعّن. عند التحية والتعريف بالنفس تتبادل التسميات أكثر ما تتبادل، وتصحيحها مبكرًا يعني أن بقية التفريغ ستُقرأ صحيحة.
إن كنت تعرف عدد الحاضرين فاذكره. النموذج الذي قيل له إن هناك ثلاثة أصوات لن يخترع رابعًا من ضجيج الخلفية.
جرّبه
حوّل تسجيلك إلى نص
الصق رابطًا أو ارفع ملفًا واقرأ النص خلال دقائق.
- أكثر من 90 لغة
- ملفات حتى 10 ساعات
- الويب وiOS وAndroid وChrome