أعلنت شركة ميتا عن إطلاق خدمة جديدة مبتكرة تسمى “Muse Voice Transcribe” لتحويل الصوت إلى نص، في إطار جهودها لتعزيز تقنياتها في مجال الذكاء الاصطناعي والصوتيات. تدعم هذه الخدمة أكثر من 70 لغة على مستوى العالم، بما في ذلك خمس لغات هندية رئيسية.
تقنية النسخ الفوري
تمكن “Muse Voice Transcribe” المستخدمين من تحويل الكلام إلى نص بشكل فوري أثناء الحديث، مما يلغي الحاجة إلى انتظار انتهاء التسجيل قبل بدء عملية النسخ. هذه الميزة تجعل الخدمة مثالية للاستخدام في الاجتماعات الطويلة والمحادثات المستمرة وتطبيقات الإملاء المباشر.
تمييز بين المتحدثين
تتيح الخدمة الجديدة القدرة على تمييز المتحدثين وفصل أصواتهم، حيث يمكنها التفرقة بين أكثر من 20 متحدثًا خلال التسجيل الواحد. كما تتميز أيضًا بتحديد بداية ونهاية الحديث بشكل تلقائي، مما يسهل عملية المتابعة والتحليل.
دعم التبديل بين اللغات
تستطيع هذه التقنية التعامل مع التسجيلات الطويلة التي قد تزيد عن ساعة كاملة. إضافة إلى ذلك، يمكنها تحديد المحادثات التي يشترك فيها المتحدثون باستخدام أكثر من لغة، حتى لو تغيرت اللغة داخل الجملة نفسها، دون الحاجة لتغيير الإعدادات يدويًا.
تكنولوجيا معالجة الصوت
تعتمد ميتا في تطوير هذا النموذج على معالجة الصوت في أجزاء صغيرة جداً، بحيث يتم تحديد الوقت المناسب لنسخ الكلمات استنادًا إلى وضوحها. هذا النهج يساعد في تحقيق توازن مثالي بين سرعة الاستجابة ودقة تحويل الكلام إلى نص.
اللغات الهندية المدعومة
تشمل اللغات الهندية التي تدعمها الخدمة في الوقت الحالي الهندية والتاميلية والتيلوجوية والكانادية والمالايالامية. وهذه اللغات تأتي ضمن مجموعة واسعة تتضمن أكثر من 70 لغة مختلفة، مما يعكس تنوع دعم اللغات في الخدمة.
واجهة Meta Model API
يمكن للمطورين استخدام واجهة “Meta Model API” للاستفادة من خدمة تحويل الصوت إلى نص في تطبيقاتهم المختلفة. وقد بدأت بعض أدوات ميتا الفعلية في استخدام هذه التقنية ضمن ميزات الإملاء، وذلك في إطار جهود الشركة لتوسيع استخدام الذكاء الاصطناعي في معالجة الأصوات والمحادثات.
تكلفة الاستخدام
يتعين على المستخدمين دفع 3 دولارات لكل 1000 دقيقة من الصوت لاستخدام واجهة البرمجة، وهو ما يعادل تقريباً 0.18 دولار لكل ساعة. هذه الرسوم تعكس التكلفة الحقيقة لتقنيات معالجة الصوت المتقدمة.
توجه ميتا نحو الذكاء الاصطناعي
تعكس هذه الخطوة النمو المتزايد لشركة ميتا في تطوير تقنيات الذكاء الاصطناعي التي تستطيع فهم وتحليل الكلام في الوقت الحقيقي. يتزايد الاعتماد على مثل هذه التقنيات في مجالات المساعدات الذكية والإملاء الصوتي وتفريغ الاجتماعات والمحتوى الصوتي.
