أوبن أي آي كشفت عن نموذجين جديدين للتعرف على الكلام، GPT Transcribe وGPT Live Transcribe، مع خفض تكلفة تفريغ الملفات الصوتية بنسبة 25% وتحقيق معدل خطأ في الكلمات يبلغ 3.31% في قياس مستقل للدقة.
أبرز النقاط:
- GPT Transcribe حقق معدل خطأ في الكلمات (WER) عند 3.31% على مؤشر AA-WER، ليحل في المركز التاسع بين الأنظمة التي يجري تتبعها.
- تكلفة تفريغ الملفات الصوتية باتت 0.0045 دولار للدقيقة، أي أقل بـ25% من GPT-4o Transcribe، بينما تبلغ تكلفة البث اللحظي 0.017 دولار.
- النموذجان يقبلان سياقاً كتابياً، وقوائم كلمات مفتاحية، وتلميحات لغوية لتحسين الدقة في التسجيلات المليئة بالضجيج.
نماذج أوبن أي آي للتحويل النصي تصل إلى واجهة برمجة التطبيقات
الشركة قدّمت النموذجين عبر منصّة المطوّرين في 28 يوليو، ثم نشرت صفحات مخصصة لكل نموذج، ودليل تفريغ صوتي محدّث، وأمثلة برمجية لكل واجهات الاستخدام المدعومة.
GPT Transcribe مخصص للملفات الصوتية المكتملة والأعمال الدُفعية الثقيلة، ويعالج التسجيلات بسرعة تعادل تقريباً 34 ضعف الزمن الحقيقي، وهي سرعة ملائمة للأرشفة، لكنها أبطأ كثيراً من أسرع خدمات التفريغ المتاحة في السوق.
GPT Live Transcribe يتولى الشق الآخر من المهمة، إذ يعيد بث النص في الزمن الحقيقي تقريباً عبر اتصال مفتوح بينما لا يزال المتحدث يتكلم. يمكن للمطورين ضبط مستوى المفاضلة بين انخفاض زمن الاستجابة واستقرار النص النهائي، وقد سارعت مايكروسوفت بالفعل إلى إدراج النسختين ضمن منصّة Foundry التابعة لها.
كلا النموذجين يقبل وصفاً نصياً للتسجيل، وقائمة كلمات مفتاحية تشمل الأسماء والمصطلحات التقنية، إضافة إلى تلميحات باللغة أو اللغات المتوقعة. هذا السياق رفع الدقة الدلالية على معيار أوبن أي آي الداخلي من 41.6% إلى 45.2%.
نموذج الملفات يتم احتسابه بسعر 0.0045 دولار لكل دقيقة صوت، أي أقل بربع السعر من النموذج السابق، بينما تبلغ تكلفة النسخة الحية 0.017 دولار لكل دقيقة من الجلسة المفتوحة.
مقال ذو صلة: حجم تداول DEX يتراجع 26% في يوليو مع تقلص السيولة على السلسلة
تصنيف Artificial Analysis يضع GPT Transcribe في المركز التاسع
شركة Artificial Analysis قاست أداء GPT Transcribe بمعدل خطأ في الكلمات بلغ 3.31% على مؤشر AA-WER، ما يضعه في المركز التاسع تقريباً من بين نحو 50 نظاماً تراقبها الشركة. هذا يمثل تحسّناً بنحو 0.7 نقطة مئوية مقارنة بـ GPT-4o Transcribe، لكن النموذج واصل التعثر أمام المواد الأصعب، مسجلاً 6.10% على مكالمات الأرباح الهاتفية.
عبر 22 لغة على مجموعة بيانات Common Voice، سجّلت أوبن أي آي معدل خطأ 19.27% مقابل 40.37% لنموذج Whisper. وتتصدّر علي بابا ترتيب الدقة بمعدل خطأ 1.8%، متقدمة على ElevenLabs وغوغل وMistral، التي تتراوح نماذجها بين 2.2% و2.9%. مراجعة لإطلاق النموذج حذّرت من أن أرقام المؤشر تعطي صورة أكثر وردية مما ينبغي، إذ إن GPT-4o نفسه الذي يقترب من 3% على المقاطع النظيفة ينهار أداؤه على تسجيلات أرباح فوضوية.
إصدارات أوبن أي آي الصوتية منذ Whisper
هذا الإطلاق يختتم عاماً مزدحماً بالصوت لدى أوبن أي آي. فقد ظهر Whisper كنموذج مفتوح في 2022، وسرعان ما أصبح الخيار الرخيص الافتراضي للتفريغ الصوتي في البودكاست ومراكز الاتصال وغرف الأخبار والأرشيفات البحثية حول العالم.
تلاه GPT-4o Transcribe في 2025 بسعر 0.006 دولار للدقيقة، مع نسخة أصغر بنصف السعر. وفي مايو، طرحت الشركة نموذج GPT-Realtime-2 إلى جانب نموذج ترجمة ونموذج GPT-Realtime-Whisper، الذي كان يقدّم البث الحي بالسعر نفسه البالغ 0.017 دولار الذي يفرضه النموذج الجديد اليوم.
في المقابل، واصل المنافسون خفض الأسعار، لتبدأ تسعيرة Mistral حالياً من 0.003 دولار.
اقرأ أيضاً: وكيل مارق من أوبن أي آي اخترق 4 خدمات إضافية إلى جانب Hugging Face





