Close Menu
Tec99Tec99
    الأبرز حالياً 🔥

    شاومي تعلن عن Xiaomi 18 Fold لمنافسة ايفون الترا

    8 سبتمبر، 2026

    رسميًا OpenAI تطلق GPT‑6 Astra – النموذج الأقوى حتى الآن

    6 سبتمبر، 2026

    لينوفو تطلق سلسلة لابتوبات IdeaPad Vibe بتصميمات شبابية

    8 سبتمبر، 2026

    ما هي ميزة iPhone Handoff الجديدة في iOS 27 نسخة بيتا؟

    7 سبتمبر، 2026
    فيسبوك الانستغرام X (Twitter) يوتيوب تيكتوك
    • معلومات عنا
    • سياسة الخصوصية
    • تواصل معنا
    فيسبوك الانستغرام X (Twitter) يوتيوب تيكتوك
    Tec99Tec99
    • الرئيسية
    • الأخبار

      شاومي تعلن عن Xiaomi 18 Fold لمنافسة ايفون الترا

      8 سبتمبر، 2026

      لينوفو تطلق سلسلة لابتوبات IdeaPad Vibe بتصميمات شبابية

      8 سبتمبر، 2026

      هواوي تطلق سماعة HUAWEI FreeBuds Neo للفئة الاقتصادية بمزايا متقدمة

      6 سبتمبر، 2026

      رسميًا OpenAI تطلق GPT‑6 Astra – النموذج الأقوى حتى الآن

      6 سبتمبر، 2026

      جوجل تطلق تحديثات جديدة لـ Find Hub لتذكر أماكن مفقوداتك!

      4 سبتمبر، 2026
    • المراجعات
      8.4

      مراجعة Vivo X300 FE بعدسات ZEISS وسعر منافس

      17 أغسطس، 2026
      8.6

      مراجعة ASUS Vivobook S16 (S3607) – معادلة الإنتاجية المثالية

      10 أغسطس، 2026
      8.4

      مراجعة OPPO Reno 16F – هل يستحق الشراء في الفئة المتوسطة؟

      3 أغسطس، 2026
      8.6

      مراجعة Soundcore Liberty 5 Pro Max من Anker – سماعة ذكية بشاشة لمس

      14 يوليو، 2026
      8.5

      مراجعة Xiaomi 17T Pro – المواصفات الكاملة والمميزات والعيوب

      8 يوليو، 2026
    • الفئات
      • هواتف ذكية
      • الألعاب
      • لابتوب
      • عرض المزيد…
    • الأكثر رواجًا

      شاومي تعلن عن Xiaomi 18 Fold لمنافسة ايفون الترا

      8 سبتمبر، 2026

      مواصفات ساعة HUAWEI WATCH D3 الجديدة

      7 سبتمبر، 2026

      هواوي تطلق سماعة HUAWEI FreeBuds Neo للفئة الاقتصادية بمزايا متقدمة

      6 سبتمبر، 2026

      إنفيديا تطلق تقنية DLSS 5 حصرياً لكروت RTX 50 مع توسع في الألعاب المدعومة

      3 سبتمبر، 2026

      جوجل تطلق Gemini 3.5 Transcribe لتحويل الكلام إلى نصوص

      31 أغسطس، 2026
    Tec99Tec99
    الرئيسية»الذكاء الاصطناعي»جوجل تطلق Gemini 3.5 Transcribe لتحويل الكلام إلى نصوص
    أخبار الأكثر رواجًا الذكاء الاصطناعي

    جوجل تطلق Gemini 3.5 Transcribe لتحويل الكلام إلى نصوص

    31 أغسطس، 2026945 زيارة
    شاركها فيسبوك تويتر لينكدإن البريد الإلكتروني واتساب Copy Link

    أعلنت جوجل عن Gemini 3.5 Transcribe، أحدث نماذجها المتخصصة في تحويل الكلام إلى نص، مع تركيز واضح على تقديم تجربة تتجاوز مفهوم النسخ الصوتي التقليدي إلى فهم الكلام وسياقه ونية المتحدث.

    يجمع النموذج بين السرعة العالية والدقة، مع قدرته على تنظيف الكلام الطبيعي من التلعثم وكلمات الحشو، والتعامل مع التصحيحات أثناء الحديث، إلى جانب دعم أكثر من 85 لغة.

    وتأتي هذه الخطوة في وقت تتجه فيه تطبيقات الذكاء الاصطناعي بشكل متزايد نحو التفاعل الصوتي، سواء في المساعدات الذكية أو أدوات الاجتماعات وخدمة العملاء أو إنشاء المحتوى، وترى جوجل أن Gemini 3.5 Transcribe يمكن أن يوفر للمطورين طبقة صوتية أكثر ذكاء لبناء تجارب تعتمد على الكلام بشكل أساسي.

    ما هو Gemini 3.5 Transcribe؟

    Gemini 3.5 Transcribe هو نموذج متخصص في تحويل الصوت إلى نص، لكنه لا يكتفي بنسخ الكلمات كما قيلت حرفيًا.

    صمم النموذج لفهم أسلوب الكلام الطبيعي واستيعاب السياق، ثم تحويل التسجيلات الصوتية الخام إلى نص واضح ومنسق وأكثر قرب من الطريقة التي يكتب بها الإنسان فعليًا.

    وهذا يعني أن المستخدم لا يحصل بالضرورة على نص مليء بالتكرار والتلعثم وكلمات مثل “أمم” و”يعني” و”آه”، وإنما على نسخة أكثر نظافة وسلاسة، مع الحفاظ على المعنى المقصود من الكلام.

    وتصف Google النموذج بأنه أدق نماذجها لتحويل الكلام إلى نص حتى الآن، وهو جزء من منظومة Gemini Audio التي تستهدف تطبيقات صوتية متقدمة تشمل النسخ الصوتي والترجمة والتفاعل الصوتي في الوقت الحقيقي.

    Gemini 3.5 Transcribe أسرع بنسبة 70%

    من أبرز التحسينات التي قدمتها جوجل في النموذج الجديد السرعة، ووفقًا لقياسات Artificial Analysis، انخفض زمن الوصول إلى النص النهائي بنسبة 70% مقارنة بالنموذج السابق Chirp 3، وهو تحسن مهم للغاية، خصوصًا في التطبيقات التي تحتاج إلى الاستجابة الصوتية بسرعة.

    وتكتسب هذه السرعة أهمية خاصة في حالات الاستخدام المباشر، مثل المساعدات الصوتية، وخدمات العملاء، والتعليقات النصية الفورية، وتطبيقات الاجتماعات والمحادثات الصوتية.

    وتوفر جوجل إصدار مخصص للبث المباشر باستخدام Live API تحت اسم gemini-3.5-transcribe-live، مع بث مستمر ثنائي الاتجاه وزمن استجابة أقل من ثانية للتطبيقات الصوتية التفاعلية.

    أما الملفات المسجلة مسبقًا، فيمكن معالجتها عبر Interactions API باستخدام gemini-3.5-transcribe، مع إمكانيات مثل تحديد المتحدثين والطوابع الزمنية على مستوى الكلمات.

    Gemini 3.5 Transcribe Fleurs benchmark
    Image Credits: Google

    دقة عالية مع معدل خطأ منخفض

    لا تعتمد قوة Gemini 3.5 Transcribe على السرعة فقط، إذا حقق النموذج أيضًا أرقام قوية في اختبارات معدل أخطاء الكلمات، أو Word Error Rate (WER).

    وبحسب جوجل، سجل النموذج متوسط معدل خطأ بلغ:

    • 2.6% في حالات تحويل الصوت غير المباشر والملفات المسجلة.
    • 4.0% في حالات البث الصوتي المباشر.

    وتشير Google إلى أن هذه القياسات جاءت وفق اختبارات Artificial Analysis، كما أظهر النموذج أداء قوي في البيئات الواقعية المليئة بالضوضاء، بما في ذلك التعامل مع البيانات الأبجدية الرقمية مثل أرقام الطلبات والرموز البريدية.

    ومن المهم الإشارة إلى أن معيار WER يعبر عن نسبة أخطاء الكلمات، لذلك فإن انخفاض النسبة يعني عادة قدرة أفضل على التعرف على الكلام بدقة.

    وفي اختبار FLEURS متعدد اللغات، حقق النموذج معدل WER بلغ 5.50% في وضع البث المباشر و5.04% في وضع المعالجة غير المباشرة عبر مجموعة من اللغات واللهجات المحلية الرئيسية التي شملها الاختبار.

    الميزة الأبرز: فهم التصحيح والتلعثم أثناء الكلام

    ربما تكون أكثر ميزات Gemini 3.5 Transcribe إثارة للاهتمام هي قدرته على فهم التصحيحات الذاتية أثناء الكلام بدلًا من تسجيل كل كلمة بشكل حرفي.

    على سبيل المثال، إذا قال المستخدم “موعدنا الثلاثاء، لا خليه الأربعاء”

    تصف جوجل هذه الخاصية ضمن ما تسميه Smart Transcription، وهي آلية مصممة للتعامل مع التصحيحات الذاتية وإزالة كلمات الحشو وتنسيق النص تلقائيًا.

    هذه الإمكانية قد تكون مؤثرة جدًا في تحويل المحادثات اليومية أو تسجيلات الاجتماعات والمقابلات إلى نصوص قابلة للاستخدام مباشرة، لأن الكلام البشري عادة لا يأتي في صورة جمل مثالية ومنظمة.

    التخلص من كلمات الحشو

    يستطيع النموذج أيضًا إزالة كلمات الحشو مثل “أمم” و”آه” و”يعني” وغيرها من الأصوات والتعبيرات التي تظهر أثناء التفكير أو التردد.

    وبذلك يمكن تحويل تسجيل صوتي طبيعي إلى نص أكثر احترافية دون الحاجة إلى المرور على النص يدوي وحذف هذه العناصر واحدة تلو الأخرى.

    Gemini 3.5 Transcribe Smart Transcription
    Image Credits: Google

    دعم أكثر من 85 لغة ولهجة

    توسع جوجل نطاق Gemini 3.5 Transcribe ليشمل أكثر من 85 لغة، مع القدرة على اكتشاف اللغة تلقائيًا والتعامل مع اللهجات الإقليمية المتنوعة.

    وهذه الإمكانية مهمة بشكل خاص للتطبيقات العالمية التي لا تتعامل مع لغة واحدة فقط، بدل من السيناريوهات التي يحدث فيها الانتقال بين لغات مختلفة أثناء المحادثة نفسها.

    التعرف على عدة متحدثين وإضافة الطوابع الزمنية

    في الملفات الصوتية المسجلة، يوفر Gemini 3.5 Transcribe أيضًا إمكانية تحديد المتحدثين وإسناد الكلمات إلى أصحابها.

    وتدعم النسخة الحالية تحديد ما يصل إلى ثلاثة متحدثين بصورة دقيقة، بينما ما يزيد على ثلاثة متحدثين لا يزال في المرحلة التجريبية.

    وهذا يجعل النموذج مناسب بشكل خاص لتسجيل الاجتماعات والمقابلات والمكالمات، حيث لا يكفي معرفة النص فقط، بل من المهم معرفة من قال كل جزء من المحادثة ومتى قيل.

    أين يمكن استخدام Gemini 3.5 Transcribe؟

    يفتح النموذج الباب أمام عدد كبير من التطبيقات العملية، خصوصًا للمطورين والشركات، ومن أبرز السيناريوهات المحتملة:

    الاجتماعات والمقابلات

    يمكن تحويل الاجتماعات والمقابلات المسجلة إلى نص منظم، مع تحديد المتحدثين والطوابع الزمنية، وهو ما يسهل عمليات المراجعة والأرشفة والبحث داخل التسجيلات.

    Gemini 3.5 Transcribe Post-call analytics
    Image Credits: Google

    مراكز الاتصال وخدمة العملاء

    يمكن استخدام النسخ الصوتي في تحليل المكالمات واستخراج المعلومات المهمة من المحادثات، وهو أحد الاستخدامات التي تستهدفها جوجل ضمن مسارات Post-call analytics.

    التعليقات النصية المباشرة

    زمن الاستجابة المنخفض يجعل النموذج مناسب للتطبيقات التي تحتاج إلى عرض الكلام كنص أثناء حدوث المحادثة.

    إنشاء المحتوى

    يمكن لمنشئي المحتوى استخدامه لتحويل المقابلات والتسجيلات والبودكاست والأفكار الصوتية إلى نصوص أولية يمكن تعديلها وتحويلها لاحقًا إلى مقالات أو منشورات أو نصوص فيديو.

    التطبيقات الصوتية ووكلاء الذكاء الاصطناعي

    تستطيع الشركات دمج النموذج في وكلاء صوتيين وتطبيقات تعتمد على المحادثة، مع الاعتماد على البث الصوتي المباشر منخفض التأخير لبناء تجارب طبيعية وسريعة.

    الخلاصة

    يبدو أن جوجل تريد مع Gemini 3.5 Transcribe إعادة تعريف ما يمكن أن يعنيه تحويل الكلام إلى نص، فبدل من الاكتفاء بالتعرف على الأصوات وتحويلها إلى كلمات، أصبح التركيز على فهم السياق، تصحيح الكلام، حذف الحشو، تحديد المتحدثين، التعامل مع اللغات واللهجات، وإنتاج نص جاهز للاستخدام.

    ومع سرعة أعلى بنسبة 70% في زمن الوصول إلى النص النهائي مقارنة بـ Chirp 3، ومعدل خطأ يبلغ 2.6% للمعالجة غير المباشرة و4% للبث المباشر وفق قياسات Artificial Analysis، يقدم النموذج مزيج قوي من الدقة والسرعة والذكاء السياقي.

    والميزة التي قد تكون الأكثر أهمية للمستخدمين العاديين ليست رقم السرعة أو معدل الخطأ فقط، وإنما قدرة النموذج على فهم أن البشر يترددون ويغيرون رأيهم ويصححون كلامهم أثناء الحديث.

    AI DeepMind Gemini Gemini 3 Gemini 3.5 Gemini 3.5 Transcribe Google Google AI Internet الذكاء الاصطناعي انترنت تقنية جوجل
    شاركها. فيسبوك تويتر لينكدإن البريد الإلكتروني واتساب Copy Link
    السابقسامسونج تطلق Galaxy S26 FE رسميًا – المواصفات الكاملة والمميزات
    التالي أهم الأجهزة المنتظر الإعلان عنها في مؤتمر Apple يوم 9 سبتمبر

    المقالات ذات الصلة

    هواتف ذكية

    شاومي تعلن عن Xiaomi 18 Fold لمنافسة ايفون الترا

    8 سبتمبر، 2026
    لابتوب

    لينوفو تطلق سلسلة لابتوبات IdeaPad Vibe بتصميمات شبابية

    8 سبتمبر، 2026
    اكسسوارات

    مواصفات ساعة HUAWEI WATCH D3 الجديدة

    7 سبتمبر، 2026
    أفضل المقالات

    تفاصيل العرض المطول لـ GTA VI – الجرافيكس وأسلوب اللعب ينسف التسريبات!

    28 أغسطس، 20261٬519

    كيف تختار المعالج المناسب لتجميعة الـ PC في 2026؟ الدليل الشامل

    18 أغسطس، 20261٬494

    إنفيديا تعلن عن DLSS 5 – ستحول ألعابك إلى أفلام هوليوود

    18 مارس، 20261٬405
    تابعنا على
    • Facebook
    • Instagram
    • Twitter
    • YouTube
    • TikTok
    • LinkedIn
    أحدث المراجعات
    8.4
    هواتف ذكية

    مراجعة Vivo X300 FE بعدسات ZEISS وسعر منافس

    17 أغسطس، 2026
    8.6
    لابتوب

    مراجعة ASUS Vivobook S16 (S3607) – معادلة الإنتاجية المثالية

    10 أغسطس، 2026
    8.4
    هواتف ذكية

    مراجعة OPPO Reno 16F – هل يستحق الشراء في الفئة المتوسطة؟

    3 أغسطس، 2026
    الأكثر شهرة

    تفاصيل العرض المطول لـ GTA VI – الجرافيكس وأسلوب اللعب ينسف التسريبات!

    28 أغسطس، 20261٬519

    كيف تختار المعالج المناسب لتجميعة الـ PC في 2026؟ الدليل الشامل

    18 أغسطس، 20261٬494

    إنفيديا تعلن عن DLSS 5 – ستحول ألعابك إلى أفلام هوليوود

    18 مارس، 20261٬405
    من اختيارنا

    معرض CES 2026 – ملخص اليوم الثاني في لاس فيغاس

    8 يناير، 2026

    صفقة Anthropic مع SpaceX – أخيرًا كلود ترفع حدود الاستخدام!

    7 مايو، 2026

    أبل تطلق تحديث iOS 26.3 – المميزات الجديدة وكيفية التحديث

    16 فبراير، 2026
    Tec99
    فيسبوك الانستغرام X (Twitter) يوتيوب تيكتوك
    • الرئيسية
    • معلومات عنا
    • سياسة الخصوصية
    • تواصل معنا
    © tec99.net 2026

    اكتب كلمة البحث ثم اضغط على زر Enter