ملخص المحتوى الرئيسي
أطلقت جوجل ثلاث نماذج كبيرة من سلسلة Gemini Flash في غضون ستة أسابيع فقط، حيث يظل النموذج الأحدث، 3.8 Flash، بسعر مقبول للغاية (0.75 دولار أمريكي مقابل مليون توكن، و3.75 دولار أمريكي كناتج)، وتظهر بيانات الأداء ممتازة (مساوٍ في البرمجة مع Claude Opus 5، ويتفوق في التفكير الاستدلالي على GPT-5.6 Sol)، كما تم إطلاق نسخة متخصصة في الأمن السيبراني تُسمى Cyber. لكن في الاستخدام الفعلي، وجد المستخدمون العاديون أن أداء النموذج جيد على الورق لكنه ضعيف في التطبيق العملي؛ حيث تعتمد العروض الرسمية على إعدادات خاصة، ويفتقر إلى القدرة على إكمال المهام الطويلة، وتكون معالجة التفاصيل غير دقيقة. السبب وراء ذلك هو صعوبات في إطلاق النموذج الرائد لجوجل، Gemini Pro، بالإضافة إلى هجرة المواهب الأساسية في مجال التكنولوجيا، مما جعل جوجل تعتمد على نماذج أصغر مثل Flash للحفاظ على حضورها في السوق.
أولاً: النموذج الأقوى بسعر مقبول
يُعتبر 3.8 Flash “أذكى نموذج في سلسلة Flash”، حيث تم تعزيز قدراته بشكل خاص في مجالات البرمجة طويلة الأجل، والتفكير الاستدلالي المعقد، وسيناريوهات الوكلاء المتخصصين، ومع ذلك يظل سعره مماثلاً للجيل السابق، 3.7 Flash:
- قدرات برمجية قريبة من الذروة: حقق 73.7% في اختبار البرمجة طويلة الأجل DeepSWE، مساوياً لـ Claude Opus 5 (74%)، لكن بتكلفة أقل بخمس مرات (2.36 دولار مقابل 11.84 دولار لكل سؤال)؛ وحقق 89.4% في اختبار Terminal-Bench 2.1، مما جعله أول نموذج من سلسلة Flash يقترب من عتبة 90%.
- تفكير استدلالي متعدد التخصصات في المستوى الأول: حقق 54.9% في اختبار HLE الشامل لمجالات STEM والعلوم الإنسانية، أعلى قليلاً من Opus 5 (54.4%) وGPT-5.6 Sol (54.5%).
- تفوق في السيناريوهات المتخصصة: حقق 61.4% في اختبار الوكلاء الماليين (Vals V2)، متجاوزاً GPT-5.6 Sol (53.8%)؛ وبلغت نسبة النجاح في اختبار الوكلاء القانونيين (Harvey) 10%، وهو ما يزيد عن ضعف نسبة Opus 5.
- النسخة السيبرانية متخصصة في الأمن: بلغت نسبة اكتشاف الثغرات 86.2% (أعلى من GPT-5.5-Cyber)، وكانت تكلفة إصلاح الثغرات أقل، كما أن الإصلاحات الصحيحة التي أنتجها فريق Chrome كانت أفضل بـ 2.6 مرة من النماذج الأخرى، لكنها متاحة فقط للمدافعين الموثوق بهم.
السر يكمن في أن 3.8 Flash يفكر بشكل أكثر عمق عند مواجهة المهام الصعبة؛ على سبيل المثال، في المهام البرمجية، ينتج 36,000 توكن إضافية وينفذ 41 خطوة إضافية مقارنة بـ 3.7 Flash، وعلى الرغم من ارتفاع التكلفة الفعلية للمهام المعقدة (من 0.4 دولار إلى 0.58 دولار)، إلا أن السعر الإجمالي لا يزال أقل بكثير من النماذج الرائدة.
ثانياً: الأداء الجيد على الورق لكنه ضعيف في التطبيق العملي
في العروض الرسمية، استطاع 3.8 Flash بناء قلاع ثلاثية الأبعاد واستخدام خرائط جوجل في نسخة DOS، لكن المستخدمين العاديين وجدوا فروقاً كبيرة عند استخدامه:
- إعدادات غير موحدة: تعتمد العروض الرسمية على منصة Antigravity وأوامر دورية بالإضافة إلى أداة Nano Banana لإنشاء النصوص المرئية، بينما يحصل المستخدمون العاديون على نموذج أساسي فقط. على سبيل المثال، عند استخدام Three.js لبناء مروحية أيرباص، يتم إنتاج النتيجة في 109 ثوانٍ، لكن تكون أجزاء الطائرة غير دقيقة وحركتها غير طبيعية؛ وفي محاكاة البراكين ثلاثية الأبعاد، تظهر مشاكل في تدفق المياه.
- سريع لكن الجودة ضعيفة: في لعبة Sticky Ball، يعمل النموذج بسرعة لكن آليات الحركة والأداء أقل جودة مقارنة بـ Kimi K3؛ وفي اختبار سوق مدينة نيويورك، تم وضع 6 أشجار فقط (أقل من 10 أشجار في النسخة 3.7 Flash)، مع إغفال متطلبات مثل الممرات المشاة والتأثيرات المائية، بالإضافة إلى إضافة إعدادات غير ضرورية للكاميرات ومعالجة بعدية.
- قصور في القدرة على إكمال المهام الطويلة: حقق 19.1% فقط في اختبار Terminal-Bench 4.0 (الذي يتطلب مهاماً أكثر صعوبة)، مقارنة بـ 51.8% لـ Opus 5؛ وحقق 59% في اختبارات التشغيل على أجهزة الكمبيوتر في OSWorld (مقارنة بـ 75.4% لـ Opus 5). يحتل المركز الثامن في التصنيف الشامل من حيث الذكاء، لكنه يظهر ضعفاً في المهام المتعددة التخصصات.
ثالثاً: الضغوط وراء إطلاق النماذج الجديدة بسرعة
السبب وراء إصدار جوجل لنماذج Flash بسرعة ليس بسبب تقدم تقني كبير، بل بسبب الضغوط التي تواجهها:
- تأخر إطلاق النموذج الرائد: قال بيتشاي في مايو من هذا العام إن النسخة الجديدة من Pro ستصدر بعد شهر، لكن تم إلغاء خطة النسخة 3.5 Pro، ولا يزال تطوير Gemini 4 متوقفاً في مرحلة متأخرة.
- هجرة المواهب الأساسية: غادر عدد من الخبراء البارزين مثل Noam Shazeer وJeff Dean خلال النصف شهر الماضي، مما أدى إلى عدم الاستقرار في الفريق. يطالب الإدارة الجديدة بتسريع وتيرة الإصدارات.
- نموذج Flash كحل مؤقت: نظراً لصغر حجم نموذج Flash واحتياجه إلى قدرات حسابية أقل مقارنة بسلسلة Pro، يمكن لعدة فرق داخل الشركة تجربة حلول مختلفة بشكل متزامن وإجراء تحديثات كل ثلاثة أسابيع؛ بينما يتطلب تعديل سلسلة Pro استخدام عدد أكبر من وحدات المعالجة الرسومية ووقتاً أطول، مما يزيد من تكاليف التجارب.
لذلك، فإن إطلاق ثلاث نماذج جديدة في غضون ستة أسابيع يعكس محاولة جوجل للحفاظ على حضورها في السوق في ظل تأخر النموذج الرائد وهجرة المواهب.
رابعاً: المكانة الحقيقية لنموذج Flash
نموذج Flash ليس الهدف النهائي لجوجل، لكنه الحل الأكثر فعالية في الوقت الحالي:
- ليس نموذجاً رائداً شاملاً: تكشف الاختبارات العملية عن وجود فجوات في أدائه مقارنة بالنماذج الرائدة (ضعف في المهام الطويلة وعدم دقة في التفاصيل).
- لكنه كافٍ كحل مؤقت: بسعره المنخفض وقدرته على التحديث السريع، يمكنه مساواة أداء النماذج الرائدة في سيناريوهات معينة (مثل البرمجة والوكلاء الماليين)، مما يساعد جوجل على الحفاظ على حصتها في السوق واهتمام المطورين حتى يتم إطلاق النموذج الرائد Gemini Pro وGemini 4.
باختصار، نموذج Flash يعتبر “لاعباً انتقالياً” لجوجل؛ فالفوز النهائي يعتمد على النموذج الرائد، لكن في الوقت الحالي يُستخدم للحفاظ على مكانة الشركة في سباق النماذج الكبيرة.
خلاصة
تعتبر سلسلة Flash من جوجل مثالاً على النماذج ذات الكفاءة العالية مقابل السعر: فهي تتفوق في بعض المجالات (مثل البرمجة والتحليل المالي) مقارنة بالنماذج الأفضل، لكن قدراتها الشاملة لا تزال غير كافية. وراء إطلاق النماذج الجديدة بسرعة تكمن ضغوط جوجل الناتجة عن تأخر النموذج الرائد وهجرة المواهب، مما دفعها إلى الاعتماد على نماذج أصغر للحفاظ على حضورها في السوق. بالنسبة للمستخدمين، إذا كنت بحاجة إلى استخدامات محددة (مثل البرمجة أو التحليل المالي البسيط)، فهو خيار ممتاز؛ لكن للمهام المعقدة، قد يكون من الأفضل الانتظار حتى إطلاق النماذج الرائدة. أما بالنسبة للصناعة، فإن ذلك يعكس المنافسة الشرسة في مجال النماذج الكبيرة، حيث لا يجرؤ أحد على التوقف، حتى لو كان ذلك يعني الاعتماد على نماذج أصغر ولكن بتقدم سريع.