أعلنت جوجل عن تحديث جوهري لمنهجية Android Bench — نظام التقييم الذي أطلقته في مارس 2026 لمقارنة أداء نماذج الذكاء الاصطناعي في كتابة كود أندرويد. التغيير الأبرز هو التخلي عن أداة mini-swe-agent v1 والانتقال إلى إطار العمل المعياري Harbor، مما يفتح الباب أمام المطورين للمشاركة الفعلية في تشكيل المعيار.

ما الذي تغيّر في المنهجية؟

  • الانتقال من أداة قياس مخصصة إلى إطار Harbor المفتوح والمعياري
  • جوجل تفتح Android Bench لاستقبال مهام برمجية حقيقية من مطوّري الأندرويد لتحسين مجموعة الاختبارات
  • المطورون مدعوون لمشاركة تقييماتهم الخاصة على المنصة
  • إعادة تقييم جميع النماذج الموجودة وفق المعيار الجديد

ترتيب النماذج الجديد

النموذج النتيجة متوسط التأخر متوسط التكلفة
Claude Fable 5 84.5 8.0s $133.2
GPT-5.5 80.2 15.7s $138.3
Claude Sonnet 5 76.2 12.3s $99.9
GPT-5.4 74.1 8.4s $83.4
Gemini 3.1 Pro Preview 73.7 10.6s $87.4
Claude Opus 4.8 72.4 6.7s $88.0
GLM 5.2 72.2 38.9s $117.0
Gemini 3.5 Flash 71.1 28.3s $165.6
Kimi K2.7 Code 70.4 31.8s $48.1

ملاحظات جوهرية

  • Claude Fable 5 يتصدر بفارق 4.3 نقطة عن GPT-5.5 رغم أنه لا يزال خاضعًا لقيود صارمة
  • Kimi K2.7 Code يبرز كأفضل خيار من حيث التكلفة بـ $48.1 فقط مقابل أداء تنافسي
  • Gemini 3.5 Flash يُسجّل أعلى تكلفة ($165.6) مع نتيجة أداء متواضعة نسبيًا
  • هذا التقييم خاص ببرمجة أندرويد تحديدًا — وليس مقياسًا عامًا لقدرات النماذج

خطوة ذكية من جوجل — بفتح Android Bench أمام المجتمع وتبني إطار معياري، يتحول من مجرد قائمة تسويقية إلى مرجع تقني حقيقي يصنعه المطورون أنفسهم.

المصدر:

9to5Google