أعلنت جوجل عن تحديث جوهري لمنهجية Android Bench — نظام التقييم الذي أطلقته في مارس 2026 لمقارنة أداء نماذج الذكاء الاصطناعي في كتابة كود أندرويد. التغيير الأبرز هو التخلي عن أداة mini-swe-agent v1 والانتقال إلى إطار العمل المعياري Harbor، مما يفتح الباب أمام المطورين للمشاركة الفعلية في تشكيل المعيار.
ما الذي تغيّر في المنهجية؟
- الانتقال من أداة قياس مخصصة إلى إطار Harbor المفتوح والمعياري
- جوجل تفتح Android Bench لاستقبال مهام برمجية حقيقية من مطوّري الأندرويد لتحسين مجموعة الاختبارات
- المطورون مدعوون لمشاركة تقييماتهم الخاصة على المنصة
- إعادة تقييم جميع النماذج الموجودة وفق المعيار الجديد
ترتيب النماذج الجديد
| النموذج | النتيجة | متوسط التأخر | متوسط التكلفة |
|---|---|---|---|
| Claude Fable 5 | 84.5 | 8.0s | $133.2 |
| GPT-5.5 | 80.2 | 15.7s | $138.3 |
| Claude Sonnet 5 | 76.2 | 12.3s | $99.9 |
| GPT-5.4 | 74.1 | 8.4s | $83.4 |
| Gemini 3.1 Pro Preview | 73.7 | 10.6s | $87.4 |
| Claude Opus 4.8 | 72.4 | 6.7s | $88.0 |
| GLM 5.2 | 72.2 | 38.9s | $117.0 |
| Gemini 3.5 Flash | 71.1 | 28.3s | $165.6 |
| Kimi K2.7 Code | 70.4 | 31.8s | $48.1 |
ملاحظات جوهرية
- Claude Fable 5 يتصدر بفارق 4.3 نقطة عن GPT-5.5 رغم أنه لا يزال خاضعًا لقيود صارمة
- Kimi K2.7 Code يبرز كأفضل خيار من حيث التكلفة بـ $48.1 فقط مقابل أداء تنافسي
- Gemini 3.5 Flash يُسجّل أعلى تكلفة ($165.6) مع نتيجة أداء متواضعة نسبيًا
- هذا التقييم خاص ببرمجة أندرويد تحديدًا — وليس مقياسًا عامًا لقدرات النماذج
خطوة ذكية من جوجل — بفتح Android Bench أمام المجتمع وتبني إطار معياري، يتحول من مجرد قائمة تسويقية إلى مرجع تقني حقيقي يصنعه المطورون أنفسهم.