مشروع livenerf يقيس بالأرقام ما إذا كان أداء Claude Opus 5.5 يتراجع بعد إطلاقه
الإحساس بتراجع جودة نموذج لا يثبت شيئًا، لكن عدّاد الـ tokens قد يفعل. فخفض مستوى التفكير يغيّر الاستهلاك بأكثر مما يغيّر الدقة.
وسم
مقاييس مقارنة النماذج مثل SWE-bench وLMArena: ما الذي تقيسه، وأين تقع النماذج الجديدة فيها، ولماذا لا تكفي النتيجة المعلنة من الشركة وحدها.
الإحساس بتراجع جودة نموذج لا يثبت شيئًا، لكن عدّاد الـ tokens قد يفعل. فخفض مستوى التفكير يغيّر الاستهلاك بأكثر مما يغيّر الدقة.
الفارق بين الطريقة الأبسط والنموذج الأكبر قد يكون بضع نقاط وقد يكون صفرًا، ولا يظهر إلا بالقياس على بيانات المنتج نفسه، قبل الالتزام بتكلفة API على كل طلب.
التقييمات التي أُجريت على النموذجين في أيامهما الأولى قاست خللًا في خطوة قبل النموذج لا النموذج نفسه، والانطباع الذي تكوّن حينها قد يبقى بعد زوال سببه.
من يستخرج بيانات بنموذج لغوي دون تعليمة صريحة للحقول الغائبة قد يحصل على حقل مختلق من كل ثلاثة حقول ناقصة، بشكل سليم لا يلفت النظر. وخدمة مدفوعة واحدة كانت أسوأ من معظم النماذج.
نسبة الثقة قد تؤدي وظيفة نفسية أكثر منها هندسية، إذ تمنح شعورًا بالتحكم في المخاطرة دون قياسها، ويظهر ذلك بعد الإطلاق حين يُسأل عن مصدر الحد الفاصل.
فئة النموذج السريع والرخيص والأقل ذكاء صار فيها مرشح جدي، فأصبح اختيار النموذج قرار منتج يتعلق بما ينتظره المستخدم، لا قرارًا تقنيًا فقط.
حين يكون النموذج أرخص بفارق كبير وأضعف بفارق قابل للقياس، يصبح الاختيار بين النماذج قرارًا بحسب شكل المهمة لا بحسب ترتيب الجداول.
حين يكون الوقت جزءًا من المهمة، يصبح التفكير الإضافي تكلفة لا ميزة، ويصبح فشل التنسيق بين الـ agents أخطر من ضعف النموذج نفسه.
في تشغيل النماذج محليًا، القرار الحاسم ليس اختيار النموذج بل اختيار نسخته المضغوطة، وهو الطريق الوحيد المتاح لمن لا يملك وسيلة دفع دولية.
الرقم نفسه كان صحيحًا في المرتين، والإعداد هو الذي روى قصتين متعاكستين. أول سؤال أمام أي اختبار أداء ليس من فاز، بل كيف قيس.
جزء من فاتورة الـ coding agents لا يذهب إلى العمل بل إلى السياق الذي ترسله الأداة في أول نداء، ويُدفع تلقائيًا عند قبول الأداة الافتراضية دون مقارنة.
جدول النتائج النهائي يخبر بالنتيجة، أما اللوحة الحية فتكشف التكلفة: التشغيلات التي توقفت، والبيانات التي حُذفت، والساعات التي ضاعت في خطأ لم يُكتشف.
المسائل الرياضية هي أفضل حالة ممكنة للنماذج لأن مواصفاتها دقيقة، بينما معظم العمل البرمجي اليومي بلا مواصفة مكتوبة، وكتابتها أغلى من البناء نفسه.
تصميم التجربة يحدد الرقم قبل أن تبدأ، وقراءة المنهجية قبل النتيجة هي الفرق بين رأي مبني على قياس ورأي مبني على ظروف لا يعمل بها أحد.
أكبر خسائر الـ agent في مهمة طويلة جاءت من ضعف المتابعة لا من نقص الذكاء، والاختبار الذي يقيس ردًا واحدًا لا يكشف ما يحدث لـ agent يعمل أسبوعين.
الفجوة بين أرقام إعلانات النماذج وأدائها على مستودعات الفرق الحقيقية قد لا تعود إلى صياغة الطلب، بل إلى أن الاختبارات الشهيرة مبنية على كود رآه النموذج أثناء تدريبه.
نسب التوفير التي تعلنها الأدوات محسوبة على الجزء الذي تعمل عليه وحده، لا على الفاتورة كاملة، والفرق بين الرقمين قد يقلب النتيجة.
نسبة توفير بلا سعر أساس معلن لا تدخل في أي حساب، ونموذج بلا API مستقل ولا أوزان مفتوحة هو اشتراك في منتج أكثر منه نموذجًا يُبنى عليه.
الخلاف حول ضرر الضغط على النماذج يحسمه عدد الـ bits: عند 4 bits لا فرق يُذكر ويكفي كارت واحد، وعند 1 bit ينهار النموذج.
الاختبار المنشور يتسرّب مع الوقت إلى بيانات التدريب، فتقيس الدرجة أن النموذج رأى السؤال لا أنه يعرف حله، والمرتبة الأولى في الترتيب العام لا تعني الأفضل في كل مهمة.
سعر الـ token المتطابق لا يعني فاتورة متطابقة. فالنموذج الأدق يستهلك ضعف الـ tokens، والمقارنة الصحيحة تكون على بيئة اختبار واحدة لا بين جدولين.
حين يتجاوز الجميع 95% في اختبار واحد، يصبح الرقم دليلًا على الانتماء إلى المجموعة لا على التفوق، ويصعب معه التمييز بين نموذج أرخص قريب فعلًا ونموذج لا يرى الاختبار الفرق بينهما.
القرار الحقيقي ليس أي نموذج أقوى، بل هل تستفيد المهمة من تفكير إضافي. وإعداد الـ effort الافتراضي، الذي لا يراجعه أحد، قد يحدد الفاتورة أكثر من اسم النموذج.
العائق أمام تشغيل نموذج قوي على خوادم الفريق نفسه لم يكن الرخصة بل التكلفة والقدرة، وكلاهما يتحرك بسرعة. لكن السعر المنخفض للـ API لا يعني أن التشغيل الذاتي مجاني.
التحسن هنا جاء من التدريب اللاحق وحده دون تغيير المعمارية، ومع رخصة MIT يصبح نموذج قادر على العمل البرمجي متاحًا للتشغيل الذاتي دون ربطه بحساب أو قرار خارجي.
الرقم الضخم في عنوان إعلان النموذج لا يكفي لاتخاذ قرار، فالأرقام الغائبة عن الإعلان هي التي تحدد الجودة والتكلفة وإمكانية التشغيل المحلي.
جزء مما يبدو ضعفًا في النموذج هو في الحقيقة أدوات تعيد نتائج ناقصة دون أن تعلن ذلك، وإصلاح الأداة قد يغني عن تبديل النموذج.
النموذج الأول في جداول الترتيب قد يكون الخامس في مهمة بعينها، والسعر والسرعة والإتاحة في المنطقة تحسم الاختيار بقدر ما يحسمه رقم الاختبار.