الوكلاء الذين يعيدون قراءة السياق نفسه طوال اليوم هم أكثر من يستفيد من هذا الخفض، وأثره يظهر في الفاتورة الشهرية لا في العرض التجريبي، بينما يبقى سببه دون تأكيد رسمي.
الخطآن ليسا في الحساب بل في افتراضين صارا قديمين: أن سعر التوكن ثابت مهما كانت العملية، وأن كل دورة فيها استدعاء واحد للنموذج. وأي أداة لقياس الاستهلاك قد تقع فيهما.
الانتظار عند كل استدعاء أداة هو مصدر معظم البطء في الـ agents متعددة الخطوات، لكن المزايا الجديدة محصورة في Responses API، والانتقال من Chat Completions ليس تعديلًا بسيطًا.
التسعير الجديد يكافئ جلسات الـ agents الطويلة بدل أن يعاقبها، لأن الجزء المتكرر من السياق هو الأكبر فيها. لكن تغيير tool_choice قد يكسر كودًا قائمًا عند الانتقال.
الفحص كان موجودًا وصحيحًا، لكن ترتيبه بعد فك الأرشيف كان يترك محتوى مرفوضًا على القرص، وكثير من مشاكل سلسلة التوريد تأتي من ترتيب الخطوات لا من كسر التشفير.
فاتورة نموذج الذكاء الاصطناعي لم تعد مرتبطة بالنموذج وحده بل بساعة الاستخدام أيضًا، وأكبر زيادة وقعت على البند الذي تعتمد عليه الـ agents أكثر من غيرها.
حين يرث الـ subagent الـ prompt cache لا يدفع مجددًا ثمن قراءة السياق نفسه، وحين تتراسل الجلسات بالاسم يصبح الجهاز الواحد أقرب إلى فريق صغير من الوكلاء.