4 دقيقة قراءة
GPT-5.6 Sol Hits 750 Tokens a Second. Agent Latency Just Became a Buying Decision

Category
عالم الذكاء الاصطناعي
Share the article
يعمل نموذج GPT-5.6 Sol الجديد من OpenAI بسرعة تصل إلى 750 رمزاً (token) في الثانية على أجهزة Cerebras، وهو ما يعادل تقريباً 5 أضعاف سرعة الـ 150 رمزاً في الثانية التي تقدمها معظم النماذج المستخدمة في الإنتاج اليوم. بالنسبة لروبوت دردشة، تبدو هذه السرعة "فورية في كلتا الحالتين". أما بالنسبة لوكيل مؤسسي يربط بين 30 أو 40 استدعاءً للنموذج لإنهاء مهمة مكتبية خلفية واحدة، فإن مضاعفة السرعة بـ 5 مرات تترجم إلى الفرق بين سير عمل ينتهي في ثوانٍ وآخر ينتهي في دقائق. لقد توقفت السرعة عن كونها ميزة إضافية لطيفة، وأصبحت بنداً أساسياً في قائمة مرجعية الشراء.
تركز معظم التغطية الخاصة بإطلاق 9 يوليو على فئات الأسعار ونتائج اختبارات القياس (benchmarks). لكن القصة الأكثر فائدة لأي شخص يشغّل وكلاء بالفعل هي معدل الإنتاجية (throughput)، لأن معدل الإنتاجية هو الضريبة التي تدفعها على كل خطوة منفردة، والوكلاء يتخذون الكثير من الخطوات.
لماذا تهم سرعة النموذج الفردي الوكلاء أكثر من الدردشة
يقرأ الشخص الذي يكتب لروبوت دردشة بمعدل يتراوح بين 5 إلى 10 رموز في الثانية تقريباً. وأي نموذج أسرع من ذلك يبدو فورياً، لذا فإن تحسينات السرعة في السنوات القليلة الماضية كانت غير مرئية بالنسبة للمستخدمين النهائيين. لكن الوكلاء غيروا هذه القاعدة.
فالوكيل الذي يؤدي مهمة حقيقية، مثل فحص مرشح لوظيفة، أو مطابقة فاتورة بأمر شراء، أو تسوية دفعة مالية، لا يقوم باستدعاء واحد للنموذج. بل يقوم بالعشرات: قراءة المستند، واستخراج الحقول، والتحقق منها بمطابقتها مع النظام، وتحديد الإجراء التالي، وصياغة الرد، والتحقق من صحته. وتنتظر كل خطوة الخطوة التي تسبقها. وبالتالي، فإن زمن الاستجابة (latency) ليس تكلفة ثابتة تدفعها لمرة واحدة، بل يتضاعف بعدد الخطوات في سير العمل.
هذا هو السبب في أن نموذج GPT-5.6 Sol بسرعة 750 رمزاً في الثانية يعد إنجازاً أكبر مما يبدو عليه. (وقد شاركت OpenAI المجموعة الكاملة في إعلان إطلاق GPT-5.6). إن سير العمل المكون من 40 خطوة والذي كان يستغرق 8 ثوانٍ لكل خطوة، يستغرق الآن ما يقارب ثانيتين. وعبر آلاف عمليات التشغيل يومياً، يغير هذا من طبيعة المهام التي يمكنك إسنادها للوكيل. فالمحادثات المباشرة مع العملاء، واستلام المطالبات في نفس اليوم، وأي عملية ينتظر فيها عنصر بشري، كلها تصبح قابلة للتطبيق عندما ينخفض زمن الرحلة الكاملة (round trip) إلى ما دون الحد الذي يمكن للناس تحمله بالفعل.
التسعير يوضح أن OpenAI تفكر في حجم الاستخدام الكبير
جاء إطلاق GPT-5.6 في ثلاثة نماذج وليس نموذجاً واحداً، وتشكيل هذه المجموعة هو الجزء المثير للاهتمام:
النموذج | الدور | السعر لكل مليون رمز (مدخلات / مخرجات) |
|---|---|---|
Sol | النموذج الرائد، الأسرع على أجهزة Cerebras (~750 رمز/ثانية) | $5 / $30 |
Terra | متوازن، يعادل GPT-5.5 وبتكلفة أرخص بضعفين تقريباً | $2.50 / $15 |
Luna | للأحجام الكبيرة، التكلفة الأقل | $1 / $6 |
إن وجود عائلة نماذج متعددة المستويات تبدأ أسعارها من 1 دولار إلى 30 دولاراً لكل مليون رمز مخرجات يدل على أن الشركة تصمم لوكلاء يقومون بملايين الاستدعاءات، وليس لشخص واحد في نافذة دردشة. نموذج Luna بسعر 1 دولار للمدخلات / 6 دولارات للمخرجات موجود لتتمكن من تشغيل الخطوات الرخيصة وعالية التكرار على نموذج منخفض التكلفة. بينما يوجد Sol للخطوات التي تحسم فيها السرعة أو التفكير المنطقي النتيجة فعلياً.
وهذا يشير إلى الدرس الحقيقي، وهو ليس "تحويل كل شيء إلى Sol".
لا يوجد نموذج واحد يفوز في كل خطوة من خطوات سير العمل
يكمن الإغراء مع أي نموذج رائد جديد في توجيه كل المهام إليه. لكن هذه قراءة خاطئة. فقد يستخدم سير عمل فحص المرشحين نموذجاً سريعاً ورخيصاً لتحليل 500 سيرة ذاتية، ونموذجاً أقوى لتصنيف القائمة المختصرة، ونموذجاً دقيقاً لصياغة رسائل التواصل. إن دفع أسعار مخرجات النموذج الرائد لمجرد إعادة تنسيق رقم هاتف هو تضييع للمال بلا فائدة.
لقد جادلنا سابقاً بأن نموذجاً واحداً لا يمكن أن يناسب كل الأعمال، وتشكيلة GPT-5.6 المكونة من ثلاثة مستويات هي اعتراف من OpenAI بنفس هذه النقطة في إصدار واحد. لا تكمن المهمة في اختيار النموذج الأفضل، بل في توجيه كل خطوة إلى النموذج الذي يحقق المعايير المطلوبة لتلك الخطوة بأقل تكلفة وزمن استجابة، والقدرة على استبدال النماذج في الأسبوع الذي يصدر فيه نموذج أسرع دون إعادة بناء سير العمل بالكامل.
هذا التوجيه هو بالضبط الغرض من وجود منصة وكلاء مستقلة عن النماذج (model-agnostic). فعندما يكون Sol هو الأسرع هذا الربع، ويكون شيء آخر هو الأسرع في الربع القادم، ستود لو أنك تغير إعداداً واحداً فقط، لا أن تعيد هيكلة عملياتك بالكامل.
ما يجب عليك فعله حيال ذلك فعلياً
قم بقياس سير العمل لديك من البداية إلى النهاية بالوقت الإجمالي، وليس بنتائج اختبارات القياس للنماذج. فالنموذج الذي يحقق 3 نقاط أعلى في اختبار القياس ولكنه بنصف السرعة قد يكون الاختيار الخاطئ لسير عمل مباشر وتفاعلي.
حدد الخطوات التي ينتظر فيها الإنسان. هذه هي الخطوات التي يغطي فيها معدل إنتاجية مثل Sol تكلفته وزيادة. أما الخطوات الجماعية (batch) التي تُشغل ليلاً فلا تحتاجه.
لا تعتمد على نموذج واحد كمعيار قياسي لجميع المهام. وزع المهام بحسب الخطوة. واحتفظ بالنموذج السريع والمكلف للحظات التي تحتاج إليه فعلاً.
تحقق من توفره قبل التخطيط بناءً عليه. يتم إطلاق أسرع إعداد لـ Sol لشركاء محدودين أولاً ويتوسع مع زيادة السعة، لذا تعامل مع الرقم 750 كحد أقصى، وليس كواقع متاح للجميع من اليوم الأول.
العنوان الرئيسي هو نموذج OpenAI أسرع. والقصة الكامنة وراءه هي أن الوكلاء غيروا مفهوم "سريع بما يكفي"، وأصبحت السرعة الآن شيئاً تشتريه لغرض محدد، وليست شيئاً مفروغاً منه.
هل تريد رؤية قراءات الوكيل المؤسسي لإصدارات مثل هذه؟ نرسل تقريراً أسبوعياً موجزاً حول ما يهم فعلياً الفرق التي تشغل الوكلاء في مرحلة الإنتاج. احصل عليه هنا.





