news

وضع OpenAI فائق السرعة: ماذا يعني تسريع 14 ضعفاً للعملاء الذكيين (2026)

١٧ أغسطس ٢٠٢٦

OpenAI Ultrafast Mode: What 14x Means for Agents (2026)

وضع OpenAI Ultrafast هو فئة خدمة API تعمل بنموذج GPT-5.6 Sol بسرعة تصل إلى 750 توكن مخرجات في الثانية على أجهزة Cerebras، وهو ما تصفه OpenAI بأنه أسرع بـ 14 مرة من المعالجة القياسية (Standard). تم تقديم معاينة لهذا الوضع في 13 أغسطس 2026، ولا يوجد سعر منشور أو تاريخ توفر حالياً.

ملخص

وضع Ultrafast هو فئة سرعة، وليس نموذجاً جديداً. هي نفس أوزان GPT-5.6 Sol، ولكن على معالجات سيليكون مختلفة. أعلنت OpenAI عن ذلك في 13 أغسطس 2026، مع أرقام رئيسية تصل إلى 750 توكن مخرجات في الثانية وسرعة معالجة تصل إلى 14 ضعف المعالجة القياسية.1

الأجزاء التي أغفلها الرقم الرئيسي:

  • الرقم الوحيد الشامل (end-to-end) الذي نشره أي شخص هو 5.6x. ففي GDPval، وبالعمل داخل Codex، أفادت Cerebras بوجود "تسريع شامل بمقدار 5.6 ضعف دون تدهور في الجودة".2 هذان الرقمان ليسا متنافسين — فرقم 14x هو سقف أقصى لجزء غير محدد من الطلب، بينما 5.6x هي نتيجة مقاسة على اختبار معياري واحد — ولكن 5.6x هي الأقرب لمحاكاة ضغط العمل الحقيقي.
  • هذه ليست أول فئة سرعة من OpenAI. تم تغيير اسم المعالجة ذات الأولوية (Priority processing) إلى وضع Fast في 30 يوليو 2026، وهي توفر بالفعل سرعة تصل إلى 2.5 ضعف المعالجة القياسية لـ gpt-5.6-sol.3 وضع Ultrafast هو الدرجة الثانية فوق Standard، وليس الأولى.
  • لا يوجد سعر منشور لوضع Ultrafast. حتى 17 أغسطس 2026، تدرج صفحة أسعار OpenAI نموذج gpt-5.6-sol تحت فئات Standard و Batch و Flex و Fast فقط — ولا يوجد صف لوضع Ultrafast.4
  • أقرب مؤشر متاح، وهو مؤشر ضعيف: تفرض كل من OpenAI و Anthropic بالضبط ضعف الأسعار القياسية على الفئات التي تصفها كل منهما بأنها "تصل إلى 2.5 ضعف". ينتقل GPT-5.6 Sol من 5$/30$ إلى 10$/60$ لكل مليون توكن؛ وينتقل Claude Opus 5 و Opus 4.8 من 5$/25$ إلى 10$/50$.45 ومع ذلك، فإن مضاعف OpenAI ليس ثابتاً — فهو يتراوح من 1.75x إلى 2.5x عبر قائمة خدماتها.
  • قد تقع التكلفة الإضافية على التوكنات الخاطئة. توثق Anthropic أن فئتها تسرع المخرجات بدلاً من الوقت المستغرق للوصول لأول توكن؛ ولم تذكر OpenAI ما إذا كان Ultrafast يسرع أي شيء يتجاوز عملية التوليد. في الفئات المسعرة حالياً}، تنطبق التكلفة الإضافية على المدخلات وكذلك المخرجات — وفي دورة عمل تتكون من 50,000 توكن مدخلات و 500 توكن مخرجات، تكون تكلفة المدخلات 94% من إجمالي التكلفة وفقاً للأسعار المنشورة.
  • الوصول متاح في معاينة محدودة لعملاء مختارين، مع نموذج إخطار للبقية.1

ما ستتعلمه

  • ماهية Ultrafast فعلياً، وأي أجزاء من الإعلان هي قياسات فعلية مقابل أجزاء تسويقية
  • لماذا تعتبر أرقام 14x و 5.6x صادقة، وماذا يقيس كل منهما فعلياً، وأيهما دليل أفضل للعميل البرمجي (agent) الخاص بك
  • أي جزء من الطلب تقوم فئة السرعة بتسريعه فعلياً، ولماذا يميل تسريع التوليد إلى ترك معالجة المطالبة (prompt processing) هي التي تحدد الوقت الإجمالي المستغرق
  • موقع Ultrafast في سلم فئات خدمة OpenAI، وتكلفة الدرجات المسعرة اليوم، ولماذا قد تقع التكلفة الإضافية على التوكنات الخاطئة بالنسبة للعملاء البرمجيين
  • تأثير خلط فئات السرعة داخل عميل برمجي واحد على ذاكرة التخزين المؤقت للمطالبات (prompt cache)
  • ما يمكنك وما لا يمكنك فعله باستخدام Ultrafast اليوم

ما هو وضع OpenAI Ultrafast؟

إن Ultrafast، بكلمات OpenAI نفسها، هي "فئة خدمة جديدة تشغل GPT‑5.6 Sol بسرعة تصل إلى 14 ضعفًا مقارنة بالمعالجة القياسية (Standard)، وسيتم إطلاقها أولاً في OpenAI API."1 وهي مدعومة بواسطة Cerebras و"تولد ما يصل إلى 750 توكن مخرجات في الثانية".1

الادعاء الاستراتيجي الكامن وراء ذلك أكثر إثارة للاهتمام من الرقم نفسه. تصيغ OpenAI الأمر على أنه كسر لمقايضة سابقة: "حتى الآن، كانت السرعة في الوقت الفعلي تعني عادةً اختيار نموذج أصغر أو أكثر تخصصًا".1 ويبدو هذا جزئيًا كإشارة إلى قائمة نماذجها الخاصة — ففي فبراير، أطلقت OpenAI نموذج GPT-5.3-Codex-Spark كمعاينة بحثية، وهو "نسخة أصغر من GPT-5.3-Codex، وأول نموذج لنا مصمم للبرمجة في الوقت الفعلي"، ويعمل أيضًا على Cerebras.6 أما Ultrafast فهو الادعاء بأنه لم يعد عليك الانتقال إلى نموذج أصغر. والعبارة الملخصة التي تستخدمها الشركة لهذه الفئة هي عمل أكثر فائدة في الثانية الواحدة.1

توضح Cerebras الآلية على أنها قصة تتعلق بنطاق عرض نطاق الذاكرة (memory-bandwidth). حيث يجادل منشورها الهندسي بأن "الاستنتاج السريع للنماذج الرائدة هو مشكلة نقل بيانات": ففي وحدات GPU، يكون استنتاج النماذج الكبيرة مقيدًا بعملية نقل الأوزان (weights) بين الذاكرة الموجودة على الشريحة والذاكرة الخارجية لكل توكن. بينما تضع Cerebras "44 جيجابايت من SRAM على كل شريحة بحجم رقاقة (wafer-sized chip)"، وبالتالي "تبقى الأوزان على الشريحة، وتتدفق التوكنات دون انقطاع عبر طبقات النموذج الموزعة على الرقاقات".2

حددت OpenAI خمسة سيناريوهات: الاستجابة للحوادث والموثوقية، الأبحاث المالية والأمن، دعم العملاء والصوت، التجارة، والأبحاث والتجارب المباشرة.1 ومثال الدعم هو الأكثر وضوحًا في أن العمل يتكون من خطوات متعددة — حل المشكلات في الوقت الفعلي "حتى عندما يتطلب العثور على الإجابة خطوات أو أنظمة متعددة" — لكن سيناريو الأبحاث يصف أيضًا حلقة تكرارية، ولا يوجد أي من السيناريوهات الخمسة عبارة عن سؤال من مرة واحدة.1

هناك تفصيل مهم إذا كنت تقتبس الإعلان في سياق الوكلاء (agents): صفحة OpenAI لا تستخدم كلمة "وكيل" (agent) على الإطلاق. بل تقول فقط إن الاختبارات الأولية تشمل "البرمجة، والتجارة، والأبحاث المالية، والدعم، وغيرها من التطبيقات التفاعلية"، وتصف سير العمل وظيفيًا. أما صياغة "الوكيل" الصريحة فتعود إلى Cerebras، التي كتبت أنه "مع Ultrafast، يمكنك الآن وضع الوكلاء في المسار الحرج للمشكلات التي يكون فيها كل ثانية فارقًا".2

رقم 14 ضعفًا يبدو كرقم تسويقي. الرقم المقاس أصغر

إليك الرقم الذي أغفله إعلان OpenAI نفسه. في نفس مجموعة الإعلانات، ذكرت Cerebras أنه في GDPval — وهو معيار OpenAI للمهام ذات القيمة الاقتصادية في العالم الحقيقي عبر 44 مهنة، والتي "تشمل مخرجاتها المستندات، والشرائح، والمخططات، والجداول البيانات، والوسائط المتعددة"7 — فإن "Ultrafast حقق تسريعاً شاملاً (end-to-end) بمقدار 5.6 ضعف دون أي تدهور في الجودة."2 وقد أجرت Cerebras هذا الاختبار في 31 يوليو 2026، حيث قارنت بين GPT-5.6 Sol و GPT-5.6 Sol Ultrafast "في الاستدلال المتوسط ضمن Codex."2

كلا الرقمين صادقان، لكنهما يقيسان أشياء مختلفة. رقم 14 ضعف هو سقف؛ حيث تصفه OpenAI بأنه "أسرع بـ 14 ضعفاً كحد أقصى من المعالجة القياسية" ولا تذكر أبداً أي جزء من الطلب تقوم بقياسه.1 أما رقم 5.6 ضعف فهو ما سجلته Cerebras عند تشغيل نظام اختبار حقيقي على معيار حقيقي — وهو أقرب لما يواجهه ضغط العمل الفعلي، رغم أنه كما توضح التحذيرات أدناه، ليس قراءة دقيقة لدورة العميل (agent loop) أيضاً.

هذه الفجوة هي نتيجة تطبيق قانون Amdahl كالمعتاد. تقضي خطوة واحدة في دورة العميل وقتها الفعلي في عدة أشياء: رحلة الطلب ذهاباً وإياباً، ومعالجة المطالبة (prompt) قبل ظهور أول رمز (token)، وتوليد الاستجابة، ثم تنفيذ أي أداة طلبها النموذج. تستهدف فئة الإنتاجية (throughput tier) واحداً من هذه العناصر. إذا تعاملنا مع الخطوة كمجموع لأجزائها — وهو تقريب يمكن لنظام اختبار جيد التغلب عليه جزئياً، كما يوضح القسم التالي — فإن الحساب يكون قياسياً: إذا كان التوليد يمثل الكسر p من الوقت الفعلي للخطوة وكان يعمل بسرعة أكبر بمقدار s مرة، فإن التسريع الإجمالي هو 1 / ((1 − p) + p/s).

ثلاثة تحذيرات قبل عكس هذه العملية. لا تذكر Cerebras ما إذا كان رقم "التسريع الشامل" يمثل زمن الاستجابة لكل مهمة (per-task latency) أو الإنتاجية الإجمالية عبر تشغيل معيار متزامن، وقانون Amdahl للخطوة الواحدة لا ينطبق على الحالة الأخيرة. وبما أن رقم 14 هو رقم "بحد أقصى"، فهو يمثل سقفاً لـ s وليس قياساً دقيقاً له. واستخدامه كمضاعف للتوليد يفترض أن رقم 14 ضعف هو رقم خاص بالتوليد أصلاً — وهي قراءة يدعمها رقم 750 رمزاً في الثانية ولكن OpenAI لم تؤكدها أبداً.

مع مراعاة هذه الشروط: إذا وضعنا s عند 14، فإن رقم 5.6 ضعف الخاص بـ Cerebras يعني أن ما يقرب من 88% من الوقت الفعلي لـ GDPval كان مخصصاً لتوليد الرموز. هذا مزيج يعتمد بشكل كبير على التوليد، وهو ما يتوقع المرء من معيار تكون مخرجاته منتجات عمل نهائية. وبما أن 14 هو سقف لـ s، فإن 88% هي الحد الأدنى لـ p وليست مجرد تقدير — فإذا كان التسريع المستدام في ذلك التشغيل هو 8 أضعاف بدلاً من 14، فإن نفس رقم 5.6 ضعف يعني أن p ≈ 94%.

نفس عدم التماثل يسري في الجدول أدناه، حيث تفترض جميع صفوف الحسابات أنك تحصل على مضاعف السقف الكامل في مرحلة التوليد:

حصة الوقت الفعلي للخطوة المقضى في توليد الرموزالتسريع الشامل عند توليد 14 ضعفاً
95%~8.5x
~88.5% (الحصة التي تشير إليها نتيجة Cerebras المقاسة عند s = 14)5.6x (مقاسة)
80%~3.9x
60%~2.3x
40%~1.6x

تطبيق قانون Amdahl على رقم 14 ضعف، بافتراض أن التوليد يتسارع بشكل موحد عند السقف وأن كل عنصر آخر يظل دون تغيير. صف 5.6 ضعف هو قياس Cerebras المنشور، والنسبة المئوية بجانبه مستنتجة منه؛ أما كل صف آخر فهو حسابي، وكل منها يمثل أفضل حالة ممكنة وليس توقعاً.

هناك رقم واحد يستحق استخلاصه لاستخدامك الخاص: 750 توكن في الثانية عند مضاعفة 14x تعني خط أساس للفئة القياسية (Standard-tier) يبلغ حوالي 54 توكن مخرج في الثانية. لا تنشر OpenAI رقم إنتاجية للفئة القياسية، وهذا الاستنتاج لا يصح إلا إذا تحقق كلا الرقمين الرئيسيين معاً. ومن أجل المقارنة، فإن رقم الإنتاجية الوحيد الذي تلتزم به OpenAI كمستوى خدمة لهذا النموذج هو هدف وضع Fast بأكثر من 80 توكن في الثانية، وهذا ينطبق على عملاء Enterprise.8 ولكن هذا يعد فحصاً مفيداً للمنطق — إذا كانت إنتاجية الفئة القياسية التي قمت بقياسها لـ gpt-5.6-sol أعلى بوضوح من 54 توكن في الثانية، فإن المضاعف المتاح لك يكون بالتالي أقل من 14.

سبب آخر للتعامل مع 5.6x كعلامة عليا بدلاً من توقع: إن GDPval، حسب صياغة OpenAI نفسها، هو تقييم من محاولة واحدة (one-shot) — مهمة في، ومخرج خارج.7 إنها ليست حلقة متعددة الأدوار، لذا فهي لا تتحمل التكلفة التي يتحملها العملاء (agents) باستمرار: إعادة إرسال ومعالجة سياق متزايد، دوراً بعد دور. العميل الذي تكون خطواته عبارة عن آثار استدلال طويلة مع استدعاءات أدوات رخيصة من حين لآخر يقع بالقرب من قمة الجدول. أما العميل الذي يطلق عشرات الاستدعاءات القصيرة للأدوات، حيث ينتظر كل منها قاعدة بيانات بطيئة أو API من طرف ثالث، فيقع بالقرب من القاع، حيث لم يكن النموذج أبداً هو عنق الزجاجة، ولا يملك فك التشفير (decoder) الأسرع الكثير ليربحه.

العنوان الرئيسي الآخر لشركة Cerebras أكثر إثارة وأقل صلة. عند تشغيل Humanity's Last Exam — وهو معيار مكون من 2,500 سؤال تم بناؤه بواسطة Center for AI Safety و Scale AI9 — أنهى Sol Ultrafast المهمة في 11 ساعة و11 دقيقة مقابل 78 ساعة و27 دقيقة لـ Claude Fable 5، وهو ما تصفه Cerebras بأنه "دقة مماثلة وسرعة أكبر بنحو 7 مرات".2 النسبة الدقيقة هي 7.01، لذا إذا كان هناك أي شيء، فإن الصياغة تقلل من شأن الأمر. ولكن هذه مقارنة بين نماذج مختلفة، وأدوات تشغيل مختلفة، وتواريخ مختلفة، وليست مقارنة بين فئة وأخرى: تذكر Cerebras أن التشغيلين استخدما أدوات تشغيل مختلفة في أيام مختلفة — Codex في 10 يوليو لـ Sol Ultrafast، و Claude Code في 13-15 يوليو لـ Fable 5، وكلاهما في إعداد الاستدلال الذي يسميه كل مورد xhigh.2 كان مستوى الجهد المعلن هو نفسه في كلا التشغيلين، ولكن نموذجين مختلفين لا يزالان يصدران كميات مختلفة من توكنات الاستدلال، وهو ما قد يفسر جزءاً كبيراً من الفجوة دون أن تساهم الأجهزة بأي شيء. هذا يخبرك أن Sol Ultrafast سريع، لكنه ليس دليلاً على مدى سرعة Ultrafast مقارنة بـ Standard.

كل هذه الأرقام تم تشغيلها بواسطة الموردين. تذكر تذييلة موقع Cerebras ذلك: "تعتمد مقارنات الأداء على اختبارات قياسية من طرف ثالث أو اختبارات داخلية. قد تختلف تحسينات سرعة الاستدلال الملحوظة مقابل الأنظمة القائمة على GPU اعتماداً على عبء العمل، والتكوين، والتاريخ، والنماذج التي يتم اختبارها."2

أي مصطلح من مصطلحات زمن الاستجابة تحركه فئة السرعة، ولماذا لن يخبرك أحد بذلك

فئات السرعة لا تسرع الطلب بشكل موحد، والجزء الذي تسرعه هو الذي يحدد ما إذا كان Ultrafast ذا قيمة لعميلك. الموردون الذين يبيعون هذه الفئات لا يتفقون حتى على الإجابة.

تقدم Anthropic فئة سرعة خاصة بها — ومن المربك أنها تسمى أيضاً Fast mode — وتعد وثائقها هي أقرب نظير منشور، حيث تتسم بصراحة غير معتادة بشأن الآليات. فهي تنص على أن "فوائد السرعة تتركز على عدد توكنات المخرجات في الثانية (OTPS)، وليس الوقت المستغرق للوصول إلى أول توكن (TTFT)"، وتكرر هذه النقطة في قائمة الاعتبارات الخاصة بها.10 الوقت المستغرق للوصول إلى أول توكن هو في الغالب تكلفة معالجة الـ prompt الخاص بك، بالإضافة إلى الانتظار في الطابور ورحلة الشبكة ذهاباً وإياباً. فك التشفير (decoding) الأسرع يجعل النموذج يصدر المخرجات بشكل أسرع؛ وفي منصة Anthropic، هذا ليس وعداً صريحاً بأنه يبدأ بشكل أسرع.

توثق xAI العكس تماماً. فالفئة لديها تسمى Priority Processing — وهو اسم استخدمته OpenAI لـ Fast mode حتى شهر يوليو، وتستخدمه Google أيضاً لثلاثة منتجات مختلفة. وتفرض xAI "سعر توكن مميز" وتدعي تحقيق مكاسب على كلا الطرفين: "وقت أقل للوصول إلى أول توكن (TTFT) وزمن انتقال أسرع بين التوكنات (ITL)، خاصة خلال فترات الطلب المرتفع".11 هذه آلية مختلفة — تتعلق بموقعك في الطابور بدلاً من سرعة السيليكون. وتبيع Google نوعاً ثالثاً، وهو فئة Priority التي "توجه الطلبات إلى طوابير حوسبة عالية الأهمية" بسعر يزيد بنسبة 75-100% عن الأسعار القياسية، مع خفض درجة حركة المرور الفائضة بدلاً من رفضها.12

لذا، يمكن للفئة المميزة أن تمنحك مكاناً أفضل في الطابور، أو مفكك تشفير أسرع، أو كليهما، والموردون الذين يبيعون هذه الفئات لا يصفون المنتج نفسه. وهذا الأمر مهم عندما تفكر في أي جزء من الوقت الفعلي لعمل الـ agent الخاص بك سيتقلص فعلياً.

تقف OpenAI في المنتصف. تذكر صفحة Fast mode الخاصة بها التزام زمن الاستجابة لهذه الفئة كحد أدنى لعدد التوكنات في الثانية بدلاً من الوقت المستغرق للوصول إلى أول توكن، وهو ما يشير إلى نهج Anthropic دون التصريح بذلك.8 وبالنسبة لـ Ultrafast، ذكرت فقط أن هذه الفئة "تولد ما يصل إلى 750 توكن مخرجات في الثانية"1 — وهو تصريح عن التوليد يترك معالجة الـ prompt دون معالجة. كما أن آلية Cerebras لا تحسم الأمر أيضاً: فإبقاء الأوزان مقيمة في SRAM على الشريحة قد يسرع معالجة الـ prompt وكذلك التوليد، أو قد لا يفعل. لا يمكن لأحد خارج مرحلة المعاينة الجزم بذلك، وبالنسبة لأي شخص يشغل agents، فإن هذا هو السؤال الأكثر أهمية.

هذا التمييز يهم الـ agents أكثر مما يهم الدردشة (chat)، وباتجاه غير مريح. فمستخدم الدردشة ينتظر مرة واحدة في البداية. أما حلقة الـ agent فتعيد إرسال سجل يزداد طولاً في كل دورة: الـ system prompt، تعريفات الأدوات، الرسائل السابقة، وكل نتيجة أداة تراكمت — محتويات الملفات، نتائج البحث، وتفريغات الصفحات. هذا الـ prompt ينمو ما لم تقم بضغطه بنشاط، وفي حالة عدم وجود hit في الـ cache، تكون معالجته تكلفة تُدفع مرة أخرى في كل دورة.

ثم يأتي قانون Amdahl ليؤثر من الجانب الآخر. افترض أن الخطوة الواحدة تستغرق ثانية واحدة لمعالجة الـ prompt بالإضافة إلى خمس وثلاثين ثانية للتوليد. معالجة الـ prompt تمثل أقل من 3% من الخطوة، ومن السهل تجاهلها. إذا قمت بتسريع التوليد 14 مرة وتركت معالجة الـ prompt كما هي، تصبح الخطوة ثانية واحدة زائد ثانيتين ونصف — المصطلح الذي كنت تتجاهله أصبح الآن يمثل 29% من الوقت الفعلي. إلى أي مدى تقوم الفئة بتسريع التوليد وليس معالجة الـ prompt، فإنها تجعل معالجة الـ prompt هي الشيء الأهم. كلما كان فك التشفير أسرع، زاد جزء زمن الاستجابة المتبقي في الأجزاء التي لا يلمسها — وهذا بالضبط سبب أهمية ملاحظة صمت OpenAI بشأن هذا السؤال.

سواء كان ذلك مهماً لـ agent معين، فإن الأمر يعود إلى نسبة واحدة: طول السياق (context length) إلى طول المخرجات، لكل خطوة. الطرف المرتبط بفك التشفير (decode-bound) من هذا الطيف لديه الكثير ليكسبه من مفكك تشفير أسرع؛ أما الطرف المرتبط بالـ prompt (prompt-bound) فليس لديه ما يكسبه تقريباً. الـ agent الذي يراكم السياق على مدى تشغيل طويل ينتقل من الطرف الأول نحو الثاني مع مرور الوقت، مما يعني أن الفئة تصبح أقل فائدة كلما طالت مدة تشغيل الـ agent.

هناك تبسيط واحد يجب التخلي عنه: وهو أن خطوة العميل (agent step) تسير بشكل تسلسلي كامل لأنه لا يمكن حدوث أي شيء حتى ينتهي النموذج. هذا ليس صحيحاً تماماً، وهذا هو السبب في أن نموذج Amdahl المذكور أعلاه هو تقريب وليس قانوناً. استدعاءات الأدوات تتدفق بشكل تدريجي. يفتح التدفق الموثق من Anthropic كتلة tool_use تحمل اسم الأداة قبل وصول أي من وسائطها، ثم يسلم الوسائط كأجزاء input_json_delta، مع وجود وضع دقيق اختياري لتقليل زمن الاستجابة بشكل أكبر.13 لا يوجد شيء في البروتوكول يمنع نظام التشغيل (harness) من اتخاذ إجراء بناءً على الاسم — مثل تهيئة اتصال، أو الحصول على رمز (token)، أو تشغيل بيئة معزولة (sandbox) — بينما لا تزال الوسائط قيد التوليد. المكاسب محدودة، حيث تشير Anthropic إلى أن النماذج الحالية تصدر مفتاحاً وقيمة كاملة واحدة في كل مرة، لذا قد تكون هناك توقفات بين الأحداث،13 كما أن الأدوات غير المتماثلة (non-idempotent) لا تزال بحاجة إلى انتظار الوسائط الكاملة. لكن عبارة "كل خطوة تتوقف بانتظار الاستجابة الكاملة" تصف نظام تشغيل بدائياً، وليس نظاماً ضرورياً.

وصفت OpenAI الشكل الأساسي نفسه عندما أعلنت عن شراكتها مع Cerebras في يناير الماضي: "عندما تطرح سؤالاً صعباً، أو تولد كوداً، أو تنشئ صورة، أو تشغل عميل ذكاء اصطناعي، هناك حلقة تحدث خلف الكواليس: ترسل طلباً، يفكر النموذج، ثم يرسل شيئاً في المقابل."14 ميزة Ultrafast تضغط عملية التفكير. أما الرحلة الذهابية والإيابية، ومعالجة المطالبة (prompt processing) والأداة فهي مسألة مختلفة — وما لم تتقلص جميعها بنفس المعامل، فإن الرقم النهائي سيكون أقل من الرقم المعلن. هذا هو الشكل الأكثر احتمالاً للفجوة بين 14x و 5.6x، رغم أن أيًا من الشركتين لم تشرح ذلك. إذا كنت تريد معرفة مدى سرعة تراكم التكاليف والوقت في هذه الحلقات، فإن تحليلنا لـ تكاليف توكنات عميل الذكاء الاصطناعي لكل مهمة يغطي جانب التكلفة من نفس الحسابات.

أين تقع Ultrafast في سلم مستويات OpenAI

من السهل قراءة Ultrafast على أنها مستوى السرعة في OpenAI. وهي المستوى الثاني. تسجل وثائق OpenAI أن "معالجة الأولويات (Priority processing) تم تغيير اسمها إلى الوضع السريع (Fast mode) في 30 يوليو 2026"، وأنها "زادت السرعة التي يعمل بها الوضع السريع لـ gpt-5.6-sol لجعله أسرع بـ 2.5 مرة من المعالجة القياسية (Standard processing)."3 يختار المطورون الاشتراك عبر service_tier: "fast"، أو عبر "priority"، والتي تقول الوثائق إنها "توفر نفس السلوك للنماذج المدعومة" — رغم أنه في GPT-5.6 والإصدارات الأقدم، تظهر الاستجابة priority بغض النظر عن الخيار الذي أرسلته من الاثنين.3 كما يتوفر خيار افتراضي على مستوى المشروع.3

إليك السلم الخاص بـ gpt-5.6-sol في السياق القصير، وفقاً لصفحة أسعار OpenAI اعتباراً من 17 أغسطس 2026:4

الفئةالمدخلات / 1 مليونالمدخلات المخزنة / 1 مليونالمخرجات / 1 مليونالسرعة
Flex$2.50$0.25$15.00أوقات استجابة أبطأ15
Batch$2.50$0.25$15.00غير متزامنة (Asynchronous)
Standard$5.00$0.50$30.00الأساسية (Baseline)
Fast mode$10.00$1.00$60.00تصل إلى 2.5 ضعف Standard
Ultrafastغير معلنغير معلنغير معلنتصل إلى 14 ضعف Standard

هناك ثلاثة استنتاجات يمكن استخلاصها من هذا الجدول.

أولاً، تكلفة Fast mode تعادل بالضبط 2.00 ضعف Standard لموديل gpt-5.6-sol — سواء في المدخلات، أو المدخلات المخزنة، أو المخرجات، وينطبق الأمر نفسه على موديلات Terra و Luna الشقيقة.4 وقد اعتمدت Anthropic نفس النسبة: حيث تبلغ تكلفة Claude Opus 5 و Opus 4.8 حوالي 5$/25$ لكل مليون توكن بالأسعار القياسية (standard)، و 10$/50$ في وضع Fast mode،5 وذلك مقابل "زيادة تصل إلى 2.5 ضعف في عدد توكنات المخرجات في الثانية".10 موردان مختلفان، وكلاهما يفرض ضعف السعر. أرقام الـ 2.5 ضعف ليست قابلة للمقارنة بدقة — فشركة Anthropic تحددها صراحةً بعدد توكنات المخرجات في الثانية، بينما تقول OpenAI فقط إنها "أسرع من معالجة Standard"3 — لكن مضاعف السعر متطابق في كلتا الحالتين.

تعامل مع ذلك كنقطة مرجعية متاحة بدلاً من كونه معادلة ثابتة. فالمضاعفة هي ببساطة الرقم الأكثر وضوحاً في التسعير. كما أن الزيادة السعرية لدى OpenAI ليست ثابتة حتى داخل كتالوج موديلاتها — فصفحة التسعير نفسها تفرض 2.5 ضعف لموديل gpt-5.5 في وضع Fast mode (من 5$/30$ إلى 12.50$/75$)، و 1.8 ضعف لموديل gpt-5-mini، و 1.75 ضعف لموديل gpt-4.1.4 كما أن Ultrafast، حسب تعبير OpenAI، "مدعوم بواسطة Cerebras"1 بدلاً من النظام الذي يشغل Standard، وهو ما يعطيه على الأرجح هيكل تكلفة مختلف — رغم أن OpenAI لم تصف توبولوجيا النشر. ولا يوجد سبب يجعل الزيادة السعرية للسرعة خطية، أو لكل توكن، أو حتى مدرجة علناً على الإطلاق.

ثانياً، وهو الأمر الأكثر أهمية من الناحية العملية: قد تقع الزيادة السعرية على التوكنات الخاطئة في أعمال الوكلاء (agents). كما غطى القسم السابق، يتم توثيق هذه الفئات — حيثما وجدت الوثائق — على أنها تسرع المخرجات. لكن ما تفرضه الفئات المسعرة هو تكلفة على المدخلات والمخرجات معاً. تميل أدوار الوكلاء إلى أن تكون كثيفة المدخلات، لأن السجل الكامل يتم إرساله مرة أخرى في كل مرة — وكلما زاد هذا الميل، ساءت الصفقة. لنأخذ دوراً يتكون من 50,000 توكن مدخلات و 500 توكن مخرجات: بالأسعار المعلنة، تبلغ التكلفة 0.265$ في Standard، منها 0.25$، أو 94%، للمدخلات.4 نقل هذا الدور إلى Fast mode يرفع التكلفة إلى 0.53$، وبناءً على آلية Anthropic الموثقة، فإن التكلفة الإضافية تشتري سرعة في الـ 500 توكن مخرجات بدلاً من الـ 50,000 توكن مدخلات. يقلل تخزين المطالبات (Prompt caching) الأرقام المطلقة بشكل كبير، لكنه لا يقلل الزيادة السعرية: فمعدل المدخلات المخزنة يتضاعف جنباً إلى جنب مع كل شيء آخر، لذا يظل الدور المخزن يكلف ضعف ما يكلفه في Standard عند استخدام Fast mode. إذا تم تسعير Ultrafast بنفس الطريقة، فإن الحسابات تصبح أسوأ مع نمو السياقات (contexts)، وهو بالضبط الاتجاه الذي تسير فيه الوكلاء.

ثالثاً، الفجوة الموجودة في ذلك الجدول هي القصة الحقيقية للمطورين. لا يوجد صف لـ Ultrafast في صفحة الأسعار، ولا دليل لـ Ultrafast ضمن وثائق API، ولا توجد قيمة موثقة لـ service_tier خاصة بها. الأثر الوحيد في وثائق API هو سطر في سجل التغييرات يعلن عن المعاينة.16 التفصيل التجاري الوحيد الذي نشرته OpenAI موجود في صفحة Reserved Tier، والتي تشير إلى أن Reserved Tier "متاح أيضاً لوضع Ultrafast، والذي يتوفر حالياً في معاينة محدودة"17 — لذا ستكون السعة قابلة للشراء مسبقاً، رغم أن سعر التوكن الواحد ليس علنياً. كما لم تذكر OpenAI ما إذا كان Ultrafast يدعم تخزين المطالبات مؤقتاً (prompt caching)، أو نافذة السياق الكاملة، أو المخرجات المهيكلة (structured outputs)، أو استدعاءات الأدوات المتوازية — وأي واحدة من هذه الميزات، في حال غيابها، ستكون أهم لعميل برمجي (agent) يعمل لفترة طويلة من أهمية السرعة نفسها. هذه الأمور تستحق الاستفسار عنها بدلاً من افتراضها، لأن الميزة التي تدعيها Cerebras تأتي مما تحتفظ به في الذاكرة الموجودة على الشريحة،2 وسياق العميل البرمجي الطويل هو بالضبط نوع الحالة التي يجب أن تعيش في مكان ما. لا يمكن الإجابة على أي من هذا من خارج نطاق المعاينة.1

مخاطر تخزين المطالبات مؤقتاً عند خلط مستويات السرعة

التحسين البديهي، بمجرد وجود مستوى سريع جداً، هو الخلط: تشغيل الخطوات الحرجة من حيث زمن الاستجابة للعميل البرمجي على المستوى السريع وبقية الخطوات على المستوى القياسي (Standard). هناك سبب موثق يدعو للحذر.

توضح Anthropic ذلك صراحة: "التبديل بين السرعة السريعة والقياسية يؤدي إلى إبطال تخزين المطالبات مؤقتاً. الطلبات بسرعات مختلفة لا تتشارك البادئات المخزنة مؤقتاً."10 بالنسبة للعميل البرمجي، هذا مكلف مرتين. تقوم حلقات العميل البرمجي بإعادة إرسال محادثة متزايدة في كل دورة، وتخزين المطالبات مؤقتاً هو ما يجعل ذلك ميسور التكلفة — حيث تكلف قراءة التخزين المؤقت عُشر تكلفة الإدخال الأساسي على منصة Anthropic، وعُشر التكلفة في مستوى Standard الخاص بـ OpenAI أيضاً (0.50 دولار مقابل 5.00 دولار).45 العميل البرمجي الذي يبدل بين المستويات دورة بدورة لا يفقد الخصم فحسب؛ إذا استمر نظام التشغيل الخاص به في تعيين نقاط توقف للتخزين المؤقت، فإنه يدفع أيضاً سعر كتابة التخزين المؤقت لـ Anthropic — 1.25 ضعف الإدخال الأساسي لكتابة لمدة خمس دقائق، و2 ضعف لساعة — مما يجعله يدفع أكثر من سعر الإدخال الكامل بينما يعتقد أنه يوفر المال.5

التكلفة الثانية هي التي تناولها القسم السابق. تعطل تخزين البادئة يعني معالجة السياق بالكامل مرة أخرى، وفي سياق عميل برمجي كبير، يضيف ذلك ثوانٍ حقيقية لكل دورة — وهو تراجع في زمن الاستجابة يمكن أن يتجاوز منطقياً أي مكسب كان يوفره فك التشفير (decoder) الأسرع.

لم تنشر OpenAI إرشادات مماثلة. تؤكد وثائق وضع Fast أن "خصومات المدخلات المخزنة مؤقتاً (cached input) لا تزال تنطبق على طلبات وضع Fast"، وتدرج صفحة التسعير سعراً منفصلاً للمدخلات المخزنة مؤقتاً لفئة Fast، ولكن لا يذكر أي منهما ما إذا كانت البادئة (prefix) المخزنة مؤقتاً في فئة واحدة يمكن قراءتها من فئة أخرى.34 بالنسبة لـ Ultrafast تحديداً، هناك سبب هيكلي للتفاؤل الحذر: فقد وصفتها OpenAI بأنها فئة متميزة تعمل على أجهزة Cerebras،1 ومن الواضح أن الحالة المخزنة مؤقتاً لا تنتقل بين عمليات النشر المنفصلة. صمم نظامك على أساس أن الفئات لا تتشارك التخزين المؤقت، واستفسر قبل افتراض خلاف ذلك.

ينطوي وضع Fast على تعقيدات تشغيلية أخرى من المرجح أن تتشاركها أي فئة أسرع على نفس المنصة. تطبق OpenAI حداً أقصى لمعدل الزيادة (ramp rate limit): إذا زاد حجم حركة المرور بشكل هجومي للغاية، فقد يقوم النظام "بخفض تصنيف بعض طلبات وضع Fast إلى السرعات القياسية وفرض الرسوم القياسية"، مع الإبلاغ في الاستجابة عن service_tier: "default" — مما يعني أنه يجب عليك قراءة الفئة المرتجعة بدلاً من افتراض أنك حصلت على الفئة التي طلبتها. قد "ينطبق" هذا الحد عند إرسال مليون توكن (token) على الأقل في الدقيقة وزيادة ذلك بنسبة تزيد عن 50% خلال 15 دقيقة.3 كما تنصح الوثائق بتجنب عمليات ETL الكبيرة أو المهام المجمعة (batch jobs) في وضع Fast.3 أما نسخة Anthropic فلها حد معدل مخصص منفصل عن حدود Opus القياسية، حيث تعيد أخطاء 429 مع ترويسة retry-after عند استنفاد الحد.10 وكلا الأمرين يستحقان التصميم بناءً عليهما. تشير OpenAI إلى أن Standard و Fast يتشاركان في حد معدل النموذج،3 لذا فإن التوليد بسرعة أكبر بعدة مرات يجعل السقف لكل دقيقة أقرب بدلاً من رفعه — والوقت الذي يتم قضاؤه في فترة التراجع (backoff) هو وقت فعلي مثل أي وقت آخر. فئات السرعة هي منتجات مقيدة بالسعة، وهي بحاجة إلى مسار تراجع قياسي (Standard fallback path) خلفها.

رهان الأجهزة الكامن وراء ذلك

Ultrafast هو المنتج الثاني الناتج عن صفقة تم الإعلان عنها في 14 يناير 2026، عندما قالت OpenAI إنها "تتعاون مع Cerebras لإضافة 750 ميجاوات من حوسبة الذكاء الاصطناعي ذات زمن الانتقال المنخفض للغاية إلى منصتنا".14 وكان المنتج الأول هو Codex-Spark، الذي وصفته OpenAI بأنه "المعلم الأول في شراكتنا مع Cerebras".6 وصفت Cerebras الأمر بأنه اتفاقية متعددة السنوات لنشر أنظمة بمقياس رقاقة (wafer-scale systems) بقدرة 750 ميجاوات، مما يجعلها "أكبر عملية نشر لاستنتاج الذكاء الاصطناعي عالي السرعة في العالم" — وهذا وصفها هي، وليس وصفاً تم التحقق منه بشكل مستقل.18 وقالت OpenAI في ذلك الوقت إنها "ستدمج هذه السعة ذات زمن الانتقال المنخفض في مكدس الاستنتاج الخاص بنا على مراحل"، على أن تدخل هذه السعة حيز التنفيذ "في دفعات متعددة حتى عام 2028".14

يوضح هذا الجدول الزمني شكل عملية الإطلاق. فالمعاينة المحدودة المقيدة بالسعة هي ما يتوقعه المرء بعد سبعة أشهر من عملية طرح لا تزال تحتاج إلى عامين لتكتمل. وقد صاغ أندرو فيلدمان، المؤسس المشارك والرئيس التنفيذي لشركة Cerebras، هذه الفرضية في يناير: "تماماً كما حولت النطاق العريض (broadband) الإنترنت، فإن الاستنتاج في الوقت الفعلي (real-time inference) سيحول الذكاء الاصطناعي، مما يتيح طرقاً جديدة تماماً لبناء نماذج الذكاء الاصطناعي والتفاعل معها."14 وتسوق الصفحة الرئيسية لشركة Cerebras نموذج Sol Ultrafast على أنه "أسرع نموذج حدودي في العالم" — ومرة أخرى، هذا ادعاء خاص بالشركة، وليس ادعاءً ورد في متن منشورها التقني.19 لمعرفة المزيد عن الشركة التي تقف وراء هذه الرقاقات، راجع تغطيتنا السابقة لـ رقاقة Cerebras ذات المقياس الوافر (wafer-scale chip) وظهورها في بورصة Nasdaq.

العملاء الذين استشهدت بهم OpenAI يتوافقون مع إطار العمل الحساس لزمن الاستجابة (latency): Jane Street، وPodium، وBasis، وRogo.1 وأكثر الاقتباسات فائدة هو اقتباس ميتش ترويانوفسكي، المؤسس المشارك لشركة Basis، لأنه يحدد القيد الفعلي: "غالباً ما لا يكون العائق أمام المنتجات السريعة حقاً هو مجرد عدد الرموز (tokens) في الثانية، بل أيضاً ذكاء النموذج، وUltrafast يجمع بين الاثنين."1

في اليوم نفسه، راهنت Google على خيار مختلف

في اليوم نفسه، أعلنت Google عن Gemini 3.7 Flash، واصفة إياه بأنه "أكثر نماذجنا ذكاءً وكفاءة في العمل حتى الآن للبرمجة والوكلاء (agents)."20 يسير هذا العرض على محور مختلف تماماً؛ حيث لم ينشر إعلان Google أي أرقام لزمن الاستجابة أو معدل الإنتاجية (throughput) للنموذج؛ بل هي حجة تعتمد على "الذكاء مقابل الدولار"، مستشهدة بمكاسب في الاختبارات المرجعية (benchmarks) مقارنة بـ Gemini 3.6 Flash بسعر تمهيدي قدره 0.75 دولار لكل مليون رمز مدخل و3.75 دولار لكل مليون رمز مخرج، ليرتفع السعر إلى 1.50 دولار و7.50 دولار في 1 يناير 2027.20 تبيع Google زمن الاستجابة بالفعل — حيث أن Gemini 3.7 Flash هو أحد النماذج المؤهلة لفئة الأولوية (Priority tier)12 — لكنها تبيعه بشكل منفصل، كترقية لسرعة الدور في قائمة الانتظار، بدلاً من بناء الإعلان حوله.

طريقان مختلفان نحو نفس الوجهة، تم الإعلان عنهما في اليوم نفسه. OpenAI تبيع ذكاءً حدودياً تم جعله سريعاً؛ بينما تبيع Google ذكاءً أرخص تم جعله أفضل. الأمر الجدير بالملاحظة ليس من سيفوز، بل ما يهدف إليه كلاهما: Google تسمي البرمجة والوكلاء صراحةً، وقائمة عملاء OpenAI الأوائل تهيمن عليها الأعمال التفاعلية متعددة الخطوات رغم أن منشورها لم يستخدم هذه الكلمة أبداً. ويظهر طريق ثالث في توجيه النماذج الذي غطيناه في 14 أغسطس مع موجّه نماذج الوكلاء NeMo Switchyard من NVIDIA، والذي يحل الوسط عن طريق إرسال كل خطوة من خطوات الوكيل إلى نموذج مختلف تماماً.

ما يمكنك فعله حقاً اليوم

قليل جداً، وهذا هو العنوان الصريح. نموذج Ultrafast متاح في معاينة محدودة لمجموعة مختارة من العملاء، وسيتوسع "مع نمو السعة"، وما هو متاح علناً هو نموذج لطلب الإخطار عند توسيع نطاق الوصول.1 لا يوجد سعر، ولا تاريخ للإطلاق العام (GA)، ولا يوجد بارامتر API موثق.134

الأمر الذي يستحق القيام به الآن هو القياس، حتى تتمكن من تقييم الفئة (tier) في اليوم الذي تتوفر فيه. قم بتقسيم كل خطوة من خطوات العميل (agent) إلى أربعة تصنيفات — رحلة الشبكة (network round trip)، ومعالجة المطالبة (prompt processing)، وتوليد الرموز (token generation)، وتنفيذ الأدوات (tool execution) — وسجل أعداد الرموز وقيمة p95 إلى جانب المتوسط. تخبرك حصة التوليد في أي صف من الجدول أعلاه تقع، وبالتالي السقف الذي يمكن أن تمنحه لك أي فئة فك تشفير (decode tier)؛ وتخبرك حصة معالجة المطالبة بما سيهيمن بمجرد حصولك عليها؛ وتخبرك p95 بما يختبره المستخدمون فعلياً، وهو نادراً ما يكون المتوسط.

ثم اطرح السؤال الذي يتجنبه الإعلان بعناية: كم تبلغ قيمة الثانية هنا؟ في السيناريوهات التي تتصدرها OpenAI — حادثة تتطور، مكالمة عميل مباشرة، متسوق لا يزال يقرر1 — تحمل الثواني قيمة مالية، ويمكن للفئة السريعة أن تبرر علاوة سعرية باهظة. أما بالنسبة لعمل العملاء الذي يعمل دون إشراف، مثل إعادة هيكلة الكود الليلية (nightly refactors)، وبوتات المراجعة، ومعالجة المستندات الضخمة، فإن الثانية لا تساوي شيئاً تقريباً، والتحرك الصحيح يكون في الاتجاه المعاكس: فكل من Flex و Batch يبلغان نصف سعر Standard.4 وبين هذين القطبين تقع التدخلات التي لا تكلف أي علاوة على الإطلاق — مثل موازاة استدعاءات الأدوات، وتقليل جهد الاستنتاج، وضغط السياق، وتخزين نتائج الأدوات مؤقتاً، واختصار الخطوات من الحلقة — والعديد منها يقايض شيئاً ما مقابل السرعة، ولكن لا شيء منها يتطلب فئة جديدة.

هناك تكلفة هجرة واحدة تستحق التسعير: "نفس النموذج، سيليكون مختلف" لا يعني تلقائياً "مخرجات متطابقة". تذكر Cerebras "عدم وجود تدهور في الجودة" في اختباراتها الخاصة،2 وتقول Anthropic عن فئتها المماثلة أنه "لا يوجد تغيير في الذكاء أو القدرات".10 ولا يعد أي منهما ضماناً لتقييماتك المحددة ومطالباتك التي تم ضبطها يدوياً. خصص ميزانية لإعادة التحقق.

لا ينبغي أن يكون أي من هذا مفاجئاً، بالنظر إلى مدى حداثة إمكانية شراء أي من هذه الخدمات. لقد تم عرض GPT-5.6 Sol نفسه في يونيو 2026 تحت قيود وصول حكومية قبل فتحه على نطاق أوسع، ولا يزال وضع Fast المنافس من Anthropic مصنفاً كمعاينة بحثية تتطلب مدير حساب أو قائمة انتظار.10 سرعة النماذج الرائدة (Frontier speed)، في كلا المختبرين، هي حالياً شيء تتقدم بطلب للحصول عليه.

المصادر

الحواشي السفلية

  1. OpenAI. "معاينة وضع Ultrafast: GPT‑5.6 Sol بسرعة تصل إلى 14 ضعفاً." 13 أغسطس 2026. https://openai.com/index/previewing-ultrafast/ 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21

  • جويس إير، Cerebras. "تسريع GPT-5.6 Sol Ultrafast." 13 أغسطس 2026. https://www.cerebras.ai/blog/accelerating-gpt-5-6-sol-ultrafast-with-openai 2 3 4 5 6 7 8 9 10 11

  • OpenAI. "الوضع السريع (Fast mode)." توثيق OpenAI API. تم الوصول إليه في 17 أغسطس 2026. https://developers.openai.com/API/docs/guides/fast-mode 2 3 4 5 6 7 8 9 10 11

  • OpenAI. "التسعير." توثيق OpenAI API. تم الوصول في 17 أغسطس 2026. https://developers.openai.com/API/docs/pricing 2 3 4 5 6 7 8 9 10 11 12

  • Anthropic. "التسعير." توثيق Claude Platform. تم الوصول في 17 أغسطس 2026. https://platform.claude.com/docs/en/about-claude/pricing 2 3 4

  • OpenAI. "تقديم GPT-5.3-Codex-Spark." 12 فبراير 2026. https://openai.com/index/introducing-gpt-5-3-codex-spark/ 2

  • OpenAI. "قياس أداء نماذجنا في المهام الواقعية" (GDPval). 25 سبتمبر 2025. https://openai.com/index/gdpval/ 2

  • OpenAI. "الوضع السريع لعملاء API." تم الوصول في 17 أغسطس 2026. https://openai.com/API-fast-mode/ 2

  • Long Phan وآخرون (Center for AI Safety و Scale AI). "Humanity's Last Exam." arXiv:2501.14249، 24 يناير 2025. https://arxiv.org/abs/2501.14249

  • Anthropic. "Fast mode (research preview)." توثيقات Claude Platform. تم الوصول في 17 أغسطس 2026. https://platform.claude.com/docs/en/build-with-claude/fast-mode 2 3 4 5 6 7 8

  • xAI. "Priority Processing." توثيقات مطوري xAI. تم الوصول في 17 أغسطس 2026. https://docs.x.ai/developers/advanced-API-usage/priority-processing

  • Google. "Priority inference." توثيقات Gemini API. تم الوصول في 17 أغسطس 2026. https://ai.google.dev/gemini-API/docs/priority-inference 2

  • Anthropic. "Streaming messages." توثيقات Claude Platform. تم الوصول في 17 أغسطس 2026. https://platform.claude.com/docs/en/build-with-claude/streaming 2

  • OpenAI. "OpenAI partners with Cerebras." 14 يناير 2026. https://openai.com/index/cerebras-partnership/ 2 3 4

  • OpenAI. "Flex processing." توثيقات OpenAI API. تم الوصول في 17 أغسطس 2026. https://developers.openai.com/API/docs/guides/flex-processing

  • OpenAI. "سجل التغييرات." توثيق OpenAI API، إدخال 13 أغسطس 2026. تم الوصول في 17 أغسطس 2026. https://developers.openai.com/API/docs/changelog

  • OpenAI. "الفئة المحجوزة لعملاء API." تم الوصول في 17 أغسطس 2026. https://openai.com/API-reserved-tier/

  • Andrew Feldman, Cerebras. "OpenAI تشارك Cerebras لتوفير استنتاج عالي السرعة للجميع." 14 يناير 2026. https://www.cerebras.ai/blog/openai-partners-with-cerebras-to-bring-high-speed-inference-to-the-mainstream

  • الصفحة الرئيسية لـ Cerebras. تم الوصول في 17 أغسطس 2026. https://www.cerebras.ai/

  • Tulsee Doshi, Google. "تقديم Gemini 3.7 Flash." 13 أغسطس 2026. https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash/ 2

  • الأسئلة الشائعة

    فئة خدمة API جديدة من OpenAI، تم عرضها في 13 أغسطس 2026، تقوم بتشغيل GPT-5.6 Sol بسرعة تصل إلى 750 رمز مخرج في الثانية على أجهزة Cerebras — وهو ما يصل إلى 14 ضعف معالجة Standard، وفقاً لـ OpenAI. 1 إنه نفس النموذج، وليس نموذجاً أصغر.