news

تكاليف توكنات وكلاء الذكاء الاصطناعي في 2026: توكنات رخيصة، ومهام مكلفة

٢٢ يوليو ٢٠٢٦

AI Agent Token Costs in 2026: Cheap Tokens, Costly Tasks

تعتمد تكاليف الـ tokens لوكلاء الذكاء الاصطناعي (AI agents) بشكل أقل على سعر الـ token الواحد وبشكل أكبر على عدد الـ tokens التي تستهلكها كل مهمة. يقوم الوكلاء بإعادة إرسال سياقهم المتزايد عند كل استدعاء لأداة، لذا يمكن لمهمة واحدة أن تستهلك tokens أكثر بكثير من مجرد محادثة — وهذا هو السبب في أن أكبر إطلاقات النماذج في عام 2026 تتنافس الآن على كفاءة الـ tokens، وليس السعر فقط.

ملخص: في يوليو 2026، تصدر اثنان من أكبر إطلاقات النماذج — GPT-5.6 من OpenAI في 9 يوليو و Grok 4.5 من xAI في منتصف يوليو — بنفس العنوان الرئيسي: tokens أقل لكل مهمة، وليس درجة أعلى في اختبارات القياس.12

تبدأ صفحة OpenAI الخاصة بـ GPT-5.6 بعبارة "ذكاء أكثر من كل token، أداء أقوى مقابل كل دولار"، وتشير إلى أن GPT-5.6 Sol يتفوق على Claude Opus 4.8 في اختبار OSWorld 2.0 لاستخدام الكمبيوتر "بينما يستخدم tokens مخرجات أقل بنسبة 85%".2 أما xAI فقد حددت سعر Grok 4.5 بـ 2 دولار / 6 دولارات لكل مليون token مدخلات/مخرجات وادعت وجود "كفاءة tokens تبلغ ضعف كفاءة النماذج الرائدة المماثلة تقريبًا" — مشيرة إلى اختبار قياس حيث أنجز المهام بمتوسط 15,954 token مخرجات مقابل 67,020 لـ Opus 4.8، أي أقل بنحو 4.2 مرة.1

هذا التحول مهم لأن أسعار الـ token الواحد تستمر في الانخفاض بينما تستمر فواتير الوكلاء الإجمالية في الارتفاع. يقوم الوكيل بإعادة إرسال سياقه المتراكم في كل خطوة، لذا فإن الرقم الذي يحدد فاتورتك هو الـ tokens لكل مهمة — وغالبًا ما لا يكون النموذج الأرخص لكل token هو الأرخص لكل مهمة.

ما ستتعلمه

  • لماذا يستهلك وكيل الذكاء الاصطناعي tokens أكثر بكثير من chatbot لنفس الطلب
  • لماذا تتصدر أكبر إطلاقات النماذج في 2026 بـ "كفاءة الـ tokens"، وليس أعلى درجات اختبارات القياس
  • كيف يقوم Grok 4.5 و GPT-5.6 بقياس الكفاءة — وماذا تعني هذه الأرقام فعليًا
  • لماذا لا يكون النموذج الأرخص لكل token هو الأرخص لكل مهمة
  • مقارنة أسعار الـ token الواحد عبر نماذج الوكلاء الرائدة اليوم
  • ما الذي يجب قياسه وتغييره إذا كنت تقوم ببناء وكلاء

لماذا هذا الأمر مهم الآن

لمدة عامين، كان الحديث عن تسعير الذكاء الاصطناعي يدور حول رقم واحد: الدولارات لكل مليون token. هذا الرقم انخفض بشكل مطرد، واستمر في الانخفاض في يوليو 2026.

لكن الفرق التي تشغل وكلاء في بيئة الإنتاج لاحظت أن فواتيرها تسير في الاتجاه المعاكس. السبب هيكلي، وبدأ يظهر أخيرًا في كيفية تسويق المختبرات لنماذجها.

الوكيل ليس مجرد استدعاء واحد للنموذج. إنه حلقة تكرارية — قراءة المهمة، استدعاء أداة، قراءة النتيجة، استدعاء أداة أخرى — وفي كل دورة يتم إعادة إرسال كل ما سبق. سعر الـ token الواحد لم يغير الكثير؛ بل كان عدد الـ tokens هو المؤثر.

هذا هو السبب في أن GPT-5.6 و Grok 4.5 يركزان على الكفاءة. عندما تهيمن تكاليف عملائك على عدد الـ tokens التي تستهلكها المهمة، لم يعد "الأرخص لكل token" هو العرض الجذاب. بل أصبح "إنهاء المهمة بـ tokens أقل" هو الأساس.

لماذا يستهلك الوكيل tokens لا يمكن لـ chatbot استهلاكها أبدًا

رسالة الدردشة عادة ما تكون رحلة ذهاب وإياب واحدة: يدخل طلبك، وتخرج الإجابة. أما الوكيل الذي يقوم بنفس المهمة الاسمية فيقوم بالعديد من رحلات الذهاب والإياب، ويزداد السياق في كل واحدة منها.

إليك الآلية. في الخطوة الأولى، يرى النموذج prompt النظام بالإضافة إلى طلبك. في الخطوة الثانية، يرى prompt النظام، وطلبك، وإجراءه الأول، واستجابة الأداة. في الخطوة العشرين، يعيد قراءة جميع الخطوات التسع عشرة السابقة قبل اختيار الخطوة العشرين.3

السياق الأولي لا يتم إرساله مرة واحدة. بل يتم إرساله مرة أخرى في كل خطوة، لذا فإنك تدفع ثمن نفس prompt النظام ونفس مخرجات الأداة مرات عديدة عبر مهمة واحدة.3

بسبب أن هذا السجل ينمو مع كل دورة، فإن إجمالي الـ tokens التي يتم معالجتها تزداد بشكل أسرع من عدد الخطوات. فالمهمة التي تتكون من عشر خطوات لا تكلف عشرة أضعاف المكالمة الواحدة — بل تكلف ما يقرب من مجموع سلسلة متزايدة، وهذا هو السبب في أن تشغيل العميل (agent) لفترات طويلة يصبح مكلفاً بشكل غير متناسب مع ما يبدو أنه يفعله.3

كم تزيد التكلفة عن الدردشة العادية؟ التقديرات تختلف بشكل كبير، وهذا التباين هو الإجابة الصادقة. تشير تحليلات الطرف الثالث إلى أن أعباء عمل العملاء (agentic workloads) تتراوح ما بين عدة أضعاف إلى 100 ضعف من الـ tokens الخاصة بدردشة من دورة واحدة مكافئة، وذلك اعتماداً على طول المهمة، وعدد الأدوات، ومقدار السجل الذي يتم الاحتفاظ به.4

هناك تفصيل واحد مهم للتحسين: في البرمجة القائمة على العملاء، غالباً ما تهيمن الـ tokens المدخلة — السياق الذي يتم إعادة إرساله — على الفاتورة، وليس المخرجات التي يكتبها النموذج.34 وهذا هو السبب أيضاً في أن تضخم السياق له تأثير حقيقي؛ انظر إلى تحليلنا حول عدد الأدوات التي يمكن لعميل AI التعامل معها فعلياً قبل أن تبدأ تعريفات الأدوات وحدها في ملء نافذة السياق.

تغير أسلوب العرض عند الإطلاق: الكفاءة هي العنوان الرئيسي

أوضح علامة على أن تكلفة الـ token لكل مهمة قد أصبحت هي ساحة المعركة هي التسويق نفسه.

عنونت OpenAI إعلان GPT-5.6 بـ "ذكاء رائد يتوسع مع طموحك" وافتتحت الصفحة بعبارة "ذكاء أكثر من كل token، وأداء أقوى مقابل كل دولار".2 ويقول أحد عناوين الأقسام نصاً: "كفاءة افتراضية، وأقصى أداء عند الطلب".2

التفاصيل تدعم هذا التوجه. في مؤشر Artificial Analysis Coding Agent Index، تذكر OpenAI أن GPT-5.6 Sol سجل نقاطاً أعلى بـ 2.8 نقطة من Claude Fable 5 "بينما استخدم أقل من نصف الـ tokens المخرجة، واستغرق أقل من نصف الوقت، وكانت تكلفته أقل بنحو الثلث".2

قامت xAI بنفس الخطوة. حيث تم بناء إعلان Grok 4.5 حول "أعلى مستوى من الذكاء لكل وحدة زمنية وتكلفة"، يتم تقديمه بمعدل 80 token تقريباً في الثانية، مع "كفاءة token تبلغ ضعف كفاءة النماذج الرائدة المماثلة تقريباً، وحل المهام في أقل من نصف عدد الخطوات".1

اختبر اثنان من أكبر المختبرات، اللذين أطلقا منتجاتهما بفارق أسبوع واحد، رسالة "tokens أقل، تكلفة أقل" كرسالة أساسية بدلاً من "أعلى درجة". هذا هو التحول في الصناعة في جملة واحدة — كما أن استثمار Anthropic الضخم في تخزين المطالبات (prompt caching)، الذي يخصم تكلفة الـ tokens المدخلة المعاد إرسالها بنسبة تصل إلى 90%، هو نفس التوجه ولكن من جانب التسعير.56

لاحظ ما الذي لا يعنيه هذا: لم يتوقف أحد عن تقديم تقارير المقاييس (benchmarks). فصفحة GPT-5.6 تحتوي على صفحات منها.2 التغيير هو أن القدرة الخام يتم بيعها الآن مقترنة بـ ادعاء بالكفاءة، لأن الدرجة التي لا يمكنك تحمل تكلفة تشغيلها على نطاق واسع لن تربح الصفقة.

ماذا تقول أرقام الكفاءة في الواقع

من المفيد قراءة ادعاءات الكفاءة الرئيسية بدقة، لأنها أكثر تحديداً مما توحي به الأرقام العامة.

عبارة "توكنز أقل بـ 4.2 مرة" من xAI هي قياس محدد: متوسط توكنز المخرجات لكل مهمة في SWE-Bench Pro، حيث سجل Grok 4.5 حوالي 15,954 مقابل 67,020 لـ Opus 4.8 (أقصى إعداد).1 هذا القياس يخص المخرجات فقط، وعلى اختبار واحد، مقابل أغلى إعداد للمنافس. أما "كفاءة التوكنز بمقدار ضعفين" فهي ادعاء متوسط من xAI عبر "نماذج رائدة مماثلة".1

وبالمثل، فإن "توكنز مخرجات أقل بنسبة 85%" من OpenAI هي نقطة بيانات واحدة: GPT-5.6 Sol مقابل Opus 4.8 في OSWorld 2.0، حيث تقول OpenAI أن Sol يحقق درجات أعلى ويستهلك أقل بكثير.2 ومن الملاحظ أن كلا المختبرين استخدما نفس المنافس — Opus 4.8 — كمرجع أساسي غير كفء.

إليك الجزء الذي تخفيه الأرقام المقربة: في مخطط الاختبارات الخاص بـ xAI، لا يتصدر Grok 4.5 معظم الجداول. فهو يتصدر SWE Marathon بنسبة 29.0%، لكن Claude Fable 5 يتصدر Terminal-Bench 2.1 (84.3% مقابل 83.3% لـ Grok)، و SWE-Bench Pro (80.4% مقابل 64.7%)، و DeepSWE 1.0.1

وهذا هو الهدف الأساسي من الترويج للكفاءة. حجة Grok 4.5 ليست "أعلى درجة" — بل هي "درجات قريبة من القمة بكسر بسيط من التوكنز وكسر بسيط من السعر". الكفاءة هي الميزة التنافسية تحديداً لأن الدرجة النهائية ليست كذلك.

الأرخص لكل توكن ليس بالضرورة الأرخص لكل مهمة

عند دمج المتغيرين معاً — السعر لكل توكن والتوكنز لكل مهمة — يمكن أن ينقلب الترتيب الذي قد تراه في صفحة الأسعار.

أولاً، صورة السعر لكل توكن عبر نماذج الوكلاء الرائدة اليوم، وكلها من مصادر رسمية:

النموذجالمدخلات ($/مليون)المخرجات ($/مليون)المصدر
GPT-5.6 Luna$1.00$6.00OpenAI2
Grok 4.5$2.00$6.00xAI1
GPT-5.6 Terra$2.50$15.00OpenAI2
Claude Opus 4.8 (عادي)$5.00$25.00Anthropic6
GPT-5.6 Sol$5.00$30.00OpenAI2
Claude Fable 5$10.00$50.00Anthropic5

الجدول: أسعار القائمة المعلنة لكل مليون توكن، الفئات القياسية، قبل خصومات التخزين المؤقت (caching) أو الدفعات (batch).

الآن، لنضف عدد التوكنز لكل مهمة باستخدام أرقام xAI لمهمة واحدة في SWE-Bench Pro. هذا توضيح للآلية وليس حكماً نهائياً على التكلفة الإجمالية — فهو يحسب توكنز المخرجات فقط، في اختبار واحد، وبأسعار القائمة:

  • Grok 4.5: 15,954 توكن مخرجات × 6$ لكل مليون ≈ 0.096$ لكل مهمة1
  • Claude Opus 4.8: 67,020 توكن مخرجات × 25$ لكل مليون ≈ 1.68$ لكل مهمة16

هذه فجوة تبلغ حوالي 17 ضعفاً في تكلفة المخرجات لمهمة واحدة — وهي ناتجة عن تضاعف ميزتين: عدد توكنز (tokens) أقل بنحو 4.2 مرة و تكلفة مخرجات أرخص لكل توكن بنحو 4.2 مرة.16 صفحة التسعير تظهر لك العامل الثاني فقط. أما عدد التوكنز فيوفر العامل الأول، وفي العمليات القائمة على الوكلاء (agentic work)، غالباً ما يكون العامل الأول هو المؤثر الأكبر.

هناك ملاحظتان للحفاظ على دقة هذا التحليل. توكنز المدخلات — التي لم تكشف xAI عنها هنا — عادة ما تهيمن على فواتير الوكلاء، لذا فإن رقم المخرجات فقط يقلل من التكلفة المطلقة.4 كما أن "max" هو إعداد الاستنتاج الأكثر تكلفة في Opus 4.8، وهو ما اختارته xAI؛ وأي إعداد أرخص سيقلل هذه الفجوة. الاتجاه العام يظل صحيحاً؛ لكن المضاعف الدقيق يعتمد على طبيعة عبء العمل.

ماذا تفعل إذا كنت تبني وكلاء ذكاء اصطناعي

الخلاصة العملية هي التوقف عن البحث بناءً على سعر التوكن الواحد، والبدء في قياس التكلفة لكل مهمة مكتملة.

قم بقياس التوكنز لكل مهمة، ولكل نموذج. الرقم الوحيد الذي يرتبط بفاتورتك هو إجمالي التوكنز — المدخلات بالإضافة إلى المخرجات — لإنجاز وحدة عمل واحدة، بما في ذلك محاولات إعادة التشغيل واستدعاءات الأدوات الفاشلة. تتبع ذلك بنفس الطريقة التي تتبع بها زمن الاستجابة (latency).

قم بتوجيه المهام حسب نوعها، ولا تعتمد دائماً على النموذج الرائد (flagship). مستويات GPT-5.6 نفسها تثبت ذلك: تضع OpenAI نموذجي Luna و Terra ليتطابقا مع النماذج الرائدة الأقدم أو يتفوقا عليها بجزء بسيط من التكلفة.2 خصص النموذج الأكثر تكلفة للخطوات التي تحتاجه فعلياً.

استغل التخزين المؤقت (caching) بقوة، لأن السياق الذي يتم إعادة إرساله هو مصدر التكلفة. تقدم Anthropic خصومات على المدخلات المخزنة مؤقتاً تصل إلى 90%؛ كما يوفر تخزين GPT-5.6 من OpenAI نفس الخصم بنسبة 90% لقراءات التخزين المؤقت مع حد أدنى لعمر التخزين يبلغ 30 دقيقة.25 بالنسبة لحلقة تعيد إرسال نفس "prompt" النظام عشرين مرة، فإن هذا الخصم يؤثر على أكبر بند في التكاليف.

قم بتقصير الحلقة واختصار السجل. تقليل الخطوات والضغط القوي للسياق يهاجم عدد التوكنز مباشرة — وهو المؤثر الذي لا تستطيع صفحة التسعير إظهاره لك. هذا هو نفس الضغط الاقتصادي الذي يتم بيعه الآن كبنية تحتية مدارة؛ انظر إلى نظرتنا حول بيئات تشغيل الوكلاء المدارة من AWS و Google و Alibaba.

الخلاصة

استمر سعر الـ token في الانخفاض في يوليو 2026، بينما استمرت تكلفة تشغيل العميل الذكي في الارتفاع — لأن هذين رقمان مختلفان، وواحد منهما فقط هو الذي يظهر في صفحة الأسعار.

لقد أدرك كل من GPT-5.6 و Grok 4.5 طبيعة السوق. ركزت عمليات إطلاقهما على تسويق الكفاءة — الذكاء لكل token، والأداء مقابل الدولار، وإنهاء المهام في خطوات أقل — لأن هذا هو المكان الذي تُنفق فيه الأموال الحقيقية الآن في أحمال عمل العملاء الذكيين.12

بالنسبة لأي شخص يبني تطبيقات باستخدام هذه النماذج، الدرس هو تغيير المقياس. توقف عن السؤال عن تكلفة النموذج لكل مليون token، وابدأ في السؤال عن تكلفة إنهاء المهمة. في عام 2026، تعيش الـ tokens الرخيصة والمهام المكلفة جنباً إلى جنب، والفجوة بينهما هي جوهر اللعبة.


المراجع

الحواشي السفلية

  1. xAI، "تقديم Grok 4.5." التسعير (2$ / 6$ لكل مليون توكن إدخال/إخراج)، "تقريباً ضعف كفاءة التوكنات مقارنة بالموديلات الرائدة المماثلة،" 15,954 مقابل 67,020 متوسط توكنات الإخراج لكل مهمة في SWE-Bench Pro (≈4.2x)، سرعة تقديم 80 TPS، ومخططات القياس (SWE Marathon، Terminal-Bench 2.1، SWE-Bench Pro، DeepSWE). https://x.ai/news/grok-4-5 2 3 4 5 6 7 8 9 10 11 12 13

  2. OpenAI، "GPT-5.6: ذكاء رائد يتوسع مع طموحك،" 9 يوليو 2026. الشعار "ذكاء أكثر من كل token، أداء أقوى مقابل كل دولار"؛ تسعير GPT-5.6 (Sol $5/$30، Terra $2.50/$15، Luna $1/$6 لكل مليون)؛ "يتفوق على Opus 4.8 مع استخدام tokens مخرجات أقل بنسبة 85%" في OSWorld 2.0؛ ادعاء كفاءة Coding Agent Index؛ شروط prompt-caching. https://openai.com/index/gpt-5-6/ 2 3 4 5 6 7 8 9 10 11 12 13 14

  3. Stanford Digital Economy Lab، "كيف تستهلك وكلاء الذكاء الاصطناعي الـ tokens الخاصة بك؟" (5 مايو 2026)، ملخص لورقة "كيف ينفق وكلاء الذكاء الاصطناعي أموالك؟ تحليل وتوقع استهلاك الـ tokens في مهام البرمجة الوكيلية" (Bai, Huang, Wang, Sun, Mihalcea, Brynjolfsson, Pentland, Pei). يقوم الوكلاء بإعادة قراءة السياق المتراكم في كل خطوة — "كرة ثلج سياقية كبيرة ومكلفة" — و"التكلفة العالية تكمن في tokens المدخلات وليس المخرجات." https://digitaleconomy.stanford.edu/news/how-are-ai-agents-spending-your-tokens/ 2 3 4 5

  4. تحليلات من جهات خارجية حول استهلاك الـ tokens الخاص بالعملاء (agents) والتكلفة لكل مهمة، والتي تقدر أعباء العمل الخاصة بالعملاء بأنها تتراوح من عدة أضعاف إلى ~100 ضعف من الـ tokens المستخدمة في محادثة مماثلة، وتشير إلى أن الـ tokens الخاصة بالمدخلات غالبًا ما تهيمن على تكلفة البرمجة المعتمدة على العملاء. تختلف التقديرات حسب المهمة والمنهجية. https://leanopstech.com/blog/agentic-ai-cost-runaway-token-budget-2026/ 2 3 4 5

  5. Anthropic، تسعير Claude Fable 5 (10$ للمدخلات / 50$ للمخرجات لكل مليون token؛ خصم يصل إلى 90% على تخزين الـ prompt للمدخلات). https://platform.claude.com/docs/en/about-claude/pricing 2 3

  6. Anthropic، "تقديم Claude Opus 4.8" (التسعير العادي 5$ للمدخلات / 25$ للمخرجات لكل مليون token؛ الوضع السريع 10$/50$؛ توفير في التخزين يصل إلى 90%). https://www.anthropic.com/news/claude-opus-4-8 2 3 4

الأسئلة الشائعة

لأن الوكيل يشغل حلقة تكرارية ويعيد إرسال سياقه التراكمي بالكامل في كل خطوة. بحلول الخطوة العشرين، يكون قد أعاد قراءة الخطوات التسع عشرة السابقة، لذا فإنك تدفع ثمن السياق المبكر عدة مرات ضمن مهمة واحدة. 3 تشير تقديرات جهات خارجية إلى أن استخدام التوكنز في الوكلاء يصل إلى عدة أضعاف أو حتى 100 ضعف الدردشة المعادلة، اعتماداً على المهمة. 4