NVIDIA NeMo Switchyard: توجيه نماذج الوكلاء 2026
١٤ أغسطس ٢٠٢٦

NeMo Switchyard هي مكتبة NVIDIA مفتوحة المصدر لإرسال كل خطوة من سير عمل وكيل الذكاء الاصطناعي (AI agent) إلى نموذج مختلف. أعلنت NVIDIA عنها في 11 أغسطس 2026 جنبًا إلى جنب مع Nemotron 3.5 Lightning، على الرغم من أن المشروع أصدر نسخته الأولى في يونيو. وقد خفض اختبار LangChain التكلفة بنسبة 74% مقارنةً بالاعتماد الكلي على النماذج الرائدة (frontier-only)، مع فقدان ست نقاط من الدقة في المقابل.
ملخص
NeMo Switchyard هي مكتبة توجيه (routing library) بترخيص Apache 2.0 تقع بين الوكيل ومزودي النماذج الخاصين به، وتختار أي نموذج مُعد مسبقًا سيتولى كل دور.1 أعلنت NVIDIA عنها في 11 أغسطس 2026 جنبًا إلى جنب مع Nemotron 3.5 Lightning، وهو نموذج mixture-of-experts بحجم 30B مع 3B من المعلمات النشطة (active parameters) يستهدف طبقة التنفيذ للوكلاء الذين يعملون لفترات طويلة.23
أرقام الإطلاق حقيقية ولكنها أضيق مما توحي به العناوين:
- قاس LangChain تكلفة أقل بنسبة 74% مقارنة بتشغيل Claude Opus 4.8 بمفرده — بـ دقة 80.0% مقابل 86.0%.4
- سجل النموذج الرخيص بمفرده 77.7% مقابل ربع سعر التوجيه. وقد تفوق التوجيه عليه بـ 2.3 نقطة، وهو ما يشير LangChain إلى أنه ضمن نطاق الضوضاء (noise) البالغ 2.7 نقطة بين كل تشغيل والآخر.4
- في الأوضاع التي تستخدم نموذج حكم (judge model)، استهلك هذا الحكم 21.2% من إنفاق التوجيه وأضاف حوالي 700 مللي ثانية لكل دور.4
- Switchyard في مرحلة ما قبل ألفا (pre-alpha). ويذكر المستودع أنها ليست للاستخدام الإنتاجي، ويصنف PyPI الحزمة على أنها حالة تطوير "3 - Alpha".15
هذا ليس مشروعًا جديدًا تمامًا. تم إرسال الإصدار 0.1.0 إلى PyPI في 30 يونيو 2026؛ والإصدار 0.2.0 — وهو إعادة كتابة لمحرك التوجيه من Python إلى Rust — صدر في 10 أغسطس 2026، قبل يوم واحد من إعلان NVIDIA.56
ما ستتعلمه
- ماهية NeMo Switchyard فعليًا، وعمرها الحقيقي، وكيف يختلف التوجيه لكل خطوة عن بوابة النماذج (model gateway)
- استراتيجيات التوجيه الأربعة الموثقة، وأي واحدة استخدمها كل اختبار شريك فعليًا
- ما وجده اختبار LangChain المكون من 145 مهمة — بما في ذلك الرقم الذي لم يظهر في العناوين
- لماذا يعد نموذج الحكم بندًا خفيًا في أي ميزانية توجيه، ومدى عدم استقراره
- كيفية تحديد ما إذا كان التوجيه يمكن أن يكون مجديًا في ضغط العمل الخاص بك
ما هي NeMo Switchyard؟
NeMo Switchyard هي مكتبة ووكيل (proxy) مفتوح المصدر مكتوب بلغة Rust يقوم بتوجيه حركة مرور LLM عبر النماذج والمزودين مع الترجمة بين تنسيقات API.1 بدلاً من أن يختار المطور نموذجًا واحدًا لوكيل كامل، يقوم الموجه بتقييم كل طلب وإرساله إلى أي نموذج مُعد مسبقًا يكون مناسبًا.
جزء Rust حديث نسبياً. كان الإصدار 0.1.0 عبارة عن حزمة Python؛ أما الإصدار 0.2.0 فقد أعاد كتابة محرك التوجيه (routing engine) بلغة Rust وجعل switchyard-server — الذي نُشر على crates.io في 10 أغسطس 2026 — هو المسار الأساسي للنشر، مع الاحتفاظ بـ Python بشكل أساسي كواجهة للتوزيع والتكامل.76
الإطار التقني الذي تستخدمه NVIDIA هو "نظام من النماذج": حيث يقوم نموذج استدلال متطور (frontier reasoning model) بالتخطيط والتنسيق، بينما تتولى نماذج متخصصة أصغر التعامل مع خطوات التنفيذ ذات الحجم الكبير.8
يوجد هذا الإطار بسبب المكان الذي تذهب إليه توكنات (tokens) العميل فعلياً. تقضي العملاء (agents) طويلة المدى معظم وقتها في استدعاءات الأدوات، والتحقق من النتائج، وتفويض العملاء الفرعيين — وهي خطوات نادراً ما تحتاج إلى نموذج متطور ولكنها تحصل عليه على أي حال.3
يقبل Switchyard طلبات OpenAI Chat و Anthropic Messages و OpenAI Responses، ثم يقوم بتوجيه كل منها بالتنسيق الأصلي للخلفية (backend) المستهدفة.1 يستمر عميل البرمجة في التحدث بـ API الخاصة به بينما يتم تلبية الطلب بواسطة vLLM أو NVIDIA NIM أو Ollama أو أي نقطة نهاية متوافقة مع OpenAI.
يوفر المستودع (repo) مشغلات لـ Claude Code و Codex CLI و OpenClaw، بالإضافة إلى خادم مستقل و Rust crate قابلة للتضمين.1 وهو مرخص بموجب Apache 2.0.
التوجيه ليس أمراً جديداً — التغيير يكمن في تشغيله محلياً
يسبق توجيه النماذج هذا الإطلاق بسنوات. فقد أصدرت LMSYS إطار عمل RouteLLM، وهو إطار توجيه مرخص بـ Apache-2.0، في 1 يوليو 2024.9 وتقدم كل من LiteLLM و OpenRouter و Portkey توجيهاً على مستوى البوابة (gateway-level routing) اليوم.
أوضح جيسون أندرسن، نائب الرئيس والمحلل الرئيسي في Moor Insights & Strategy، هذا الفرق ببساطة: "توجيه النماذج في حد ذاته ليس جديداً — حيث تقدم Openrouter و AWS Bedrock Agent Core و Microsoft Foundry بالفعل إصدارات سحابية. المهم هو أن NVIDIA تجعل هذا مفتوح المصدر ومتاحاً للتشغيل محلياً."10
وكان حكمه على هذا الإصدار مباشراً بنفس القدر: "Switchyard ليس ثورياً، ولكنه يمثل نقطة إثبات."10
استراتيجيات التوجيه الأربعة
يوثق Switchyard أربع استراتيجيات للتوجيه، وهي توازن بين زمن الاستجابة (latency) والدقة بشكل مختلف تماماً. لاحظ أن التصعيد (escalation) ليس نوع توجيه مستقلاً — بل هو وضع من أوضاع مصنف LLM.1
| الاستراتيجية | كيفية اتخاذ القرار | نوع المسار type | استدعاء إضافي للموديل؟ |
|---|---|---|---|
| LLM classifier | موديل حكم صغير يختار الهدف ويحافظ على تقارب الجلسة (session affinity) | llm_classifier | نعم |
| Stage router | يقرأ نشاط الأدوات، والأخطاء، وعدد التوكنز الموجودة بالفعل في المحادثة | stage_router | لا |
| Escalation router | يبدأ في المستوى الضعيف؛ ويقوم موديل حكم بترقية المهمة بعد تكرار الأدوار السيئة | llm_classifier مع mode = "escalation" | نعم |
| Random | تقسيم ثابت لحركة المرور لاختبارات A/B والخطوط المرجعية | random | لا |
هناك خيار خامس، passthrough، يقوم بتسجيل هدف واحد تحت معرف موديل واحد دون أي قرار توجيه على الإطلاق.1
تصف NVIDIA أيضاً prefill router قابلاً للضبط يقرأ أنماط التنشيط الداخلية للموديل للتنبؤ بأي مرشح من المرجح أن يجيب بشكل صحيح.8 ولكنه لم يُطرح بعد: تصفه LangChain بأنه "في مرحلة البحث وليس جاهزاً للإنتاج"، ووجد ممارس راجع إصدار 0.2.0 أنه "تم تقديمه مفاهيمياً فقط وقت الكتابة ولم يتم تضمينه بعد في الإصدار".46
هذا التمييز مهم عند قراءة نتائج القياس، لأن الشركاء لم يستخدموا جميعاً نفس الاستراتيجية. أرقام LangChain تأتي من وضع escalation، الذي يدفع تكلفة موديل الحكم في كل دور من أدوار المستوى الضعيف، بينما تصف NVIDIA شركة Cognition بأنها تطبق staged router.48
ما الذي قامت LangChain بقياسه فعلياً
شغلت LangChain مجموعة تقييم Deep Agents الخاصة بها — 145 مهمة وكيلة متعددة الخطوات بمتوسط 6.3 استدعاء للموديل لكل منها — من خلال Switchyard في وضع escalation، مع التوجيه بين Nemotron 3.5 Lightning و Claude Opus 4.8.4
تم استقاء السيناريوهات من τ²-bench airline، و Berkeley Function Calling Leaderboard، و FRAMES، و Nexus، لتغطي دعم العملاء تحت قيود السياسات، والتحقيق في حوادث المناوبة (on-call)، وأتمتة سير العمل متعدد الخطوات.4
| الذراع | الدقة | التكلفة لكل تشغيل | التكلفة لكل مهمة مكتملة |
|---|---|---|---|
| Opus 4.8 وحده | 86.0% | $11.45 | $0.092 |
| موجه (Opus 4.8 + Nemotron 3.5 Lightning) | 80.0% | $3.00 | $0.026 |
| Nemotron 3.5 Lightning وحده | 77.7% | $0.72 | $0.006 |
الجدول: مجموعة LangChain Deep Agents، 145 مهمة. المصدر: LangChain، 11 أغسطس 2026.4
7% فقط من الاستدعاءات ذهبت إلى الموديل الرائد (frontier model) — وهذه الاستدعاءات شكلت 68.4% من الفاتورة.4 بينما تعامل Nemotron مع الـ 93% المتبقية مقابل 10.4% من الإنفاق. تستثني أعداد الاستدعاءات هذه موديل الحكم، الذي يعمل مرة واحدة لكل دور في المستوى الضعيف.4
هذه هي النتيجة الرئيسية، وهي نتيجة صامدة.
الرقم الذي لم يتصدر العناوين
انظر إلى الصف الثالث مرة أخرى. حقق Nemotron 3.5 Lightning بمفرده نسبة 77.7% مقابل 0.72 دولار. بينما حقق التكوين الموجه (routed configuration) نسبة 80.0% مقابل 3.00 دولار.
لقد اشترى التوجيه 2.3 نقطة دقة مقابل 4.2 ضعف التكلفة. وقامت LangChain بقياس التباين من تشغيل لآخر بنحو 2.7 نقطة واستنتجت، بكلماتها الخاصة، أننا "لا نستطيع القول بأن التوجيه قد تفوق على النموذج الرخيص هنا".4
كما أشارت LangChain إلى السبب: مجموعة الاختبار مشبعة. حيث لا يفصل سوى 8 نقاط تقريبًا بين نموذج مفتوح بحجم 30B ونموذج رائد (frontier model) في هذه المهام، مما "يعطي التوجيه مساحة أقل لإثبات قيمته مقارنة بعبء عمل أكثر صعوبة".4
ولنكون منصفين لكلا الطرفين، فقد نشرت LangChain هذا التحذير بنفسها وبشكل بارز — فهو الثاني من بين ثلاث نتائج رئيسية في أعلى المنشور.4 الفجوة تكمن في كيفية تداول هذا الرقم. فتغطية eWeek للإطلاق، على سبيل المثال، تستشهد بخفض التكاليف من NVIDIA وتذكر LangChain من بين الشركاء الذين اختبروا الأدوات، دون ذكر المقايضة في الدقة.11
لكن مراسل eWeek أضاف التحذير الصحيح بشأن أرقام الإطلاق بشكل عام: "أرقام الأداء والتكلفة من NVIDIA تعتمد إلى حد كبير على اختباراتها الخاصة أو اختبارات الشركاء، لذا يجب على المشترين التحقق من التوفير والدقة مقابل أعباء العمل الخاصة بهم قبل استبدال النماذج الحالية".11
القاضي بند تكلفة، وليس مجرد خطأ بسيط في التقريب
يتطلب توجيه التصعيد (Escalation routing) نموذج قاضٍ لقراءة كل دور مكتمل والتصويت على ما إذا كان العميل (agent) يسير في المسار الصحيح. استخدمت LangChain نموذج Gemini 3.1 Flash Lite في هذا الدور.4
مثل هذا القاضي شكل 21.2% من الإنفاق الموجه — وهو ثاني أكبر بند تكلفة بعد النموذج الرائد، وما يقرب من ثلث تكلفة Opus.4 إنه يعمل في كل دور حتى يتم تصعيد المهمة، وعلى عكس النموذج الرائد، فإنه لا يستفيد من تخزين المطالبات مؤقتًا (prompt caching).
كما أنه يكلف من حيث زمن الاستجابة (latency): حوالي 700 مللي ثانية لكل دور، مقابل صفر فعليًا لموجه مرحلة الاستدلال (heuristic stage router).4
والقاضي غير مستقر بطريقة لا تظهرها جداول التكاليف. يذكر Hiroshi Morishige من Classmethod، الذي قام بتشغيل Switchyard في التحقق الداخلي منذ الإصدار v0.1.0، أن استبدال نموذج التصنيف بإصدار تحديث بسيط أدى إلى تحويل 50 محادثة من 39 توجيهًا للفئة الضعيفة إلى توجيه واحد فقط — دون ظهور أي أخطاء ومع بقاء الثقة عالية.6
عبر 1,392 حكمًا شملت ثمانية نماذج ومطالبتين، وجد أن معدل الأحكام الضعيفة يتراوح بين 0% إلى 100% على مدخلات متطابقة. استنتاجه هو: ما يقرأه القاضي، وكيف يقرأه، هو متغير أكبر بكثير من العتبة (threshold) التي تقوم بضبطها.6
لخصت LangChain هذا في صيغة نقطة التعادل التي تستحق الاقتباس:
minimum offload = judge cost / (expensive cost - cheap cost)
بالنسبة لعملية الاقتران الخاصة بهم، فإن وجود حكم بتكلفة 0.64 دولار مقابل فجوة سعرية قدرها 10.73 دولار يعني أنهم بحاجة إلى تحويل 5.9% من الأدوار لتحقيق نقطة التعادل. لكنهم قاموا بتحويل 93%.4 إذا كان النموذجان المرشحان متقاربين في السعر، فإن المعادلة تتطلب تحويلاً بنسبة تزيد عن 100% — ولا يمكن لعملية التوجيه (routing) أن تكون مربحة إلا إذا قمت باستضافة النموذج الرخيص ذاتياً.
التوجيه يوسع نطاق التكلفة لديك
عبر خمس عمليات تشغيل، تراوحت حركة مرور النماذج الرائدة (frontier traffic) من 4.1% إلى 9.1%، بمتوسط 6.9%.4 لم يتغير شيء بين هذه التشغيلات باستثناء الأدوار التي اختار الموجه تصعيدها.
ومع ذلك، تحركت الفاتورة بنسبة 67%، من 2.16 دولار إلى 3.61 دولار.4 حيث بلغت تكلفة استدعاء Opus نحو 0.0324 دولار مقابل 0.00037 دولار لـ Nemotron — أي حوالي 87 ضعفاً — لذا فإن التغييرات الطفيفة في معدل التصعيد تؤثر بقوة على الفاتورة.
هذه هي المقايضة التي لا يضعها أحد في شرائح العرض الخاصة بالإطلاق: الموجه يقلل متوسط إنفاقك ولكنه يوسع النطاق حوله. لذا، ضع ميزانيتك بناءً على الحد الأعلى لهذا النطاق، وليس على المتوسط.
يظهر نفس التوتر في كيفية تعامل AWS و Anthropic مع فرض إنفاق الوكلاء باستخدام حدود قصوى لكل جلسة — حيث يكون السقف مفيداً تحديداً لأن تكلفة التشغيل الواحد لم تعد قابلة للتنبؤ.
النموذج الأساسي: Nemotron 3.5 Lightning
نموذج Nemotron 3.5 Lightning هو نموذج mixture-of-experts مفتوح بحجم 30B مع 3B من المعلمات النشطة، تم إصداره في 11 أغسطس 2026.312 تصفه NVIDIA بأنه أصغر عضو في عائلة Nemotron 3؛3 وهو يأتي بعد Nemotron 3 Nano في ترتيب الإصدار.2
تفيد NVIDIA بأن سرعة المخرجات تصل إلى 4 أضعاف النماذج ذات الحجم المماثل، وبدقة 86% على PinchBench مع إكمال 10,000 مهمة أسرع بنسبة 30% من Qwen3.6 35B بدقة مماثلة.3
تم إصدار الأوزان وبيانات التدريب والوصفات بموجب ترخيص OpenMDW-1.1،3 وهو إطار ترخيص النماذج الخاص بمؤسسة Linux التي التزمت NVIDIA في مايو 2026 باعتماده في الإصدارات المستقبلية من عائلات نماذج Cosmos و Isaac GR00T و Ising و Nemotron.13 النموذج متاح مجاناً على OpenRouter مع نافذة سياق تبلغ 1 مليون توكن وحد أقصى للمخرجات يبلغ 65,536 توكن.12
بالنسبة للقراء الذين يتابعون فئة الوكلاء ذات الأوزان المفتوحة، فقد صدر هذا في نفس أسبوع إصدار Muse Glimmer من Meta — ويغطي تحليلنا للمعايير حول أين يتفوق Muse Glimmer وأين يتأخر في المهام الوكالية الجانب الآخر من هذه المقارنة.
فجوة النضج
إليك الجزء الذي يستحق اهتماماً أكثر مما ناله.
نشر إعلان NVIDIA تخفيضات في تكاليف الشركاء تتراوح بين 27% و 74%. وبعد ثلاثة أيام، كان مستودع Switchyard لا يزال يحمل هذا التنبيه: "Switchyard هو برنامج في مرحلة ما قبل ألفا (pre-alpha) ويتطور بسرعة. ومن المتوقع أن تتغير الـ API والخوارزميات بشكل كبير قبل أن نصل إلى الإصدار v1.0." وتحته مباشرة: "برنامج تجريبي. ليس للاستخدام في بيئات الإنتاج."1
وهذا ما تؤكده مصادر أخرى؛ حيث تدرج PyPI الحزمة تحت حالة التطوير "3 - Alpha"،5 كما أشار المراجعان من جهات خارجية اللذان اختبرا إصدار 0.2.0 عملياً إلى نفس التحذير.146
وكان مراجعة Wavect صريحة بشأن النتيجة: Switchyard "هو صراحةً في مرحلة ما قبل ألفا، ولا يزال المسار يحتاج إلى معايرة، والموديل الأرخص يكون أرخص فقط عندما تظل المهمة المكتملة مقبولة."14
أما بالنسبة لنسب الاعتماد فهي لا تزال في بدايتها وفقاً للأرقام. فبحلول 14 أغسطس 2026، يظهر المستودع 342 نجمة، و 51 عملية نسخ (forks)، و 213 عملية إرسال (commits)، مع 35 مشكلة مفتوحة و 39 طلب سحب (pull requests) مفتوح،1 بينما سجل الـ crate الخاص بـ switchyard-server إجمالي 321 عملية تحميل منذ نشره في 10 أغسطس.7
وتوجد البرمجيات الوسيطة (middleware) الخاصة بـ LangChain للتوجيه داخل العمليات في حالة مماثلة — "تجريبية ولم تُنشر كحزمة بعد"، مما يتطلب منك استنساخ كل من Switchyard و langchain-nvidia وتثبيتهما محلياً.4
لا يجعل أي من هذا نتائج الاختبارات (benchmarks) خاطئة، بل يعني أن الشيء الذي أنتج هذه النتائج ليس هو الشيء الذي يمكنك نشره يوم الاثنين.
وتصب تحذيرات Andersen في نفس الاتجاه: "توجيه الموديلات ليس عملية (plug-and-play). فمثلما هو الحال مع موجه الشبكة (network router)، يتطلب الحصول على أفضل النتائج مشغلين مهرة وتكوينات دقيقة." ويضيف أن الوكلاء (agents) الحاليين "سيحتاجون على الأرجح إلى إعادة هندسة للاستفادة من التوجيه"، وأنه إذا كانت البنية الأساسية (upstream architecture) خاطئة، "سيصبح الموجه عبئاً إضافياً بدلاً من أن يكون وسيلة تحسين."10
من غيرهم أبلغ عن أرقام
يسرد منشور الإطلاق الخاص بـ NVIDIA نتائج الشركاء عبر النظام البيئي. هذه النتائج مُبلغ عنها من قبل الموردين ولم يتم التحقق منها بشكل مستقل، لذا تعامل معها كمؤشرات عامة.2
| الشريك | النتيجة المُبلغ عنها |
|---|---|
| Ramp | تكلفة أقل بنسبة 58%، ووقت تشغيل أقصر بنسبة 33% على Ramp SWE-Bench |
| Cognition | 50.6% على FrontierCode Main بتكلفة متوسطة 3.11 دولار — بفارق 2.8 نقطة عن Opus 5 وبتكلفة أقل بنحو 28%8 |
| Classmethod | تخفيض في التكلفة بنسبة 27% في الاختبارات الداخلية |
| Cadence | تحسن في الكفاءة بنسبة 9.9% في سير عمل التحقق الرسمي |
جدول: نتائج Switchyard المُبلغ عنها من الشركاء. المصدر: NVIDIA، 11 أغسطس 2026.2
يعتبر رقم Cognition هو الأكثر فائدة من بين هذه الأرقام لأن NVIDIA نشرت الإعدادات: توجيه مرحلي (staged routing) بين Opus 5 و Kimi K2.7، تم نشره للمستخدمين الداخليين في NVIDIA.8 معظم الشركاء الآخرين لم يكشفوا عن النماذج التي تم التوجيه بينها، مما يحد من مدى قدرتك على تحليل نسبهم المئوية.
نشر مهندس من Classmethod جانبه من رقم الـ 27%، وصياغته تستحق الاقتباس. في مجموعة مهام منسقة خاصة به، قاس انخفاضاً في التكلفة بنسبة 98% — ثم استبعد هذه النتيجة، لأن المهام كانت سهلة لدرجة أن النموذج الرخيص حقق درجة كاملة بمفرده. بكلماته، هذا الرقم "ليس دليلاً على 'تقليل التكاليف مع الحفاظ على الجودة' — بل هو دليل على 'توجيه جميع المهام التي لا تحتاج إلى نموذج قوي إلى نموذج ضعيف'". أما نسبة الـ 27% فهي الرقم الناتج عن حركة مرور (traffic) حقيقية.6
تفصيل واحد يستحق الملاحظة: كان المرجع الأساسي لـ Cognition هو Opus 5، بينما كان لـ LangChain هو Opus 4.8. أطلقت Anthropic نموذج Claude Opus 5 في 24 يوليو 2026، قبل 18 يوماً من هذا الإطلاق، لذا فإن النتيجتين الرئيسيتين تم قياسهما مقابل أجيال مختلفة من النماذج الرائدة (frontier models).
تزعم الاختبارات الداخلية لـ NVIDIA أن التوجيه يقلل تكلفة إكمال المهام "إلى ما يقرب من ثلث تكلفة Opus 4.8 وحده".2 أما قياس LangChain المنشور بشكل منفصل فقد جاء بنحو الربع (3.00 دولار مقابل 11.45 دولار) على مجموعة اختبار مختلفة.4 اختبارات مختلفة، لكنها في نفس النطاق — وهو تحقق منطقي معقول من الاتجاه، إن لم يكن من القيمة الدقيقة. كلاهما اختبارات شركاء أو موردين، وليست تقييمات من طرف ثالث.
تشمل شركاء التكامل Kong، التي توفر التوجيه بشكل أصلي من خلال Kong AI Gateway؛ و LiteLLM، التي تضيف Switchyard كإضافة وسيطة (proxy plug-in)؛ و Nous Research، التي قامت بدمجه في Hermes.2
هل يجب عليك استخدام التوجيه؟
ثلاثة أسئلة تحدد ذلك، بهذا الترتيب.
هل فجوة السعر واسعة بما يكفي؟ قم بتشغيل معادلة LangChain قبل بناء أي شيء. إذا تجاوزت تكلفة الحكم (judge cost) مقسومة على فجوة السعر معدل التفريغ الواقعي لديك، فلن يكون التوجيه مربحاً — ولا يوجد تغيير في الإعدادات يمكنه إصلاح ذلك.4
هل عبء العمل لديك صعب بما يكفي؟ يثبت التوجيه جدواه عندما يفشل النموذج الرخيص فعلياً في جزء من حركة المرور لديك. في مجموعة اختبار مشبعة حيث الفجوة هي 8 نقاط، كان استنتاج LangChain هو أنه إذا كانت التكلفة الدنيا هي الأولوية، فإن تشغيل النموذج الرخيص وحده هو الخيار الأفضل.4
هل يمكنك تحمل التباين؟ إذا كان فريق المالية لديك يريد رقماً يمكن التنبؤ به بدلاً من متوسط أقل، فإن الموجه (router) سيعمل ضد مصلحتك.
الحجة الصادقة للتوجيه هي تلك التي قدمتها LangChain: إنها "تكلفة عدم الاضطرار إلى التخمين". في بيئة الإنتاج، لا تعرف مسبقاً ما إذا كان الطلب الوارد سهلاً أم صعباً، وتشغيل النموذج الرخيص على كل شيء يعني قبول إجابته في المهام الصعبة أيضاً.4
هذا عرض قيمة حقيقي. ولكنه مجرد عرض مختلف عن "أرخص بنسبة 74%".
الخلاصة
يعد Switchyard قطعة بنية تحتية جادة وتحولاً حقيقياً: توجيه النماذج لكل خطوة، مفتوح المصدر، ويعمل على أجهزتك الخاصة. هذا أمر يستحق المتابعة، كما أن منظومة الشركاء التي تتشكل حوله — Kong و LiteLLM و LangChain و Cognition و Nous Research — تشير إلى أن هذا النمط أصبح واقعاً.
لكن حسابات يوم الإطلاق تستحق القراءة بعمق يتجاوز العناوين الرئيسية. فأكبر توفير في الأرقام المنشورة جاء بتكلفة بلغت ست نقاط من الدقة، ونموذج تحكيم يستهلك خمس الميزانية، وتذبذب بنسبة 67% في تكلفة التشغيل الواحد، ومستودع برمجيات ينصح بعدم إطلاقه بعد.
التوجيه (Routing) ليس خصماً. إنه مراهنة على أنك لا تستطيع التمييز بين الطلبات الصعبة والسهلة مسبقاً — وهذه المراهنة لها ثمن.
للحصول على صورة أشمل حول كيفية قياس كفاءة الوكلاء، راجع تحليلنا لـ معايير استنتاج الوكلاء ومقياس الوكلاء لكل ميجاوات.
Footnotes
-
NVIDIA-NeMo/Switchyard, GitHub repository. Accessed August 14, 2026. https://GitHub.com/NVIDIA-NeMo/Switchyard ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12
-
NVIDIA. "NVIDIA Nemotron 3.5 Lightning and NeMo Switchyard Deliver Faster, Smarter, More Efficient Agentic AI." August 11, 2026. https://blogs.nvidia.com/blog/nemotron-lightning-switchyard-rtx-dgx/ ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7
مدونة NVIDIA التقنية. "NVIDIA Nemotron 3.5 Lightning يوفر تنفيذًا سريعًا ودقيقًا للمهام المتخصصة للوكلاء الذين يعملون لفترات طويلة." 11 أغسطس 2026. https://developer.nvidia.com/blog/nvidia-nemotron-3-5-lightning-delivers-fast-accurate-specialized-task-execution-for-long-running-agents/ ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7
LangChain. "كم عدد مكالمات العميل (agent) الخاصة بك التي تحتاج فعلياً إلى نموذج متطور (frontier model)؟" 11 أغسطس 2026. https://www.langchain.com/blog/switchyard-agent-routing-benchmark ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18 ↩19 ↩20 ↩21 ↩22 ↩23 ↩24 ↩25 ↩26
PyPI. سجل إصدارات "nemo-switchyard" والبيانات الوصفية للحزمة. تم الوصول في 14 أغسطس 2026. https://pypi.org/project/nemo-switchyard/ ↩ ↩2 ↩3 ↩4 ↩5
Hiroshi Morishige, Classmethod DevelopersIO. "لقد جربت NeMo Switchyard v0.2.0، الذي ولد من جديد بلغة Rust." 12 أغسطس 2026. تم ذكر Classmethod في منشور إطلاق NVIDIA كشريك لـ Switchyard. https://dev.classmethod.jp/en/articles/nvidia-nemo-switchyard-v020-rust-first-touch/ ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8
crates.io. البيانات الوصفية لـ "switchyard-server" crate. تم الوصول في 14 أغسطس 2026. https://crates.io/crates/switchyard-server ↩ ↩2 ↩3
مدونة NVIDIA التقنية. "توجيه أعباء عمل عملاء الذكاء الاصطناعي عبر النماذج باستخدام NVIDIA NeMo Switchyard." 11 أغسطس 2026. https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/ ↩ ↩2 ↩3 ↩4 ↩5
LMSYS Org. "RouteLLM: An Open-Source Framework for Cost-Effective LLM Routing." 1 يوليو 2024. https://www.lmsys.org/blog/2024-07-01-routellm/ ↩
Jason Andersen, Moor Insights & Strategy. "NVIDIA NeMo Switchyard: Open-Sourcing Model Routing Is the Real Move." 11 أغسطس 2026. https://moorinsightsstrategy.com/field-notes/nvidia-nemo-switchyard-open-sourcing-model-routing-is-the-real-move/ ↩ ↩2 ↩3 ↩4
Aminu Abdullahi, eWeek. "Nvidia Launches Nemotron 3.5 Lightning and Switchyard to Cut AI Agent Costs." 12 أغسطس 2026. https://www.eweek.com/news/nvidia-nemotron-3-5-lightning-switchyard-ai-agent-costs/ ↩ ↩2
OpenRouter. "NVIDIA: Nemotron 3.5 Lightning (free)." تم الوصول إليه في 14 أغسطس 2026. https://openrouter.ai/nvidia/nemotron-3.5-lightning:free ↩ ↩2 ↩3
Linux Foundation. "Linux Foundation Releases OpenMDW-1.1; NVIDIA Adopts OpenMDW for Cosmos, Isaac GR00T, Ising and Nemotron, AI Model Families." 28 مايو 2026. https://www.linuxfoundation.org/press/linux-foundation-releases-openmdw-1.1-nvidia-adopts-openmdw-for-cosmos-isaac-gr00t-ising-and-nemotron-ai-model-families ↩
Kevin Riedl, Wavect. "NeMo Switchyard 0.2: Agent Model Routing Without Training?" 11 أغسطس 2026. Wavect هي شركة استشارات برمجيات وتفصح عن مصلحة تجارية في هذا المجال. https://wavect.io/blog/nemo-switchyard-model-router/ ↩ ↩2