محلي مقابل الحدودي — ميزانية الأمر

مشهد الـopen-weight — اللي تقدر تشحنه فعلاً

4 دقيقة للقراءة

الكورس لحد دلوقتي قارن 3 frontier APIs: Claude، GPT، Gemini. عندهم خاصية مشتركة — closed weights، مستضافين عند الـvendor، فوترة per-token. النص التاني من مشهد الـprompt engineering هو الـopen-weight models اللي تقدر تـdownload-هم وتشغّلهم بنفسك، على الـinfrastructure بتاعتك أو على third-party host ما بيملكش الـweights. Llama، Mistral، Qwen، DeepSeek، Phi. الـlist بتزيد.

محتاج تعرف الجزء ده من المشهد أصل لكتير من المهام اللي الـCTO بتاع هاجر بيدفع لـClaude عشانها، open-weight model شغّال على GPU صغير ممكن يعمل الشغل بـfraction من التكلفة.

اللي بيحدد هل تقدر تشغّله — total params قبال active params

frontier مغلق — إنت بتأجّره
open-weight MoE — كبير في الحمل، رخيص في التشغيل
open-weight dense — رقم واحد للاتنين
dense صغير — GPU واحد، موبايل، edge

العيلات اللي بتفرق، وإزاي تقراها

أسامي النماذج وأحجامها بتتغيّر كل كام شهر؛ العيلات والـlicences بتتحرك أبطأ بكتير. عشان كده النسخة الباقية من الجدول ده هي مين الصانع وإيه اللي تتأكد منه، والأحجام تقراها من الـmodel card يوم ما تختار.

العيلةالصانعتعرف إيه قبل ما تختار حجم
LlamaMetaLlama 4 نقل العيلة لـMixture-of-Experts — Scout و Maverick الاتنين بيشغّلوا ~17B parameter لكل token وهم شايلين أكتر من كده بكتير في الذاكرة. ما تنقلش سلّم أحجام Llama 3 الـdense (8B / 70B / 405B) على Llama 4؛ الأحجام وحسابات الـhardware الاتنين مختلفين.
MistralMistral AIMistral Large 3 نموذج MoE كبير تحت Apache 2.0 — licence متساهل، بس VRAM بحجم frontier. Mistral كمان بتشحن نماذج أصغر بكتير تحت نفس الـlicence؛ الـlicence مش مؤشر على الحجم.
QwenAlibabaمتغيرات dense و MoE، أغلبها تحت Apache 2.0. قوي على الـcode وعلى الصيني/الإنجليزي. أوسع مدى أحجام في أي عيلة، وده اللي بيخليه أول محطة عادةً لما يكون عندك VRAM budget ثابت.
DeepSeekDeepSeekMoE، نسبة cost/quality عدوانية. متغير الـreasoning هو النظير الـopen-weight لأوضاع التفكير المستضافة في الـmodule 4. شروط الـlicence بتختلف من release لـrelease — راجع كل واحد.
PhiMicrosoftعيلة النماذج الصغيرة. Phi-4 نفسه نموذج 14B dense؛ العضو اللي تحت 4B اسمه Phi-4-mini. اختار العضو الصح — الأسامي بتفرق بكلمة واحدة ومتطلبات الـhardware بتفرق ~4×.

راجع الأحجام والـcontext windows والـlicences الحالية على الـmodel cards بتاعة كل عيلة — Meta Llama، Mistral، Qwen، DeepSeek، Phi. الصفحات دي بتتصحّح لما release يغيّر حاجة؛ جدول في كورس لأ.

"قابل للشحن" دي بتعني إيه فعلاً

النموذج قابل للشحن لمهمتك لو محقق الأربعة كلهم:

  1. هل يقدر يشتغل فعلاً على hardware budget اللي عندك؟ احسبها من الـmodel card، مش من اسم العيلة. للنموذج الـdense الأرضية تقريباً = الـparameters × bytes لكل parameter — حوالي 2 bytes لكل واحد بـfp16، وحوالي 0.5 بـint4 — زائد الـKV cache وoverhead التشغيل، يعني نموذج dense بـ70B محتاج عشرات الـGB بـint4 وأكتر من 100 بكتير بـfp16. للنموذج الـMoE، احسب الـVRAM على total parameters، لأن كل الـexperts لازم تكون محمّلة، وتوقّع سرعة وتكلفة per-token بتاعة الرقم الـactive الأصغر بكتير. عشان كده "بيشغّل 17B parameter" ما بيقولش لك حاجة عن إنه هيدخل ولا لأ. اختار أصغر نموذج يعمل الشغل.

  2. هل الـprompt اللي اشتغل على Claude / GPT / Gemini لسه شغّال هنا؟ غالباً، لأ. الـopen-weight models بتميل تبقى أحسس لصياغة الـprompt وبتتبع few-shot examples بشكل أحرف. الدروس الجاية بتغطّي ده.

  3. الـlicence إيه؟ "open-weight" مش licence واحد. Llama بيتشحن تحت الـcommunity licence بتاعة Meta نفسها، وفيها شروط — منها حد لو عدّيته الـdeployments الكبيرة جداً بتحتاج اتفاق منفصل. Apache 2.0، اللي كذا release من Mistral و Qwen بيستخدموه، ما فيهوش الشرط ده. شروط DeepSeek بتختلف من release لـrelease. اقرا ملف الـlicence اللي جنب الـweights، لكل نموذج، قبل ما تشحن — وخد بالك إن الـlicence ممكن يفرق بين نموذجين من نفس الصانع.

  4. inference cost end-to-end كام؟ نموذج ببلاش مش ببلاش لو بتدفع لـAWS للـGPU. قارن قبال السعر per-token للـfrontier API على نفس الـvolume. على volumes قليلة، الـfrontier APIs أرخص. على volumes عالية (ملايين requests في اليوم)، open-weight على infrastructure بتاعتك بيكسب.

الـtradeoff الصريح

الفجوة بين أحسن نماذج open-weight والـfrontier المستضاف ضاقت كتير، وبتضيق بشكل غير متساوي. فين open-weight بيصمد عادةً: توليد من دورة واحدة، classification، تلخيص نص موجود أصلاً في الـprompt. وفين ما بيصمدش عادةً: الالتزام المستمر بتعليمات كتير في نفس الوقت، long-context reasoning، وtool use على خطوات كتير.

قاوم إغراء إنك تنقل نسبة مئوية للفجوة دي، بما فيها نسبة منّنا إحنا. الـleaderboards المنشورة بتتحرك كل أسبوع، وغالباً بتتقاس على benchmarks ما تشبهش مهمتك، ولما الرقم يوصل لكورس بيكون بيوصف release اتعدّى عليه. الفجوة اللي بتفرق هي اللي على الـprompts بتاعتك إنت — وده بالظبط اللي المشروع الختامي بيقيسه. شغّل الـprompt الحقيقي بتاعك على نموذج مستضاف وعلى مرشّح open-weight، قيّم الاتنين بنفس الـrubric، وهيطلع معاك رقم يستاهل أكتر من أي leaderboard لأنه عن الشغل بتاعك إنت.

خطة هاجر العملية بتاخد نفس الشكل: تخلّي نموذج frontier للـcustomer-facing copy، وتخلّي نموذج مستضاف رخيص لمسودات الـvolume العالي، وتختبر هل نموذج open-weight self-hosted يقدر ياخد job الـbulk-classification اللي بيشتغل كل ليلة. الـclassification هو أقوى مرشّح للتبديل — volume عالي، المخرج قصير وقابل للفحص، والـlabel الغلط رخيص إنك تمسكه ورا. هل التوفير هيغطّي الـGPU ولا لأ ده حساب ما تقدرش تعمله غير بعد ما تقيس، ودي هي النقطة.

التالي: إزاي بتتغيّر prompt budget — الـopen-weight models بتتصرف بشكل مختلف لما الـprompts تطوّل. :::

اختبار

الوحدة 5: محلي مقابل الحدودي — ميزانية الأمر

خذ الاختبار
هل كان هذا الدرس مفيدًا؟

سجّل الدخول للتقييم