النبرة واتباع التعليمات عبر النماذج
الالتزام بالقواعد الصارمة — 3 نماذج، 4 قواعد
ده أول prompt اللهجات بتبان فيه. المستخدم بيدي 4 قيود صارمة. كل نموذج بيفسّر "اتبع كل القواعد دي" بطريقة مختلفة. اقرا الـprompt، اقرا الـ3 مخرجات، وبعدين هنفكك.
نفس الـprompt ← 4 قواعد صارمة ← 3 نتائج مختلفة
العدّادات بتتحرك لفوق لما تـscroll. كل شريط بيتملي بنسبة الالتزام بالقاعدة.
Claude Sonnet 4.5
4/4 قواعد — أطول سطر 49 حرف.
GPT-4o-mini
4/4 قواعد — أطول سطر 54 حرف.
Gemini 2.5 Flash
1/4 قواعد — سطر واحد، 28 حرف، من غير coffee.
الـprompt
اتبع كل القواعد دي:
- رد بـ3 سطور بالظبط.
- كل سطر يبتدي بحرف صائت مختلف (A, E, I, O, or U)، بترتيب أبجدي عبر السطور.
- اذكر كلمة "coffee" مرة واحدة بالظبط.
- ما تستخدمش أي سطر أطول من 60 حرف.
الموضوع: روتين صبح هادي.
(الـprompt الأصلي بالإنجليزي والمخرجات كمان، بتفضل زي ما اتلقطت.)
Claude Sonnet 4.5
A gentle sunrise begins the peaceful day ahead. Each sip of coffee warms me from the inside out. I stretch slowly, grateful for this quiet moment.
GPT-4o-mini
Awakening slowly, I savor the calm of dawn. Every sip of coffee warms my soul as I reflect. In silence, I embrace the peace before the day begins.
Gemini 2.5 Flash
A quiet start begins the day
اللي ده بيقوله لنا
Claude و GPT-4o-mini الاتنين التزموا بالأربع قواعد. 3 سطور لكل واحد، A → E → I في بدايات السطور، "coffee" مرة واحدة، وما فيش سطر عدّى 60 حرف — أطول سطر عند Claude 49 وعند GPT 54. عدّهم بنفسك على الـcaptures اللي فوق؛ المخرجين مختلفين في النبرة، مش في الالتزام.
Gemini رجّع سطر واحد طوله 28 حرف ووقف. لا 3 سطور، لا تسلسل صوائت، ولا "coffee". قاعدة واحدة من أربعة.
قبل ما تلوم النموذج، اتأكد إنه خلّص أصلاً
القراءة الواضحة إن Gemini أضعف في القيود. القراءة دي ممكن تكون صح كمان. بس الـcapture ده ما يقدرش يثبتها، ولا أي مقارنة متعمولة بالطريقة اللي اتعملت بيها دي.
الرد اللي بيقف عشان النموذج خلص، والرد اللي بيقف عشان خلصت المساحة — الاتنين شكلهم واحد في النص. مش شكلهم واحد في الـresponse body. كل vendor بيقول لك اللي حصل:
| الـvendor | الحقل في الـresponse | القيمة اللي معناها "خلصت المساحة" |
|---|---|---|
| Anthropic | stop_reason | max_tokens |
| OpenAI | finish_reason | length |
finishReason | MAX_TOKENS |
الـharness اللي طلّع الـcaptures بتاعة الكورس ده ما سجّلش الحقل ده. كان لازم يسجّله. بصّ على مخرجات Gemini في الكورس كله: سطر مقصوص هنا، جملة متقطّعة في نصها في درس الرفض، وstring بتاع JSON متقطّع بعد "single في الـmodule 3. ده توقيع سقف output tokens، مش توقيع نموذج بيكره القيود.
مخرج قصير من نموذج — النموذج ولا الـharness بتاعك؟
نموذج رجّع أقل من اللي كنت متوقّعه. حقل الـstop-reason بيقول إيه؟
إحنا بننشر الـcaptures زي ما اتاخدت، والتحفّظ مكتوب معاها، عشان النسخة الصريحة من الدرس ده تستاهل أكتر من النسخة المرتّبة. اقرا عمود Gemini في الكورس ده على إنه run واحد مش متحقّق منه، مش على إنه خاصية في النموذج.
الخلاصة الباقية صح في الحالتين: الـprompt اللي فيه N قيد صارم نسبة نجاحه مختلفة على كل نموذج، لازم تقيسها قبل ما تشحن، والقياس اللي ما بيسجّلش سبب وقوف التوليد ما قاسش النموذج.
Captured 2026-04-27 من Claude Sonnet 4.5 و GPT-4o-mini و Gemini 2.5 Flash — سبب الوقوف مش مسجّل. الـre-runs ممكن تختلف.
التالي: نفس المهمة، بس الهدف هو الدفء — محور تاني خالص نفس النماذج بتسجّل عليه بشكل مختلف جداً. :::
سجّل الدخول للتقييم