الأبحاث · سبتمبر 2026

اختُبر مقابل 26 إعدادًا من النماذج اللغوية الكبيرة.
وجاء الأول في كل مقياس رئيسي.

بلغ L3، محرك لسان اللغوي داخل رايتكس، نسبة 80.29% على مقياس F0.5 للتعديلات على معيار من جمل عربية حقيقية راجعها خبير لغوي. وبلغ Claude Fable 5.1، أقوى إعدادات النماذج اللغوية الكبيرة التي اختبرناها، 44.68%.

الأبحاث

  • تاريخ النشر
  • الإصدار1.0
  • الجهةفريق البحث في لسان
  • تاريخ التقييم9 سبتمبر 2026
80.29%مقياس F0.5 للتعديلاتمقيس · Claude Fable 5.1 بنسبة 44.68%
84.54%دقة تنبيهاتهمقيس · التالي 64.21%
96.38%بديل صحيح بعد تنبيه صحيحمقيس · بعد التطبيع العربي، مشروطة بصحة التنبيه
0.000014كيلوواط ساعة لكل 1,000 رمز، على نطاق المسرّعمقيس على NVIDIA A10 · 0.000042 بمعامل المنظومة الكاملة بثلاثة أضعاف، وهو تقدير

يجمع F0.5 بين الدقة والاستدعاء مع ترجيح الدقة. والدقة نسبة التغييرات المقترحة التي وقعت حيث غيّر الخبير اللغوي النص أيضًا؛ والاستدعاء نسبة تعديلات الخبير التي وجدها النظام. التعريفات الكاملة في المنهجية.

ما الذي يعنيه هذا لكتابة مؤسستك

يُحكم على المدقق اللغوي في وزارة أو غرفة أخبار أو مصرف بأربعة أمور. هل ينبّه إلى ما هو خاطئ فعلًا؟ وهل يترك النص الصحيح دون مساس؟ وهل الإصلاح المقترح صائب؟ وهل يستطيع المسؤولون عن النص أن يروا السبب؟ يقيس تقييم L3 الأمور الثلاثة الأولى، ويجيب المنتج عن الرابع.

تنبيهات دقيقة. من بين التغييرات التي اقترحها L3، وقع 84.54% منها على مقطع غيّره الخبير اللغوي أيضًا. وهذا هو الرقم الذي يلمسه المراجع: قائمة اقتراحات معظمها يستحق القبول. مقيس.

إنذارات كاذبة قليلة، وفوات قليل. كان L3 النظام الوحيد بين الأنظمة المقارَنة الذي جمع بين دقة تتجاوز 80% واستدعاء يتجاوز 60%. أما النماذج اللغوية الكبيرة فكانت إما حذرة وناقصة، وإما شاملة ومشوشة؛ ولم يحقق أي منها الأمرين على هذا المعيار. مقيس.

اقتراحات يمكنك قبولها. متى نُبّه إلى مقطع تنبيهًا صحيحًا، طابق بديل L3 المرجع حرفيًا في 89.79% من الحالات، وفي 96.38% منها بعد التطبيع العربي. وهذه النسب مشروطة بصحة التنبيه، ونصرّح بذلك حيثما وردت. مقيس.

الشرح والتحكم في البيانات. يحمل كل تصحيح في رايتكس القاعدة التي وراءه، ويُنشر المحرك داخل مقر المؤسسة، فلا يلزم أن يغادر أي نص نطاقها ليُدقَّق. ولا يقيس التقييم هذين الأمرين؛ فهما ما يفعله المنتج. إمكانية في المنتج.

الطاقة. عند القياس على مسرّع NVIDIA A10 بسعة 24 غيغابايت، استهلك L3 نحو 0.000014 كيلوواط ساعة لكل 1,000 رمز على نطاق المسرّع. مقيس. ولا يقول القياس نفسه شيئًا عن متطلبات العتاد؛ أما النشر داخل المقر فإمكانية في المنتج مبيّنة أعلاه. إمكانية في المنتج.

يتصدر L3 مقياس F0.5 للتعديلات بنسبة 80.29% مقابل 44.68% لـ Claude Fable 5.1

مقياس F0.5 للتعديلات، رصد المقاطع بحدودها الدقيقة، أفضل عشرة إعدادات. الأعلى أفضل. يرجّح F0.5 الدقة على الاستدعاء، لأن التغييرات غير الضرورية أعلى كلفة من التعديلات الفائتة.

رصد المقاطع بحدودها الدقيقة، بمتوسط جزئي، أي بتجميع كل مقاطع التعديل قبل حساب النسبة. مخرج واحد لكل نظام، والاقتراح الأول فقط من L3، والتعليمات الحرفية نفسها المكونة من أربعة أسطر. وكل درجات المنافسين من تشغيلنا نحن لخدمة كل مزود، لا من منشورات المزودين. انظر المنهجية؛ ويعرض الجدول كل الإعدادات.

الرقم الرئيسي

F0.5 هو المقياس الرئيسي لأنه يطابق طريقة تعامل المؤسسات مع المدقق اللغوي. فهو يجمع بين الدقة والاستدعاء مع ترجيح الدقة، لأن التغيير غير الضروري لا بد من مراجعته ورفضه، وربما التراجع عنه يدويًا. سجّل L3 نسبة 80.29%؛ وجاء Claude Fable 5.1 تاليًا بنسبة 44.68%، بفارق 35.61 نقطة. ويتغير المنافس الأقوى بتغيّر المقياس: كان Claude Opus 5 التالي في F1 بنسبة 34.58% مقابل 74.66% لـ L3، وكان GPT-5.6 Sol التالي في الاستدعاء بنسبة 41.08% مقابل 66.85%. وتصدّر L3 المقاييس الأربعة كلها. مقيس.

L3 هو النظام الوحيد الذي يجمع بين دقة تتجاوز 80% واستدعاء يتجاوز 60%

الدقة في مقابل الاستدعاء لكل إعداد له صف نتائج. الأعلى أفضل على المحورين. الاستدعاء على المحور الأفقي والدقة على المحور الرأسي؛ ويشير الربع المظلل إلى دقة تتجاوز 80% مع استدعاء يتجاوز 60%.

رصد المقاطع بحدودها الدقيقة. خطوط إرشادية عند دقة 80% واستدعاء 60%. شُغّل GPT-6 Astra بإعدادي استدلال، ولا تحمل ملاحق التقرير إلا صفًا واحدًا له، فيظهر نقطة واحدة. النقاط المسماة: L3، وClaude Fable 5.1، وGPT-5.6 Sol، وClaude Opus 5.

إنذارات كاذبة قليلة

مخطط التشتت هو الرسم الذي يستحق أن يُحفظ. كان Claude Fable 5.1 أدق نموذج لغوي كبير بنسبة 64.21%، وكانت اقتراحاته صائبة في الغالب، لكنه لم يجد سوى 20.15% من التعديلات المرجعية؛ فالوثيقة المدققة به تحتفظ بمعظم أخطائها. ووجد GPT-5.6 Sol نسبة 41.08% من التعديلات، وهي الأعلى بين النماذج، بدقة 25.03%؛ فالوثيقة المدققة به تعود بتغييرات مرفوضة أكثر من المقبولة. وتتجمع معظم الإعدادات الأخرى متقاربةً في الزاوية السفلى اليسرى. أما L3 فهو النقطة الوحيدة في الربع الأعلى الأيمن. مقيس.

وبالنسبة إلى فريق الكتابة، هذا هو الفرق بين أداة يبقيها الناس مفعّلة وأداة يوقفونها. فالمراجعون يتسامحون مع خطأ فائت أكثر مما يتسامحون مع سيل من التنبيهات الخاطئة، وهذا هو التفاوت الذي يعبّر عنه F0.5 بالضبط.

بعد تنبيه صحيح، يطابق بديل L3 المرجع في 96.38% من الحالات، بفارق 1.84 نقطة عن Claude Fable 5.1

دقة التصحيح، حرفيًا وبعد التطبيع العربي، مشروطة بتنبيه صحيح. الأعلى أفضل. يبدأ المحور من 70%.

مشروطة بتنبيه صحيح، فاقرأها إلى جانب الاستدعاء: تنطبق نسب Claude Fable 5.1 على مقاطع أقل بكثير من مقاطع L3. عشرة إعدادات مرتبة بحسب النسبة بعد التطبيع. مفتاح الرسم: البديل الحرفي، وبعد التطبيع العربي.

اقتراحات يمكنك قبولها

التنبيه إلى المقطع الصحيح نصف المهمة. طابق بديل L3 مرجع الخبير اللغوي حرفًا بحرف في 89.79% من المقاطع المنبَّه إليها تنبيهًا صحيحًا، وفي 96.38% منها بعد التطبيع، الذي يزيل التشكيل والتطويل ويوحّد صور الألف والهمزة والتاء المربوطة حتى لا يُحكم على اقتراح صحيح بالخطأ بسبب حركة واحدة. وكان Claude Fable 5.1 قريبًا في هذا المقياس المشروط، بنسبتي 89.07% و94.54%، لكن على مجموعة تنبيهات أصغر بكثير. فدقة مشروطة عالية مع استدعاء منخفض تعني أداة متحفظة تفوّت الكثير؛ ولا بد من قراءة الرقمين معًا. مقيس.

يطابق L3 الجملة المرجعية كاملة في 55.96% من الجمل، ضعف نسبة Claude Fable 5.1 البالغة 27.98%

التطابق التام على مستوى الجملة، أفضل عشرة إعدادات. الأعلى أفضل. نسبة الجمل التي يطابق مخرجها الكامل المرجع الكامل حرفًا بحرف.

صارم عن قصد: تعديل فائت واحد، أو تعديل زائد واحد، أو حرف مختلف واحد يُسقط الجملة. يتعادل GPT-5.6 Terra وGemini 2.5 Flash عند 18.49% ويحتفظان بترتيب المصدر. نسب فقط.

جمل كاملة، لا مقاطع فحسب

يتسلم المحرر جملة، لا قائمة مقاطع. وفي الاختبار الصارم من طرف إلى طرف، حيث يجب أن يطابق المخرج الكامل المرجع الكامل، طابق L3 المرجع في 55.96% من الجمل، أي ضعف نسبة Claude Fable 5.1 البالغة 27.98%. والاختبار لا يتسامح بحكم تصميمه: فحركة زائدة واحدة أو نقطة ناقصة واحدة تُسقط الجملة. وهو ملخص لسلسلة المعالجة كاملة، لا معدل خطأ. كما حافظ L3 على سلامة الجملة وهو يصححها، فسجّل 98.84% على ROUGE-1 F1 في مقابل المرجع، متقدمًا على Claude Fable 5.1 بفارق 2.28 نقطة. مقيس.

كيف تبدو التصحيحات

أربعة صفوف من المعيار كما وردت حرفيًا: النص الأصلي، ومرجع الخبير اللغوي، ومخرج L3، ومخرجات عدد من إعدادات النماذج اللغوية الكبيرة. ثلاثة منها أخطاء صريحة؛ والرابع معيار تحريري، حيث الجملة الأصلية سليمة نحويًا ويطبّق المرجع الاصطلاح التحريري للمؤسسة. وقد طُلب من النماذج ألا تعيد الصياغة، فذلك الصف يُظهر ما تفعله الطبقة التحريرية في المحرك، لا إخفاقًا نحويًا، ويصرّح التعليق بذلك. وحيثما طابق نموذج المرجع، تقول البطاقة ذلك أيضًا.

مثال 1

خطأ صريح

خطآن في كرسي الهمزة ونقطة ختامية ناقصة؛ طابق L3 المرجع تمامًا، وصححت النماذج المعروضة الهمزة الثانية وتركت الأولى.

النص الأصلي

نعم يمكن لكتاب واحد يقرأه (مقطع خاطئ) الإنسان في مرحلة من عمره فيجد فيه ما يضيئ (مقطع خاطئ) له طريقه إلى النجاح (مقطع خاطئ)

المرجع

نعم يمكن لكتاب واحد يقرؤه (تصحيح) الإنسان في مرحلة من عمره فيجد فيه ما يضيء (تصحيح) له طريقه إلى النجاح. (تصحيح)

L3
مطابق

نعم يمكن لكتاب واحد يقرؤه (تصحيح) الإنسان في مرحلة من عمره فيجد فيه ما يضيء (تصحيح) له طريقه إلى النجاح. (تصحيح)

Claude Fable 5.1
جزئي

نعم يمكن لكتاب واحد يقرأه (مقطع خاطئ) الإنسان في مرحلة من عمره فيجد فيه ما يضيء (تصحيح) له طريقه إلى النجاح (مقطع خاطئ)

Claude Opus 5
جزئي

نعم يمكن لكتاب واحد يقرأه (مقطع خاطئ) الإنسان في مرحلة من عمره فيجد فيه ما يضيء (تصحيح) له طريقه إلى النجاح (مقطع خاطئ)

GPT-6 Astra
جزئي

نعم يمكن لكتاب واحد أن يقرأه (مقطع خاطئ) الإنسان في مرحلة من عمره فيجد فيه ما يضيء (تصحيح) له طريقه إلى النجاح. (تصحيح)

GPT-5.6 Sol
جزئي

نعم يمكن لكتاب واحد أن يقرأه (مقطع خاطئ) الإنسان في مرحلة من عمره فيجد فيه ما يضيء (تصحيح) له طريقه إلى النجاح (مقطع خاطئ)

Gemini 3.1 Pro
جزئي

نعم يمكن لكتاب واحد يقرأه (مقطع خاطئ) الإنسان في مرحلة من عمره فيجد فيه ما يضيء (تصحيح) له طريقه إلى النجاح (مقطع خاطئ)

DeepSeek V4 Pro
جزئي

نعم يمكن لكتاب واحد يقرأه (مقطع خاطئ) الإنسان في مرحلة من عمره فيجد فيه ما يضيء (تصحيح) له طريقه إلى النجاح (مقطع خاطئ)

لماذا المرجع صحيح

يجلس حرف الهمزة على كرسي مختلف بحسب الحركات المحيطة به: في «يقرؤه» يجب أن تُكتب على واو لأن الهمزة نفسها مضمومة، والضمة أقوى من فتحة الحرف الذي قبلها، وفي «يضيء» يجب أن تُكتب مفردة على السطر لأنها جاءت بعد حرف مدّ؛ وقد استعملت الكلمتان في النص الأصلي الكرسي الخطأ، كما أن المرجع يختم الجملة بنقطة.

  • كرسي الهمزة
  • الترقيم
مثال 2

خطأ صريح

قاعدة كلاسيكية لموضع الهمزة داخل مصطلح تقني شائع جدًا؛ ولم يصل أي إعداد من النماذج اللغوية الكبيرة إلى رسم المرجع.

النص الأصلي

ما المقصود بالتحليلات التنبؤية (مقطع خاطئ)؟

المرجع

ما المقصود بالتحليلات التنبئية (تصحيح)؟

L3
مطابق

ما المقصود بالتحليلات التنبئية (تصحيح)؟

Claude Fable 5.1
دون تغيير

ما المقصود بالتحليلات التنبؤية (مقطع خاطئ)؟

Claude Opus 5
دون تغيير

ما المقصود بالتحليلات التنبؤية (مقطع خاطئ)؟

GPT-6 Astra
دون تغيير

ما المقصود بالتحليلات التنبؤية (مقطع خاطئ)؟

GPT-5.6 Sol
دون تغيير

ما المقصود بالتحليلات التنبؤية (مقطع خاطئ)؟

Gemini 3.1 Pro
دون تغيير

ما المقصود بالتحليلات التنبؤية (مقطع خاطئ)؟

DeepSeek V4 Pro
دون تغيير

ما المقصود بالتحليلات التنبؤية (مقطع خاطئ)؟

لماذا المرجع صحيح

عندما يتحول الاسم «التنبؤ» إلى الصفة «التنبئية» تنتقل الهمزة من كرسي الواو إلى كرسي الياء؛ وقد أبقى النص الأصلي رسم الاسم داخل الصفة، وهو خطأ إملائي تركته كل النماذج اللغوية الكبيرة دون تصحيح.

  • كرسي الهمزة
مثال 3

خطأ صريح

اسم مؤنث يبدو مذكرًا؛ طابقت عدة إعدادات المرجع هنا، ومنها Claude Fable 5.1.

النص الأصلي

كيف لأحد أن يمتلك مثل هذا الكبرياء (مقطع خاطئ)؟

المرجع

كيف لأحد أن يمتلك مثل هذه الكبرياء (تصحيح)؟

L3
مطابق

كيف لأحد أن يمتلك مثل هذه الكبرياء (تصحيح)؟

Claude Fable 5.1
مطابق

كيف لأحد أن يمتلك مثل هذه الكبرياء (تصحيح)؟

Claude Opus 5
دون تغيير

كيف لأحد أن يمتلك مثل هذا الكبرياء (مقطع خاطئ)؟

GPT-6 Astra
مطابق

كيف لأحد أن يمتلك مثل هذه الكبرياء (تصحيح)؟

GPT-5.6 Sol
دون تغيير

كيف لأحد أن يمتلك مثل هذا الكبرياء (مقطع خاطئ)؟

Gemini 3.1 Pro
مطابق

كيف لأحد أن يمتلك مثل هذه الكبرياء (تصحيح)؟

DeepSeek V4 Pro
دون تغيير

كيف لأحد أن يمتلك مثل هذا الكبرياء (مقطع خاطئ)؟

لماذا المرجع صحيح

كلمة «الكبرياء» مؤنثة في العربية، فألفها الممدودة في آخرها علامة تأنيث، ولذلك يجب أن يأتي اسم الإشارة «هذه» بصيغة المؤنث.

  • المطابقة في التذكير والتأنيث
مثال 4

معيار تحريري

معيار تحريري لا خطأ: يفضّل المرجع صيغة المبني للمجهول المباشرة على «تم» مع المصدر، وأبقت النماذج التركيب كما هو التزامًا بتعليمات عدم إعادة الصياغة.

النص الأصلي

تم بناء (مقطع خاطئ) هذا النموذج عام 2024.

المرجع

بني (تصحيح) هذا النموذج عام 2024.

L3
مطابق بعد التطبيع

بُنِي (يختلف عن المرجع في التشكيل أو الرسم فقط) هذا النموذج عام 2024.

Claude Fable 5.1
دون تغيير

تم بناء (مقطع خاطئ) هذا النموذج عام 2024.

Claude Opus 5
دون تغيير

تم بناء (مقطع خاطئ) هذا النموذج عام 2024.

GPT-6 Astra
دون تغيير

تم بناء (مقطع خاطئ) هذا النموذج عام 2024.

GPT-5.6 Sol
دون تغيير

تم بناء (مقطع خاطئ) هذا النموذج عام 2024.

Gemini 3.1 Pro
دون تغيير

تم بناء (مقطع خاطئ) هذا النموذج عام 2024.

DeepSeek V4 Pro
دون تغيير

تم بناء (مقطع خاطئ) هذا النموذج في عام 2024.

لماذا المرجع صحيح

«تم بناء هذا النموذج» جملة سليمة نحويًا، لكن الأسلوب المؤسسي يفضّل صيغة المبني للمجهول المباشرة «بُني هذا النموذج»؛ ومنعت تعليمات النماذج إعادة الصياغة، فهذا اصطلاح أسلوبي يطبّقه المرجع، لا خطأ صريح.

  • معيار تحريري

يحلّ L3 ثانيًا في معدل المعالجة، بعد Qwen 3.8 27B على Groq

رموز المخرج المصحح الموحدة في الثانية. الأعلى أفضل. زمن الطلب الفعلي من طرف إلى طرف، والمجزّئ نفسه لكل الأنظمة.

معدل معالجة الخدمة شاملًا عبء الطلب ومعالجة التعليمات، لا معدل فك الترميز الخام. Qwen 3.8 27B على Groq أسرع من L3 ويحتل المرتبة الأولى في المخطط. عشرة إعدادات معروضة؛ ويسرد الجدول كلها من دون إجمالي الثواني.

السرعة

قدّم L3 52.28 رمزًا موحدًا من المخرج في الثانية بمعدل 1.041 ثانية للجملة المقيسة زمنيًا، ثانيًا بعد Qwen 3.8 27B على Groq بمعدل 66.98 رمزًا في الثانية. أما Claude Fable 5.1، أقوى النماذج في الجودة، فعمل بمعدل 15.07 رمزًا في الثانية و3.585 ثانية للجملة. والرقم معدل معالجة الخدمة، مقيسًا من طرف إلى طرف مع احتساب عبء الطلب، وهو ما يلمسه الكاتب وهو ينتظر نتيجة الشريط الجانبي. وليس هو المعدل المشبع بالدفعات المستخدم في قياس الطاقة، ولا تصح مقارنة الاثنين. مقيس.

تقدير الطاقة للمنظومة الكاملة لـ L3 أقل من القيم المرجعية المستشهد بها للنماذج اللغوية الكبيرة بنحو 29 إلى 3,357 مرة

كيلوواط ساعة لكل 1,000 رمز معالج، مقياس لوغاريتمي: كل خط شبكة عشرة أضعاف سابقه. الأقل أفضل. L3 مقيس؛ والقيم المرجعية تقديرات مستشهد بها.

رقم L3 على نطاق المسرّع قياس مباشر على NVIDIA A10؛ ورقم المنظومة الكاملة يطبّق معامل عبء بثلاثة أضعاف. والقيم المرجعية قيم منشورة أو مشتقة لمنظومة الخدمة الكاملة، وهي تقديرات مستشهد بها لا قياسات للنماذج المختبرة عبر واجهاتها البرمجية. الشريط المظلل في صف L3 هو نطاق الحساسية من ضعفين إلى أربعة أضعاف.

الطاقة، ولماذا النشر داخل المقر واقعي

قسنا L3 على NVIDIA A10 بسعة 24 غيغابايت: نسبة استغلال للمسرّع لا تقل عن 95%، وإحماء لمدة 30 ثانية، وحالة مستقرة لمدة 10 دقائق، وأخذ عينات القدرة بتردد 1 هرتز، ومتوسط قدرة لوحدة معالجة الرسوميات نحو 100 واط عند نحو 2,000 رمز في الثانية. أي 0.05 جول للرمز، أو نحو 0.000014 كيلوواط ساعة لكل 1,000 رمز على نطاق المسرّع. والضرب في معامل ثلاثة أضعاف لعبء المضيف والتبريد والشبكات والمنشأة يعطي تقديرًا للمنظومة الكاملة قدره 0.000042 كيلوواط ساعة. مقيس.

الطاقة لكل 1,000 رمز معالج، وهي القيم المرسومة أعلاه. عمود الواط ساعة هو قيمة الكيلوواط ساعة مضروبة في 1,000 لتُقرأ الأرقام دون أصفار بادئة. L3 مقيس؛ والقيم المرجعية تقديرات مستشهد بها لا قياسات للنماذج المختبرة.
النظامكيلوواط ساعة لكل 1,000 رمزواط ساعة لكل 1,000 رمزنسبةً إلى خط الأساسالدليل والنطاق
L30.0000140.014قبل معامل الثلاثة أضعافقياس مباشر على NVIDIA A10 بسعة 24 غيغابايت، نطاق المسرّع
L30.0000420.0421x، خط الأساستطبيع للمنظومة الكاملة بثلاثة أضعاف، خط الأساس للمقارنة
Gemini Apps0.00121.228.6xإفصاح Google عن منظومة الخدمة الكاملة، مستشهد به
GPT-4o-mini0.00616.1145.2xتقدير IFP School، محوّل خطيًا ومطبّع، مستشهد به
GPT-5 medium0.074741,761.9xتقدير IFP School، محوّل خطيًا ومطبّع، مستشهد به
GPT-5 high0.1411413,357.1xتقدير IFP School، محوّل خطيًا ومطبّع، مستشهد به

أما أرقام المقارنة فقيم مرجعية مستشهد بها، لأن مزودي الواجهات البرمجية لا ينشرون قياسات للطاقة: يعطي إفصاح Google عن Gemini Apps 0.0012 كيلوواط ساعة لكل 1,000 رمز، وتعطي تقديرات IFP School لكل استعلام، محوَّلة بالطريقة نفسها، 0.0061 لـ GPT-4o-mini و0.074 لـ GPT-5 medium و0.141 لـ GPT-5 high. وعلى هذا الأساس يقل تقدير المنظومة الكاملة لـ L3 بنحو 29 إلى 3,357 مرة. وتعتمد النتيجة على معامل العبء، ولذلك يعرض التقرير النطاق من ضعفين إلى أربعة أضعاف؛ وعبره يظل L3 أكفأ من أدنى القيم المرجعية بما لا يقل عن 21 مرة. والنتيجة العملية للمؤسسات أضيق مما تبدو: جرى القياس نفسه على مسرّع NVIDIA A10 بسعة 24 غيغابايت، ويتيح رايتكس النشر داخل المقر. مقيس لـ L3؛ تقديرات مستشهد بها للقيم المرجعية؛ والنشر داخل المقر إمكانية في المنتج.

حساسية تقدير المنظومة الكاملة لـ L3 لمعامل العبء. Gemini Apps أدنى القيم المرجعية المستشهد بها وGPT-5 high أعلاها؛ وأيًّا كان المعامل المختار بين الضعفين وأربعة الأضعاف، يظل L3 أقل من أدنى قيمة مرجعية بما لا يقل عن 21 مرة.
معامل العبءكيلوواط ساعة لكل 1,000 رمز لـ L3التفوق على Gemini Apps (0.0012)التفوق على GPT-5 high (0.141)
2x0.00002842.9x5,036x
3x، المعتمد في التقرير0.00004228.6x3,357x
4x0.00005621.4x2,518x
كيف قيس رقم L3 على نطاق المسرّع، وفق منهجية الطاقة في التقرير.
القياسالقيمة
المسرّع المرجعيNVIDIA A10 بسعة 24 غيغابايت
نسبة الاستغلال في الحالة المستقرةلا تقل عن 95%
الإحماء ونافذة القياسإحماء لمدة 30 ثانية، ثم حالة مستقرة لمدة 10 دقائق
أخذ عينات القدرةبتردد 1 هرتز خلال نافذة الحالة المستقرة
متوسط قدرة وحدة معالجة الرسومياتنحو 100 واط
معدل المعالجة المستدامنحو 2,000 رمز في الثانية، بدفعات مشبعة
الطاقة لكل رمز0.05 جول
الطاقة لكل 1,000 رمز50 جول = 0.01389 واط ساعة = 0.0000139 كيلوواط ساعة، ويرد في التقرير بصيغة 0.000014
معامل المنظومة الكاملة3x، وهو تقريب لحاصل 1.5 (فعالية استخدام الطاقة) × 1.3 (التكرار والموثوقية) × 1.5 (ما تبقى من أعباء الخدمة والشبكة الكهربائية)
المستثنى من نطاق المسرّعطاقة المضيف والتبريد والشبكات والتخزين وعبء المنشأة

المنهجية

  1. المعيار

    مجموعة من جمل عربية حقيقية راجعها خبير لغوي. كتب الخبير مرجعًا مصححًا لكل جملة، أو أبقاها كما هي حين لم يلزم إصلاح، فتُقاس الأنظمة أيضًا على تركها النص الصحيح دون مساس.

  2. التعليمات

    تلقّى كل نموذج التعليمات العربية ذاتها المكونة من أربعة أسطر، حرفيًا:

    صحح الأخطاء في كل جملة من الجمل التالية إن وجدت.

    لا تعد صياغة الجملة أو تحذف من كلماتها فقط صحح الأخطاء الإملائية أو القواعدية بها.

    لا تضف التشكيل إلى الكلمات.

    إذا لم تجد خطأ، أعد الجملة نفسها تماماً.

    ومنعت إعادة الصياغة وحذف الكلمات وإضافة التشكيل، واشترطت إعادة الجملة الأصلية كما هي عند عدم وجود خطأ.

  3. المخرج الواحد

    مخرج واحد مقيّم لكل جملة ولكل نظام؛ وإعادة المحاولة للحصول على استجابة صالحة فقط، لا لاختيار الأفضل من عدة مخرجات. وقُيّم L3 على اقتراحه الأول فقط.

  4. التقييم

    مقاطع بحدودها الدقيقة في النص الأصلي، تُطابَق بتطابق الحدود؛ الدقة والاستدعاء وF1 وF0.5 بمتوسط جزئي عبر المقاطع. وتُقاس دقة التصحيح فقط على المقاطع المنبَّه إليها تنبيهًا صحيحًا، حرفيًا وبعد التطبيع العربي. والتطابق التام للجملة لكل جملة. وROUGE بمتوسط كلي لكل جملة بعد إزالة التشكيل والتطويل.

  5. معدل المعالجة والطاقة

    معدل المعالجة: الرموز الموحدة لكل مخرج مصحح صالح على زمن الطلب الفعلي من طرف إلى طرف، مع احتساب عبء الطلب. الطاقة: قياس مباشر على A10، ومعامل منظومة كاملة بثلاثة أضعاف، وقيم مرجعية مستشهد بها، وحساسية من ضعفين إلى أربعة أضعاف. والتعريفات الكاملة في التقرير.

  6. درجات المنافسين

    أُنتج كل رقم للنماذج اللغوية الكبيرة من تشغيل فريق البحث في لسان لخدمة المزود، مع الاستضافة كما وردت في قائمة التقرير. ولم يؤخذ أي رقم من نتائج منشورة لدى المزود.

الأدلة

الادعاءالنطاقالحالة
80.29% على F0.5 للتعديلات، الأول بين كل الإعداداترصد المقاطع بحدودها الدقيقة، مخرج واحدمقيس
دقة 84.54% مع استدعاء 66.85%؛ النظام الوحيد فوق 80% و60% معًاالبروتوكول نفسهمقيس
دقة تصحيح 89.79% حرفيًا و96.38% بعد التطبيعمشروطة بتنبيه صحيحمقيس
تطابق تام للجملة 55.96%؛ و98.84% على ROUGE-1 F1صارم لكل جملة؛ متوسط كليمقيس
52.28 رمزًا في الثانية، الثاني بعد Qwen 3.8 27B على Groqمعدل الخدمة مع العبءمقيس
0.000014 كيلوواط ساعة لكل 1,000 رمز على نطاق المسرّع؛ 0.000042 للمنظومة الكاملة؛ أقل من القيم المرجعية المستشهد بها بنحو 29 إلى 3,357 مرةقياس على A10؛ القيم المرجعية تقديرات مستشهد بهامقيس لـ L3، تقديرات مستشهد بها للقيم المرجعية
تصحيحات مشروحة، ونشر داخل المقر وعلى السحابة السياديةرايتكسإمكانية في المنتج

الحدود

  • منعت التعليمات إعادة الصياغة، فالصفوف التي يطبّق فيها المرجع اصطلاحًا تحريريًا تميل لصالح المعيار الذي التزمه الخبير اللغوي؛ وهي تُظهر تطبيق المحرك لذلك المعيار، لا إخفاق النماذج في النحو.
  • القيم المرجعية للطاقة تقديرات مستشهد بها، لا قياسات للنماذج المختبرة عبر واجهاتها البرمجية؛ ومعامل الثلاثة أضعاف اختيار التقرير، وقد رُبطت النماذج التي لا رقم منشورًا لها بقيمة مرجعية بحسب فئة القدرة على سبيل التقدير الافتراضي.
  • يشمل معدل المعالجة عبء الطلب ويعكس منظومة الخدمة لدى كل مزود يوم التشغيل.
  • لقطة معيار واحدة بتاريخ 9 سبتمبر 2026، الإصدار 1.0؛ لم يُتحقق منها بصورة مستقلة؛ صممها فريق البحث في لسان ونفّذها. والتعريفات والتعليمات الحرفية وكل النسب منشورة كاملة ليتسنى تكرار البروتوكول على مادة أخرى؛ أما جمل المعيار نفسها فمتاحة للباحثين عند الطلب.
  • فاتت L3 تعديلات مرجعية، واقترح تغييرات لم يُجرِها الخبير اللغوي؛ وتصف دقة 84.54% واستدعاء 66.85% الجانبين.

داخل رايتكس

المحرك في هذا التقييم هو نفسه الذي يقوم عليه التدقيق العربي في رايتكس في المحرر وإضافات أوفيس وامتدادات المتصفح. إمكانية في المنتج. ولترى كيف يظهر في المنتج: تعرض صفحة المنتج فئات الأخطاء والقاعدة وراء كل بطاقة، ويشرح قسم التقنية (بالإنجليزية) المكوّنات المتخصصة التي تجعل المحرك قابلًا للشرح وسريعًا، وتغطي صفحة النشر (بالإنجليزية) خيارات السحابة والسحابة السيادية والنشر داخل المقر، وتضع مقارنة رايتكس في مواجهة روبوتات المحادثة (بالإنجليزية) هذه الأرقام إلى جانب فروق سير العمل. ويحمل التقرير الكامل على موقع لسان كل الجداول وصيغة الاستشهاد وسجل الإصدارات.

دقّق نصوصك بنفسك

المعيار معيارنا؛ أما وثائقك فهي الاختبار الذي يهم. المحرر مجاني في البداية، ويمكن للمؤسسات تشغيل L3 على بنيتها التحتية ضمن مشروع تجريبي، وتُرسل أسئلة المنهجية إلى support@lisan.com.

أسئلة شائعة

لماذا F0.5 هو الرقم الرئيسي؟

لأن التغيير غير الضروري في الكتابة المؤسسية يكلّف أكثر من التعديل الفائت: فلا بد من مراجعته ورفضه، وربما التراجع عنه. ويرجّح F0.5 الدقة على الاستدعاء تعبيرًا عن ذلك. وننشر الدقة والاستدعاء وF1 أيضًا، ويتصدر L3 المقاييس الأربعة كلها، فاختيار الرقم الرئيسي لا يغيّر صاحب المرتبة الأولى.

هل تُحقق من هذا بصورة مستقلة؟

لا. فقد صمم فريق البحث في لسان التقييم ونفّذه. والمنهجية منشورة كاملة: التعليمات الحرفية، وقاعدة المخرج الواحد، وتعريفات المقاطع بحدودها الدقيقة، وخطوات التطبيع، وكل نسبة في الملاحق. ويمكن لأي جهة تملك مجموعة عربية راجعها خبير لغوي أن تكرره، والمحرر مجاني لهذا الغرض.

لماذا تسجّل النماذج اللغوية الكبيرة استدعاءً منخفضًا؟

التقييم صارم: لا يحصل النموذج على نقطة إلا إذا غيّر المقطع الذي غيّره الخبير اللغوي بالضبط، وقد يُعدّ تغيير علامة الترقيم مقطعًا مستقلًا. ومنعت التعليمات إعادة الصياغة والتشكيل، فتُركت صفوف المعيار التحريري والقواعد الكلاسيكية، مثل مواضع الهمزة في المصطلحات التقنية الشائعة، في الغالب دون مساس. وتختلف النماذج: غيّر Claude Fable 5.1 قليلًا وأصاب غالبًا باستدعاء 20.15%؛ وغيّر GPT-5.6 Sol كثيرًا وأخطأ غالبًا باستدعاء 41.08%.

هل تعني نسبة 96.38% أن دقة رايتكس هي 96%؟

لا. فتلك النسبة تنطبق على المقاطع التي نبّه إليها L3 تنبيهًا صحيحًا: حمل 96.38% منها البديل الصحيح بعد التطبيع العربي. وكان استدعاؤه 66.85% وتطابقه الصارم على مستوى الجملة كاملة 55.96%. فاقرأ الأرقام الثلاثة معًا.

هل المحرك في التقييم هو نفسه الموجود في المنتج؟

نعم. L3 هو محرك لسان اللغوي الذي يقوم عليه التدقيق العربي في رايتكس: في المحرر وإضافات أوفيس وامتدادات المتصفح وواجهة API. وقيّم التقييم اقتراحه الأول فقط، مطابقةً لقاعدة المخرج الواحد المطبقة على النماذج. إمكانية في المنتج.