ما الذي يعنيه هذا لكتابة مؤسستك
يُحكم على المدقق اللغوي في وزارة أو غرفة أخبار أو مصرف بأربعة أمور. هل ينبّه إلى ما هو خاطئ فعلًا؟ وهل يترك النص الصحيح دون مساس؟ وهل الإصلاح المقترح صائب؟ وهل يستطيع المسؤولون عن النص أن يروا السبب؟ يقيس تقييم L3 الأمور الثلاثة الأولى، ويجيب المنتج عن الرابع.
تنبيهات دقيقة. من بين التغييرات التي اقترحها L3، وقع 84.54% منها على مقطع غيّره الخبير اللغوي أيضًا. وهذا هو الرقم الذي يلمسه المراجع: قائمة اقتراحات معظمها يستحق القبول. مقيس.
إنذارات كاذبة قليلة، وفوات قليل. كان L3 النظام الوحيد بين الأنظمة المقارَنة الذي جمع بين دقة تتجاوز 80% واستدعاء يتجاوز 60%. أما النماذج اللغوية الكبيرة فكانت إما حذرة وناقصة، وإما شاملة ومشوشة؛ ولم يحقق أي منها الأمرين على هذا المعيار. مقيس.
اقتراحات يمكنك قبولها. متى نُبّه إلى مقطع تنبيهًا صحيحًا، طابق بديل L3 المرجع حرفيًا في 89.79% من الحالات، وفي 96.38% منها بعد التطبيع العربي. وهذه النسب مشروطة بصحة التنبيه، ونصرّح بذلك حيثما وردت. مقيس.
الشرح والتحكم في البيانات. يحمل كل تصحيح في رايتكس القاعدة التي وراءه، ويُنشر المحرك داخل مقر المؤسسة، فلا يلزم أن يغادر أي نص نطاقها ليُدقَّق. ولا يقيس التقييم هذين الأمرين؛ فهما ما يفعله المنتج. إمكانية في المنتج.
الطاقة. عند القياس على مسرّع NVIDIA A10 بسعة 24 غيغابايت، استهلك L3 نحو 0.000014 كيلوواط ساعة لكل 1,000 رمز على نطاق المسرّع. مقيس. ولا يقول القياس نفسه شيئًا عن متطلبات العتاد؛ أما النشر داخل المقر فإمكانية في المنتج مبيّنة أعلاه. إمكانية في المنتج.
الرقم الرئيسي
F0.5 هو المقياس الرئيسي لأنه يطابق طريقة تعامل المؤسسات مع المدقق اللغوي. فهو يجمع بين الدقة والاستدعاء مع ترجيح الدقة، لأن التغيير غير الضروري لا بد من مراجعته ورفضه، وربما التراجع عنه يدويًا. سجّل L3 نسبة 80.29%؛ وجاء Claude Fable 5.1 تاليًا بنسبة 44.68%، بفارق 35.61 نقطة. ويتغير المنافس الأقوى بتغيّر المقياس: كان Claude Opus 5 التالي في F1 بنسبة 34.58% مقابل 74.66% لـ L3، وكان GPT-5.6 Sol التالي في الاستدعاء بنسبة 41.08% مقابل 66.85%. وتصدّر L3 المقاييس الأربعة كلها. مقيس.
إنذارات كاذبة قليلة
مخطط التشتت هو الرسم الذي يستحق أن يُحفظ. كان Claude Fable 5.1 أدق نموذج لغوي كبير بنسبة 64.21%، وكانت اقتراحاته صائبة في الغالب، لكنه لم يجد سوى 20.15% من التعديلات المرجعية؛ فالوثيقة المدققة به تحتفظ بمعظم أخطائها. ووجد GPT-5.6 Sol نسبة 41.08% من التعديلات، وهي الأعلى بين النماذج، بدقة 25.03%؛ فالوثيقة المدققة به تعود بتغييرات مرفوضة أكثر من المقبولة. وتتجمع معظم الإعدادات الأخرى متقاربةً في الزاوية السفلى اليسرى. أما L3 فهو النقطة الوحيدة في الربع الأعلى الأيمن. مقيس.
وبالنسبة إلى فريق الكتابة، هذا هو الفرق بين أداة يبقيها الناس مفعّلة وأداة يوقفونها. فالمراجعون يتسامحون مع خطأ فائت أكثر مما يتسامحون مع سيل من التنبيهات الخاطئة، وهذا هو التفاوت الذي يعبّر عنه F0.5 بالضبط.
اقتراحات يمكنك قبولها
التنبيه إلى المقطع الصحيح نصف المهمة. طابق بديل L3 مرجع الخبير اللغوي حرفًا بحرف في 89.79% من المقاطع المنبَّه إليها تنبيهًا صحيحًا، وفي 96.38% منها بعد التطبيع، الذي يزيل التشكيل والتطويل ويوحّد صور الألف والهمزة والتاء المربوطة حتى لا يُحكم على اقتراح صحيح بالخطأ بسبب حركة واحدة. وكان Claude Fable 5.1 قريبًا في هذا المقياس المشروط، بنسبتي 89.07% و94.54%، لكن على مجموعة تنبيهات أصغر بكثير. فدقة مشروطة عالية مع استدعاء منخفض تعني أداة متحفظة تفوّت الكثير؛ ولا بد من قراءة الرقمين معًا. مقيس.
جمل كاملة، لا مقاطع فحسب
يتسلم المحرر جملة، لا قائمة مقاطع. وفي الاختبار الصارم من طرف إلى طرف، حيث يجب أن يطابق المخرج الكامل المرجع الكامل، طابق L3 المرجع في 55.96% من الجمل، أي ضعف نسبة Claude Fable 5.1 البالغة 27.98%. والاختبار لا يتسامح بحكم تصميمه: فحركة زائدة واحدة أو نقطة ناقصة واحدة تُسقط الجملة. وهو ملخص لسلسلة المعالجة كاملة، لا معدل خطأ. كما حافظ L3 على سلامة الجملة وهو يصححها، فسجّل 98.84% على ROUGE-1 F1 في مقابل المرجع، متقدمًا على Claude Fable 5.1 بفارق 2.28 نقطة. مقيس.