الرئيسية/التقييم
اعرف أداء نموذجك في سوق منطقتنا الفعلي
معايرة وتقييم عبر لغات المنطقة ولهجاتها واستخداماتها — يراجعها بشر، لا مقياس آلي واحد.
ما الذي نقيّمه
دقة وطلاقة وملاءمة المستوى اللغوي لمخرجات النموذج بالعربية، تُراجَع وفق معيار من قِبل مراجعين أصليين لا بمقياس آلي وحده.
مدى قدرة النموذج على إنتاج وفهم لهجات محددة، لا الفصحى فقط — فالفجوة بينهما غالبًا ما تكون سبب فشل المنتجات في السوق.
معايير معدل خطأ الكلمات ووضوح الكلام، تُقاس على عينات كلام لهجية حقيقية، لا كلام مقروء بجودة استوديو.
هل مخرجات النموذج مناسبة سياقيًا للمنطقة التي يُقيَّم فيها — دون أن تُصنَّف كغير آمنة بواسطة مرشح عالمي فضفاض، ودون إغفال سياق إقليمي يفوت معيارًا عامًا.
مراجعة أمان وضرر خاصة بالمنطقة، ينفذها مراجعون بلغتهم الأم مدرَّبون على معيار أمان.
أداء النموذج على مدخلات ومخرجات مزدوجة اللغة، وهي الطريقة التي يتواصل بها جزء كبير من مستخدمي المنطقة فعليًا.
الدقة في المحتوى المتخصص (طبي، قانوني، مالي بالعربية) حيث لا تصل المعايير العامة.
دقة التعرف مقابل صور أصيلة إقليميًا — لافتات، تغليف، بيئات — بدل معايير رؤية عامة.
مقارنة مباشرة بين إصدارات نموذج أو منافسين، يقيّمها مراجعون بشريون لا مقياس آلي بديل.
مثال توضيحي
يوضح الجدول أدناه شكل تقرير المعايرة — الأبعاد التي نقيسها وطريقة عرض النتائج — باستخدام أرقام افتراضية. هذه ليست نتيجة حقيقية من أي نموذج قيّمناه؛ لا تتوفر لدينا بعد مجموعة معايرة منشورة فعليًا.
مجموعة المعايرة قيد التطوير — الدفعة الأولى للتقييم مستهدفة في الربع التالي لأولى مشاريع مشترينا التجريبية. أخبرنا بالنموذج والسوق المستهدفين عبر نموذج المشروع وسنحدد تقييمًا مخصصًا الآن، قبل إطلاق المجموعة العامة.
| العربية السعودية | ٨٧٪ |
| العربية المصرية | ٩١٪ |
| العربية الأردنية | ٨٤٪ |
| تبديل الشيفرة اللغوية | ٧٣٪ |
| الاتساق الثقافي | ٨٨٪ |