تقييم الأداء
لا مفاهيم مجردة، أرقام مقاسة فعليًا فقط · جميع البيانات من تقارير اختبارات المشاريع، ونرحب بالتحقق
أربع مجموعات من البيانات الأساسية المقاسة فعليًا
من اختبارات P2/P3 من البداية إلى النهاية، والقياس الفعلي لخط DeepDoc، وتقارير اختبار خط الإنتاج
معالجة كاملة من البداية إلى النهاية
(الطبقة البنيوية بكامل الدرجة)
تعاون نموذجين في تحليل التنسيق
(بحساب GPT-4o)
جودة التحليل: كيف تُقرأ الدرجات ثلاثية الطبقات
بعد معالجة كل مستند، يحصل على «ورقة فحص»
تفاصيل القياس الفعلي لمستند OFD من 443 صفحة
الطبقة البنيوية (هل كتل التنسيق وتسلسل العناوين وترتيب القراءة صحيحة) —من الدرجة الكاملة؛ وبعد الجمع بين الطبقة العلاقية (علاقات صفوف وأعمدة الجداول، واتصال السياق) والطبقة المحتواية (النص، دقة OCR)، بلغت الدرجة الإجمالية 0.924. تقارب أخطاء كشف بنية الجداول تم عبر تعاون نموذجين 64%。
نظام التقييم ثلاثي الطبقات
إطلاق قاعدة المعرفة مجرد بداية، والفحص المستمر هو ما يبقيها موثوقة دائمًا
طبقة المدونة: هل المواد الخام جيدة؟
قياس جودة المعالجة المسبقة نفسها، مع تقييم تلقائي عند إدخال كل دفعة من المستندات.
- اكتمال التحليل
- معدل الحفاظ على بنية الجداول
- دقة OCR
- تغطية الإخفاء
- معدل إصابة الصلاحيات
طبقة البحث: هل الاسترجاع دقيق؟
قياس فاعلية البحث بمجموعة أسئلة معيارية، وتحديد مشكلات الاسترجاع.
- HitRate@K / Recall@K
- MRR (متوسط الترتيب المعكوس)
- NDCG@K (جودة الترتيب)
طبقة التوليد: هل الإجابات صحيحة؟
قياس وفاء إجابات الذكاء الاصطناعي وملاءمتها، بما يقابل مباشرة تجربة العمل.
- Faithfulness (الوفاء بالنص الأصلي)
- AnswerRelevancy (معدل الإجابات بعيدة عن السؤال)
- ContextPrecision (دقة السياق)
كيف تُغلق حلقة التقييم: اضغط «سلبًا» مرة، ويجد النظام السبب بنفسه
بعد تقييم المستخدم السلبي لإجابة ما، يتتبع النظام تلقائيًا نقاط المعرفة التي استندت إليها تلك الإجابة، ويُسنِد الخطأ إلى المرحلة المحددة — هل التقسيم قطع المعنى، أم التنظيف حذف محتوى بالخطأ، أم الإخفاء تجاوز الحد، أم البيانات الوصفية ناقصة؟ وتعود نتيجة التحديد تلقائيًا إلى مجموعة التقييم، وتُجرى مصادقة انحدار تلقائية عند تغيير الاستراتيجية التالي، ولا يُسمح بالمرور إذا لم تبلغ المؤشرات المستهدف (بوابة الانحدار).
أداء الضغط: بيانات حرفتنا الأولى
محرك الضغط هو الأساس الذي يقوم عليه الأساس، وهو أيضًا بند تكلفة مباشر
نتائج الضغط النموذجية
| المؤشر | القيمة المقاسة فعليًا | الدلالة بالنسبة للعملاء |
|---|---|---|
| متوسط نسبة الضغط | 60% (بحد أقصى 80%) | خفض مباشر لأكثر من نصف تكاليف التخزين |
| سرعة المعالجة | بنية في الذاكرة، بتحسين 3-5 مرات | معالجة كاملة في الذاكرة، دون إدخال وإخراج قرصي لمجلدات مؤقتة |
| بوابة جودة الصور | SSIM ≥ 0.92 / PSNR ≥ 30dB | الضغط الأصغر لا يعني الضغط المشوش، والبحث التلقائي عن أفضل المعلمات |
| إزالة تكرار الخطوط | توفير 30-50% من مساحة الخطوط | دمج تلقائي للخطوط المكررة في مستندات Office |
| توفير توكن الوسائط المتعددة | 85.9% (بحساب GPT-4o) | تغذية النموذج الكبير بصور مضغوطة تعني انخفاضًا كبيرًا في فاتورة الاستدلال |
ما الأرقام التي ستخرج بها مستنداتك؟
احجز قياسًا فعليًا بمستندات حقيقية، ونحن نُصدر التقرير