UGLYPEAR AI تُكمل ترقية أعمالها: ضغط المستندات عالي الأداء × أساس هندسة بيانات RAGتعرّف على الأعمال الجديدة →

تقييم الأداء

لا مفاهيم مجردة، أرقام مقاسة فعليًا فقط · جميع البيانات من تقارير اختبارات المشاريع، ونرحب بالتحقق

أربع مجموعات من البيانات الأساسية المقاسة فعليًا

من اختبارات P2/P3 من البداية إلى النهاية، والقياس الفعلي لخط DeepDoc، وتقارير اختبار خط الإنتاج

124 ثانية
مستند OFD ثابت التنسيق من 443 صفحة
معالجة كاملة من البداية إلى النهاية
تقرير اختبار خط الإنتاج
0.924
الدرجة الإجمالية لفحص جودة التحليل ثلاثي الطبقات
(الطبقة البنيوية بكامل الدرجة)
تقرير اختبار P2/P3 e2e
64%
تقارب أخطاء كشف بنية الجداول
تعاون نموذجين في تحليل التنسيق
قياس فعلي لخط DeepDoc على 73 صفحة
85.9%
توفير تكلفة توكن الصور
(بحساب GPT-4o)
قياس فعلي لتكلفة الاستدلال متعدد الوسائط
ملاحظة:شمل الاختبار مستندات ثابتة التنسيق حقيقية (مستند OFD طويل يحتوي جداول وصورًا مضمنة)، والمعالجة من البداية إلى النهاية تعني سلسلة المعالجة الكاملة «رفع→تحليل→تنظيف→إخفاء→ضغط→تقسيم→بيانات وصفية→فحص جودة». وتختلف البيانات باختلاف تعقيد المستندات، ونرحب بقياسها فعليًا بمستنداتكم للتحقق.

جودة التحليل: كيف تُقرأ الدرجات ثلاثية الطبقات

بعد معالجة كل مستند، يحصل على «ورقة فحص»

تفاصيل القياس الفعلي لمستند OFD من 443 صفحة

الطبقة البنيوية (هل كتل التنسيق وتسلسل العناوين وترتيب القراءة صحيحة) —من الدرجة الكاملة؛ وبعد الجمع بين الطبقة العلاقية (علاقات صفوف وأعمدة الجداول، واتصال السياق) والطبقة المحتواية (النص، دقة OCR)، بلغت الدرجة الإجمالية 0.924. تقارب أخطاء كشف بنية الجداول تم عبر تعاون نموذجين 64%

درجة الطبقة البنيوية1.00
100%
الدرجة الإجمالية المركبة (ترجيح الطبقات الثلاث)0.924
92.4%

نظام التقييم ثلاثي الطبقات

إطلاق قاعدة المعرفة مجرد بداية، والفحص المستمر هو ما يبقيها موثوقة دائمًا

طبقة المدونة: هل المواد الخام جيدة؟

بوابة الرقابة قبل إدخال المستندات

قياس جودة المعالجة المسبقة نفسها، مع تقييم تلقائي عند إدخال كل دفعة من المستندات.

  • اكتمال التحليل
  • معدل الحفاظ على بنية الجداول
  • دقة OCR
  • تغطية الإخفاء
  • معدل إصابة الصلاحيات

طبقة البحث: هل الاسترجاع دقيق؟

هل يمكن العثور على المعرفة

قياس فاعلية البحث بمجموعة أسئلة معيارية، وتحديد مشكلات الاسترجاع.

  • HitRate@K / Recall@K
  • MRR (متوسط الترتيب المعكوس)
  • NDCG@K (جودة الترتيب)

طبقة التوليد: هل الإجابات صحيحة؟

الإجابات التي يراها المستخدم النهائي

قياس وفاء إجابات الذكاء الاصطناعي وملاءمتها، بما يقابل مباشرة تجربة العمل.

  • Faithfulness (الوفاء بالنص الأصلي)
  • AnswerRelevancy (معدل الإجابات بعيدة عن السؤال)
  • ContextPrecision (دقة السياق)

كيف تُغلق حلقة التقييم: اضغط «سلبًا» مرة، ويجد النظام السبب بنفسه

بعد تقييم المستخدم السلبي لإجابة ما، يتتبع النظام تلقائيًا نقاط المعرفة التي استندت إليها تلك الإجابة، ويُسنِد الخطأ إلى المرحلة المحددة — هل التقسيم قطع المعنى، أم التنظيف حذف محتوى بالخطأ، أم الإخفاء تجاوز الحد، أم البيانات الوصفية ناقصة؟ وتعود نتيجة التحديد تلقائيًا إلى مجموعة التقييم، وتُجرى مصادقة انحدار تلقائية عند تغيير الاستراتيجية التالي، ولا يُسمح بالمرور إذا لم تبلغ المؤشرات المستهدف (بوابة الانحدار).

أداء الضغط: بيانات حرفتنا الأولى

محرك الضغط هو الأساس الذي يقوم عليه الأساس، وهو أيضًا بند تكلفة مباشر

نتائج الضغط النموذجية

المؤشر القيمة المقاسة فعليًا الدلالة بالنسبة للعملاء
متوسط نسبة الضغط60% (بحد أقصى 80%)خفض مباشر لأكثر من نصف تكاليف التخزين
سرعة المعالجةبنية في الذاكرة، بتحسين 3-5 مراتمعالجة كاملة في الذاكرة، دون إدخال وإخراج قرصي لمجلدات مؤقتة
بوابة جودة الصورSSIM ≥ 0.92 / PSNR ≥ 30dBالضغط الأصغر لا يعني الضغط المشوش، والبحث التلقائي عن أفضل المعلمات
إزالة تكرار الخطوطتوفير 30-50% من مساحة الخطوطدمج تلقائي للخطوط المكررة في مستندات Office
توفير توكن الوسائط المتعددة85.9% (بحساب GPT-4o)تغذية النموذج الكبير بصور مضغوطة تعني انخفاضًا كبيرًا في فاتورة الاستدلال

اطّلع على التفاصيل التقنية لمحرك الضغط →

ما الأرقام التي ستخرج بها مستنداتك؟

احجز قياسًا فعليًا بمستندات حقيقية، ونحن نُصدر التقرير

اطلب قياسًا فعليًا