UGLYPEAR AI تُكمل ترقية أعمالها: ضغط المستندات عالي الأداء × أساس هندسة بيانات RAGتعرّف على الأعمال الجديدة →

القدرات الأساسية

ثماني قدرات مترابطة، تغطي كل متر من طريق المستند إلى المعرفة

أولًا: التحليل عالي الدقة

مدخل موحد لست صيغ، يقرأ المستندات الممسوحة أيضًا، والجداول لا تتفكك

تنوع صيغ المستندات المؤسسية هو العقبة الأولى في بناء قاعدة المعرفة. يتضمن الأساس تحليل التنسيق DeepDoc (نموذجا ONNX مزدوجان لتعرف التنسيق وبنية الجداول، مع استدلال محلي)، ليحلل الصيغ الست PDF وWord وExcel وPPT وOFD وXPS في بيانات مهيكلة موحدة، مع الحفاظ على تسلسل العناوين والفقرات وعلاقات صفوف وأعمدة الجداول (بما في ذلك الخلايا المدموجة) وترتيب القراءة؛ ويُعرَّف المستند الممسوح ضوئيًا تلقائيًا عبر OCR.

6 صيغتحليل موحد للصيغ
نموذجانتعرف على التنسيق وبنية الجداول
OCR تلقائيتعرف تلقائي على المستندات الممسوحة
0.924الدرجة الإجمالية المقاسة لفحص جودة التحليل ثلاثي الطبقات
// مثال لمخرجات التحليل (مقتطف) { "title": "الأدلة التقنية للمنتج V3.2", "elements": [ { "type": "heading", "level": 1, "text": "الفصل الأول: نظرة عامة على المنتج" }, { "type": "table", "headers": ["الطراز","القدرة","الجهد الكهربي"], "rows": [["A100","500W","220V"]] }, { "type": "image", "description": "خريطة مظهر المنتج" } ] }

ثانيًا: تنظيف المستندات

إحباط «الضوضاء» كالترويسات والعلامات المائية عند باب قاعدة المعرفة

الترويسات والتذييلات وأرقام الصفحات والعلامات المائية والمحتوى المكرر — كلها ضجيج خلفي للإنسان، لكنها مصدر تلوث للذكاء الاصطناعي: صفحة أرقام تظهر فجأة في الإجابة، وبحث تشوشه المستندات المكررة. يوسم الأساس هذه الضوضاء وينظفها تلقائيًا بعد التحليل، مع إعادة تقرير التنظيف: ما عولج وما حذف، كل ذلك موثق ومتاح للفحص.

الترويسات/التذييلات/أرقام الصفحاتوسم وإزالة تلقائيين
كشف العلامات المائيةإعادة استخدام كاشفات الذكاء الاصطناعي
المستندات المكررةإزالة التكرار بتجزئة المحتوى
تقرير التنظيفسجل لكل خطوة معالجة

ثالثًا: الإخفاء الذكي بالذكاء الاصطناعي

13 فئة من المعلومات الحساسة، تُطمس تلقائيًا قبل الإدخال

الوجوه وبطاقات الهوية والأختام الرسمية ولوحات المركبات ورموز الاستجابة السريعة داخل الصور المضمنة في المستندات — إدخالها مباشرة إلى قاعدة المعرفة مخطر تسريب جسيم. يعيد الأساس استخدام كاشفات حماية الخصائص بالذكاء الاصطناعي من محرك الضغط، لمعالجة المناطق الحساسة تلقائيًا قبل الإدخال بتمويش غاوسي أو موزاييك، مع إخراج تقرير إخفاء — ما اكتُشف في كل صورة وأين عولج، واضح تمامًا عند التدقيق.

13 فئةكاشف المعلومات الحساسة
الوجوه/وثائق الهويةطمس وتشويش تلقائي
الأختام/التواقيعتعرف على المناطق ومعالجتها
تقرير الإخفاءسجل كامل للمواقع وطرق المعالجة

اطّلع على منظومة أمن البيانات الكاملة →

رابعًا: الضغط عالي الأداء

معالجة واحدة بمخرَجين: ملفات أصغر + معرفة أنظف

الضغط هو حرفة UGLYPEAR الأولى. تغطية كاملة لأكثر من 40 صيغة: الصور، والصوت والفيديو، وPDF وOffice وOFD وXPS والنصوص، بمتوسط نسبة ضغط 60% وحد أقصى 80%. وتضمن بوابة الجودة بمؤشرين SSIM/PSNR أن «الضغط الأصغر» لا يعني «الضغط المشوش». وللتطبيقات الذكية، يعني ضغط الصور مباشرة انخفاض تكلفة توكن الاستدلال متعدد الوسائط — قياس فعلي بحساب GPT-4o يوفر 85.9%.

60-80%متوسط نسبة الضغط
40+صيغ الملفات
SSIM≥0.92بوابة الجودة
85.9%توفير توكن الصور

تعرّف على عائلة منتجات ضغط SmartSlim →

خامسًا: التقسيم الذكي

لكل مستند طريقة تقسيم — دون كسر المعنى، يصبح البحث دقيقًا

التقسيم بطول ثابت هو أشهر فخ في هذا المجال: تُقطع الجملة من منتصفها، فما يسترجعه الذكاء الاصطناعي معلومة ناقصة ولا يفعل سوى التخمين. يختار الأساس استراتيجية التقسيم حسب نوع المستند، ويحتوي أربع مجموعات معلمات مسبقة يمكن ضبطها حسب العمل:

نوع المستند استراتيجية التقسيم معالجة خاصة
اللوائح/العقودتقسيم حسب البنودلا يمكن فصل الشروط عن الاستنتاجات
الأدلة التقنيةحسب الفصل + القسم الفرعيالطراز/المواصفات/نطاق الاستخدام في كتلة واحدة
FAQسؤال وجوابربط السؤال بالإجابة
بيانات جداولتقسيم حسب مجموعات الصفوفتكرار رأس الجدول، مع الحفاظ على علاقات الصفوف والأعمدة
PPTحسب الصفحةالعنوان + النص + الملاحظات معًا
تقارير طويلةطبقتان: أب وابنالبحث في الكتلة الفرعية، والتوليد من الكتلة الأم

سادسًا: البيانات الوصفية ودورة الحياة

كل نقطة معرفة تحمل «بطاقة هوية»، والمعرفة المنتهية تخرج تلقائيًا

بعد اكتمال التقسيم، تُربط كل نقطة معرفة تلقائيًا بالبيانات الوصفية: عنوان المستند، مسار الفصل، وقت النشر، رقم الإصدار، القسم المصدر وغيرها، مع تعزيز محتوى بأربعة مستويات (مسار التنقل، الكلمات المفتاحية، الملخص، الأسئلة الفرضية). وعند تحديث المستند تتم معالجة تدريجية: الإصدار الجديد يدخل تلقائيًا، والإصدار القديم يُخفض ترتيبه ووسم بأنه منتهٍ، ويضمن تجزئة المحتوى عدم تكرار إدخال المستند نفسه.

تعزيز بأربعة مستوياتمسار التنقل/الكلمات المفتاحية/الملخص/HyDE
إدارة الإصداراتأرشفة متعددة الإصدارات مع إمكانية التراجع
تحديث تدريجيإعادة تقسيم تلقائية للأجزاء المتغيرة
إدارة الحداثةخفض تلقائي لترتيب المعرفة المنتهية الصلاحية

سابعًا: وسم الصلاحيات

من يطّلع على أي معرفة، نضبطها حتى مستوى نقطة المعرفة

لا يمكن البحث عن لوائح الرواتب إلا من الموارد البشرية والإدارة العليا، والمستندات التقنية معزولة حسب الأقسام. يدعم الأساس ربط كل نقطة معرفة بتسميات القسم والمنصب والدور والمنطقة ودرجة السرية، وعند البحث تُطبَّق فلترة الصلاحيات قبل الاسترجاع — يُتحقق من الصلاحيات في طبقة البيانات، دون الاعتماد على ضبط النفس في طبقة التطبيق. وتوفر منظومة تعدد المستأجرين عزلًا طبيعيًا لقواعد معرفة العملاء/وحدات الأعمال المختلفة.

مستوى نقطة المعرفةدقة تسميات الصلاحيات
تعدد المستأجرينعزل طبيعي للبيانات
الفلاتر تسبق البحثالفلترة قبل الاسترجاع
معاينة الفلاترإمكانية التحقق من فاعلية الصلاحيات

ثامنًا: التقييم ثلاثي الطبقات

جودة قاعدة المعرفة تتحدث بالأرقام، والإجابات السيئة يمكن محاسبتها

بناء قاعدة المعرفة ليس نهاية الأمر. يتضمن الأساس نظام تقييم ثلاثي الطبقات: طبقة المدونة (اكتمال التحليل، معدل بنية الجداول، دقة OCR، تغطية الإخفاء)، وطبقة البحث (HitRate@K وRecall@K وMRR وNDCG@K)، وطبقة التوليد (الوفاء بالسياق، ملاءمة الإجابة، دقة السياق). وبعد تقييم المستخدم السلبي يُسنَد الخطأ تلقائيًا: هل المشكلة في التقسيم أم التنظيف أم الإخفاء أم البيانات الوصفية؟ يُعرف بمجرد الفحص، وتعود الحالات السيئة تلقائيًا إلى مجموعة التقييم.

ثلاث طبقاتالمدونة/البحث/التوليد
بوابة الانحدارانحدار تلقائي عند تغيير الاستراتيجيات
إسناد التقييم السلبيتحديد المشكلة في مرحلة محددة
لوحة معلوماتتصور مرئي لاتجاهات الجودة

اطّلع على البيانات المقاسة →

هل تريد رؤية هذه القدرات وهي تعمل على مستنداتك؟

احجز عرضًا توضيحيًا، فالرؤية خير من السماع

احجز عرضًا توضيحيًا التكامل والنشر