دادهی محرمانه
جستوجو در اسناد سازمانی با بازیابیافزوده
مدل زبانی اسناد شما را ندیده است. بازیابیافزوده این را حل میکند — ولی یک مسئلهی جدید میسازد که اگر حلش نکنید، از مسئلهی اول بدتر است: کنترل دسترسی.
سطح دادهی غالب در این حوزه
محرمانه: افشایش به کسبوکار، مشتری یا اعتبار شما آسیب میزند. استقرار متناسب: درونسازمانی.
مسئله در این حوزه چه شکلی است
- اسناد در پوشهها و سامانههای مختلف پراکندهاند و جستوجوی کلیدواژهای پیدایشان نمیکند.
- دانش سازمانی در اسنادی است که کسی وقت خواندنشان را ندارد.
- کارکنان تازهوارد ماهها طول میکشد تا بفهمند هر چیزی کجاست.
- وقتی همهی اسناد در یک مخزن ریخته شوند، کنترل دسترسی بهطور پیشفرض از بین میرود.
سه کار قابل خودکارسازی
۰۱
تعیین محدوده و نقشهی دسترسی
پیش از هر کار فنی: کدام مجموعه سند، و چه کسی اجازهی دیدن چه چیزی را دارد. اگر این قاعده جایی مکتوب نیست، اولین کار همین است.
۰۲
آمادهسازی و نرمالسازی اسناد
تکهکردن روی مرزهای طبیعی سند و نرمالسازی متن فارسی. اگر نیمفاصله و «ی» و «ک» یکدست نشوند، بازیابی بهطور نامحسوس بد کار میکند.
۰۳
پرسش و پاسخ با ارجاع به منبع
هر پاسخ باید بگوید از کدام سند و کدام نسخه آمده. بدون ارجاع، پاسخ قابل راستیآزمایی نیست.
دادهای که هرگز نباید بیرون برود
- اسناد دارای طبقهبندی یا محرمانه
- قراردادها و اسناد حقوقی در جریان
- پروندههای پرسنلی
- دانش فنی و نقشههای محصول
معماری استقرار متناسب
درونسازمانی برای مخازن حاوی سند محرمانه. نکتهی کلیدی معماری اینجا این است که فیلتر دسترسی باید در مرحلهی بازیابی اعمال شود، نه بعد از تولید پاسخ. اگر قطعهای که کاربر اجازهی دیدنش را ندارد اصلاً به مدل داده نشود، مدل هم نمیتواند لو بدهد.
ریسکهای OWASP LLM مرتبط
LLM08
ضعف بردار و بازیابی
مهمترین ریسک این حوزه. اگر کنترل دسترسی روی اسناد اعمال نشود، کاربر به سندی میرسد که نباید.
LLM02
افشای اطلاعات حساس
نتیجهی مستقیم ریسک بالا: پاسخی که از سند غیرمجاز ساخته شده.
LLM01
تزریق دستور
سندی که بازیابی میشود میتواند حاوی دستور پنهان باشد، حتی اگر داخل شبکهی خودتان باشد.
LLM09
اطلاعات نادرست
ارجاع به سند درست تضمین نمیکند که مدل آن را درست خوانده باشد. ارجاع بازبینی را ممکن میکند، جایگزینش نمیشود.
نمونهی معیار پذیرش
روی ۱۰۰ پرسش واقعی کاربران، پاسخ درست با ارجاع به سند و نسخهی درست ارائه شود؛ و صفر مورد دسترسی به سندی خارج از سطح مجاز کاربر در گزارش تست دسترسی.
عدد دقیق در گفتوگو با شما و بر اساس وضعیت فعلی کارتان تعیین میشود. عددی که بدون شناخت کار شما نوشته شود، تبلیغ است نه معیار.
محدودیتها
- اگر پرسش نیازمند محاسبه روی هزاران ردیف باشد، بازیابیافزوده ابزار درستی نیست؛ یک پرسوجوی پایگاه داده است.
- اسناد اسکنشده بدون لایهی متنی اول باید از تشخیص نوری بگذرند و کیفیتش روی نمونهی واقعی سنجیده شود.
- اگر نسخههای قدیمی و جدید یک سند با هم در مخزن باشند، پاسخ ممکن است از نسخهی منسوخ بیاید. مدیریت نسخه پیشنیاز است، نه بهبود بعدی.
پرسش و پاسخ
آیا مدل روی اسناد ما آموزش میبیند؟
نه. بازیابیافزوده آموزش نیست. مدل چیزی یاد نمیگیرد و بعد از پایان مکالمه چیزی به خاطر نمیسپارد. اسناد فقط در لحظهی پاسخ به مدل نشان داده میشوند.
چطور جلوی دیدن سند غیرمجاز را میگیرید؟
با اعمال فیلتر دسترسی در مرحلهی بازیابی. قطعهای که کاربر اجازهاش را ندارد اصلاً وارد بافتار نمیشود، پس مدل هم نمیتواند لو بدهد. این با فیلترکردن پاسخ بعد از تولید فرق اساسی دارد.
برای فارسی چه چیزی متفاوت است؟
نرمالسازی. نیمفاصله، «ی» و «ک» عربی در برابر فارسی، و اعداد در سه الفبا باعث میشوند دو متن یکسان از نظر انسان، برای ماشین دو چیز متفاوت باشند. ابزار نرمالساز آزمایشگاه همین کار را نشان میدهد.
اگر دو سند با هم متناقض باشند، کدام را نشان میدهد؟
هر دو را، با نام سند و تاریخش کنار هرکدام. تشخیص اینکه کدام معتبر است کار سازمان است نه کار مدل — و پنهانکردن یکی از آن دو، تناقض را حل نمیکند، فقط از چشم پنهانش میکند. معمولاً همین دیدهشدنِ تناقض، ارزشمندترین خروجی هفتهی اول است.
پیادهسازی جستوجو در اسناد از کجا شروع میشود؟
همینجا پاسخ دهید و پتانسیل اتوماسیون کسبوکارتان را بسنجید.
یک جلسهی نیمساعته کافی است تا بفهمیم کدام از این سه کار برای شما اولویت دارد و اولین گام مشخصتان چیست.
اگر این خدمات مناسب شما نباشد، صریحاً به شما میگویم.