راهنما · ۶ دقیقه مطالعه
پرسش از PDF با هوش مصنوعی و اسناد RAG
مسیر واقعی آپلود، ایندکس، انتخاب سند و پرسش با استناد در استودیوی اسناد PiGPT.
پرسش از PDF با هوش مصنوعی زمانی قابل اعتمادتر است که پاسخ به بخشهای بازیابیشدهٔ همان سند وصل باشد. استودیوی «اسناد و دانش» PiGPT این مسیر را واقعاً دارد: فایل را بارگذاری میکنید، منتظر ایندکس میمانید، یک یا چند سند آماده را انتخاب میکنید و سؤال را با استناد میپرسید. پاسخ در کنار منابع بازیابیشده نمایش داده میشود.
RAG مخفف تولید تقویتشده با بازیابی است. بهجای اینکه مدل فقط از دانش عمومی پاسخ بدهد، ابتدا قطعات مرتبط از کتابخانهٔ شما پیدا میشوند و سپس پاسخ بر اساس همان قطعات ساخته میشود. این روش خطا را صفر نمیکند، اما منبع بررسی را جلوی چشم شما میگذارد.
چه فایلهایی در استودیو پذیرفته میشوند؟
مسیر واقعی ابزار /app/documents است. رابط فعلی فایلهای TXT، Markdown، CSV و PDF را میپذیرد. میتوانید برای فایل عنوان اختیاری بنویسید. پس از آپلود، سند وضعیت «در صف»، «ایندکس»، «آماده» یا «خطا» میگیرد. تا وقتی دستکم یک سند آماده نباشد، دکمهٔ پرسش فعال نمیشود.
وجود PDF به این معنا نیست که هر نوع PDF بدون محدودیت خوانده میشود. PDF متنی با سند اسکنشده فرق دارد. اگر فایل فقط تصویر صفحهها باشد، استخراج متن ممکن است به OCR نیاز داشته باشد. کیفیت پایین، صفحهٔ چرخیده، جدول پیچیده و فونت غیرمعمول میتواند نتیجه را ضعیف کند. برای تصویر یا PDF اسکنشده، مقالهٔ استخراج متن از عکس مسیر جداگانه را توضیح میدهد.
پیش از بارگذاری، دادهٔ حساس و بخشهای نامرتبط را حذف کنید. یک فایل کوچک و دقیق معمولاً برای پرسش مشخص بهتر از آرشیوی بزرگ با نسخههای تکراری است.
ایندکس چه کاری انجام میدهد؟
پس از آپلود، متن استخراج و به قطعات کوچکتر تقسیم میشود. رابط تعداد قطعات هر سند آماده را نشان میدهد. هنگام سؤال، سیستم قطعات نزدیک به پرسش را بازیابی میکند. تنظیم فعلی محصول برای قابلیت اسناد، پاسخ بر اساس منبع کاربر و اعلام ناکافی بودن اطلاعات را در دستور سیستم قرار میدهد.
ایندکس کردن با خلاصه کردن فرق دارد. در این مرحله قرار نیست یک پاسخ نهایی ساخته شود؛ کتابخانه برای جستوجوی معنایی آماده میشود. اگر فایل را عوض کردهاید، نسخهٔ قدیمی را حذف و نسخهٔ درست را دوباره بارگذاری کنید تا دو پاسخ متعارض در کتابخانه نماند.
وضعیت «خطا» را نادیده نگیرید. سند ناموفق وارد محدودهٔ پاسخ نمیشود. پیام همان ردیف را بخوانید، فایل را باز کنید و مطمئن شوید خالی، خراب یا با پسوند نادرست نیست.
انتخاب سند و محدودهٔ سؤال
در کتابخانه میتوانید کنار سند آماده تیک بزنید. اگر چیزی انتخاب نکنید، رابط همهٔ اسناد آماده را محدوده در نظر میگیرد. برای سؤال دقیق بهتر است فقط فایلهای مرتبط را انتخاب کنید. این کار احتمال بازیابی متن همنام از نسخه یا پروژهای دیگر را کمتر میکند.
اگر دو سند را مقایسه میکنید، نام هر دو را در سؤال بیاورید و معیار مقایسه را مشخص کنید. مثلاً: «تعریف هزینهٔ قابل قبول در سند سیاست مالی و دستورالعمل سفر چه تفاوتی دارد؟ برای هر نتیجه منبع را جدا نشان بده.»
برای یک سند بلند نیز سؤال را کوچک نگه دارید. «کل فایل را توضیح بده» معمولاً انتخاب قطعات را دشوار میکند. سؤال دربارهٔ تصمیم، تعریف، استثنا، عدد یا بخش مشخص، منبع دقیقتری برمیگرداند.
چگونه سؤال دقیق بنویسیم؟
هدف، محدوده و قالب را در یک پیام بیاورید. نمونه: «فقط بر اساس سند انتخابشده، شرایط فسخ را در پنج نکته خلاصه کن. تاریخ، مبلغ و استثناها را دقیق نگه دار. اگر دربارهٔ مهلت اطلاعرسانی چیزی نیست، بنویس در سند یافت نشد.»
عبارت «فقط بر اساس سند» جلوی هر خطایی را تضمین نمیکند، ولی معیار بازبینی میسازد. درخواست منبع برای هر ادعا نیز مهم است. رابط استنادهای بازیابیشده را زیر پاسخ با شماره، امتیاز و بخشی از محتوا نشان میدهد.
برای خلاصهٔ مدیریتی، کاربرد را بگویید. برای مطالعه، تعریف و مثال بخواهید. اصول کلی نوشتن پرامپت فارسی در اینجا هم برقرار است: هدف، زمینه، محدودیت و قالب.
استناد را چگونه بررسی کنیم؟
استناد به این معناست که قطعهای برای ساخت پاسخ بازیابی شده، نه اینکه هر جملهٔ پاسخ حتماً نتیجهٔ منطقی و قطعی همان قطعه است. متن منبع را بخوانید و ببینید ادعا واقعاً پشتیبانی میشود. امتیاز بالاتر نشانهٔ نزدیکی است، نه مهر صحت.
عدد، تاریخ، نام و عبارتهای منفی را خطبهخط با سند تطبیق دهید. اگر پاسخ میگوید «مجاز است» اما منبع «مجاز نیست مگر...» نوشته، خلاصه شرط مهمی را حذف کرده است. در این حالت سؤال را محدودتر کنید و بخواهید عبارت کامل شرط نقل شود.
اگر منبع نامرتبط است، واژههای مبهم سؤال را اصلاح کنید یا سندهای اضافی را از انتخاب خارج کنید. تکرار همان سؤال بدون تغییر معمولاً مشکل محدوده را حل نمیکند.
خلاصهسازی و مقایسه چند سند
برای خلاصه کردن PDF بلند، ابتدا بخشهای کلیدی را جداگانه بپرسید: مسئله، شواهد، نتیجه و محدودیت. سپس از پاسخهای مبتنی بر منبع یک خلاصهٔ نهایی بسازید. راهنمای خلاصهسازی متن فارسی معیارهای حفظ عدد و شرط را توضیح میدهد.
در مقایسه، از سیستم نخواهید تفاوتی را که وجود ندارد بسازد. بگویید اگر دو سند دربارهٔ معیاری حرف نزدهاند، خانهٔ آن معیار «ذکر نشده» باشد. تعارض را نیز پنهان نکنید؛ نسخه، تاریخ و صاحب سند برای تصمیم اهمیت دارند.
پاسخ استودیو در ویرایشگر بلوکی قابل بازبینی است و میتوانید خروجی HTML چاپی بگیرید. پیش از خروجی، متن را ویرایش و منابع را دوباره کنترل کنید.
خطاهای رایج
بارگذاری چند نسخهٔ تکراری، انتخاب همهٔ اسناد برای هر سؤال و پرسیدن درخواست بسیار کلی سه خطای متداولاند. خطای دیگر اعتماد به پاسخ بدون باز کردن قطعهٔ منبع است. RAG ابزار بررسی را نزدیک میکند، ولی وظیفهٔ بررسی را حذف نمیکند.
فایل محرمانه را فقط به دلیل راحتی بارگذاری نکنید. نیاز واقعی، دسترسی حساب و سیاست نگهداری سازمان را بسنجید. برای تصمیم حقوقی، پزشکی یا مالی، پاسخ جای متن اصلی و نظر متخصص نیست.
همچنین گمان نکنید نبود پاسخ یعنی نبود مطلب در فایل. ممکن است عبارت با واژهای متفاوت نوشته شده یا استخراج متن مشکل داشته باشد. یک بار با اصطلاح هممعنا بپرسید و سپس متن فایل را دستی جستوجو کنید.
چکلیست عملی
- فایل درست و غیرحساس را انتخاب کنید.
- فرمت و امکان انتخاب متن PDF را بررسی کنید.
- تا وضعیت «آماده» صبر کنید.
- فقط سندهای مرتبط را تیک بزنید.
- سؤال را با موضوع، محدودیت و قالب بنویسید.
- از سیستم بخواهید نبود اطلاعات را صریح اعلام کند.
- هر ادعای مهم را با قطعهٔ منبع تطبیق دهید.
- پیش از اشتراک یا خروجی، عددها و شرطها را دوباره بخوانید.
اگر سؤال همزمان به فایل شما و یک واقعیت بیرونی نیاز دارد، روشنکردن وب را در پرسش از اسناد با جستجوی وب بسنجید و مرز فقطکتابخانه را در اسناد فقطکتابخانه در برابر وب نگه دارید.
جمعبندی
قابلیت پرسش از PDF در PiGPT یک مسیر واقعی آپلود، ایندکس، بازیابی و پاسخ با استناد دارد. از اسناد و دانش شروع کنید، کتابخانه را تمیز نگه دارید و سؤال را به تصمیم مشخص وصل کنید. مزیت اصلی RAG پاسخ کوتاهتر نیست؛ امکان دیدن منبعی است که باید برای پذیرفتن پاسخ بررسی شود.