راهنما · ۶ دقیقه مطالعه
استخراج متن فارسی از عکس با OCR در PiGPT
راهنمای واقعی استفاده از OCR استودیوی رسانه برای تبدیل تصویر و PDF به متن قابل ویرایش.
استخراج متن فارسی از عکس با OCR تصویر نوشته را به متن قابل کپی و ویرایش تبدیل میکند. در استودیوی رسانهٔ PiGPT بخش «OCR / منبع کپشن» وجود دارد: فایل تصویر یا PDF را انتخاب میکنید، «استخراج متن» را میزنید و نتیجه در همان کارت نمایش داده میشود.
OCR رونویسی اولیه است، نه تأیید صحت سند. کیفیت عکس، فونت، جدول، دستخط و ترکیب فارسی و انگلیسی بر نتیجه اثر دارند. عدد و نام ممکن است ظاهراً درست اما واقعاً اشتباه باشند؛ بنابراین بازبینی با تصویر اصلی بخش ضروری کار است.
OCR چه فایلهایی را میگیرد؟
فرم فعلی /app/media تصویر و PDF را میپذیرد. در سمت سرور، PDF از مسیر استخراج متن سند پردازش میشود و تصویر با قابلیت بینایی برای استخراج نوشته خوانده میشود. خروجی متن ساختاریافتهٔ فارسی یا انگلیسی است.
اگر PDF متن انتخابپذیر دارد، استخراج مستقیم معمولاً بهتر از عکس گرفتن از صفحه است. اگر PDF اسکنشده باشد، کیفیت هر صفحه تعیینکننده است. فایل خالی رد میشود و قابلیت رسانه و اسناد باید برای حساب فعال باشند.
برای مجموعهٔ بزرگ، نخست یک صفحهٔ نماینده را آزمایش کنید. اگر ستون، جدول یا حاشیه در همان نمونه بههم میریزد، پردازش صد صفحه مشکل را بزرگتر میکند.
عکس مناسب برای تبدیل به متن
صفحه را صاف و موازی دوربین بگیرید. زاویهٔ زیاد شکل حروف را تغییر میدهد. نور باید یکنواخت باشد؛ سایهٔ دست، بازتاب کاغذ براق و نور نقطهای بخشی از متن را میپوشاند. وضوح را روی نوشته تنظیم کنید.
تمام حاشیههای بیربط را ببرید، اما شمارهٔ صفحه و عنوانی را که برای فهم لازم است نگه دارید. اگر دو صفحه در یک عکس جا نمیشوند، جدا ثبت کنید. بزرگ کردن دیجیتال عکس تار، جزئیات واقعی اضافه نمیکند.
برای رسید، کارت یا برچسب کوچک، پسزمینهٔ ساده انتخاب کنید. متن بسیار ریز را از فاصلهٔ نزدیک و با بیشترین وضوح ثبت کنید. تصویر را پیش از ارسال باز کنید و خودتان خوانایی عددهای کوچک را بسنجید.
مسیر استفاده در PiGPT
وارد استودیوی رسانه شوید و کارت OCR را پیدا کنید. فایل را انتخاب و دکمهٔ «استخراج متن» را بزنید. درخواست با حساب شما ارسال میشود و نتیجهٔ متنی در پایین همان فرم ظاهر میشود.
صفحهٔ فعلی گزینهٔ زبان، محدودهٔ صفحه یا قالب جدول جداگانه ندارد. پس نباید انتظار تنظیماتی را داشته باشید که در رابط نیست. اگر سند پیچیده است، صفحهها را جدا کنید و خروجی هر بخش را مستقل نگه دارید.
بعد از دریافت متن، آن را مستقیم منتشر نکنید. در یک ویرایشگر قرار دهید، شکست خطها را مرتب کنید و با تصویر اصلی مقابله کنید. نسخهٔ خام را نیز نگه دارید تا معلوم باشد چه اصلاحی انجام شده است.
بازبینی متن فارسی
نخست عددها، تاریخها، مبالغ، شمارهها و کدها را بررسی کنید. تفاوت «۰» و «۵»، یا رقم فارسی و لاتین، در بعضی تصویرها دشوار است. سپس نام افراد، مکان و محصول را کنترل کنید؛ موتور ممکن است نزدیکترین واژهٔ آشنا را جایگزین کند.
حروف فارسی و عربی مانند «ی/ي» و «ک/ك» ممکن است مخلوط شوند. برای جستوجو و پردازش بعدی، نویسهها را یکدست کنید، ولی متن تاریخی یا نقل قول را بیدلیل مدرن نکنید.
منفیها، ممیز، درصد و واحد نیز حیاتیاند. «۱٫۵» با «۱۵» تفاوت بزرگی دارد. هر عدد را همراه خط یا خانهٔ جدول اصلی ببینید.
جدول و چندستون
OCR ممکن است متن جدول را استخراج کند اما رابطهٔ سطر و ستون را از دست بدهد. اگر جدول برای تصمیم مهم است، خروجی را با ساختار دستی بازسازی کنید. از مدل نخواهید جای خالی را حدس بزند؛ خانهٔ ناخوانا باید «نامشخص» بماند.
در صفحهٔ دو ستونه، ترتیب خواندن ممکن است میان ستونها جابهجا شود. هر ستون را جدا برش دهید یا پس از استخراج ترتیب پاراگراف را با اصل صفحه تطبیق دهید. تیتر و زیرنویس تصویر را نیز از بدنه جدا کنید.
برای CSV نهایی، عددها را پیش از وارد کردن به ابزار تحلیل داده کنترل کنید. تحلیل دقیق روی دادهٔ اشتباه فقط نتیجهٔ اشتباه را منظمتر میکند.
دستخط و سند قدیمی
دستخط از متن چاپی دشوارتر است. شکل شخصی حروف، خطخوردگی و اتصال واژهها خطا را بالا میبرد. با نمونهٔ کوتاه شروع کنید و انتظار رونویسی کامل نداشته باشید.
سند قدیمی ممکن است لکه، کاغذ زرد، چاپ کمرنگ یا املای تاریخی داشته باشد. اصلاح کنتراست میتواند کمک کند، اما فیلتر شدید بخشهایی از حروف را حذف میکند. اصل فایل را نگه دارید.
برای آرشیو پژوهشی، هر عبارت نامطمئن را با نشانه مشخص کنید و شمارهٔ صفحه یا ناحیه را ثبت کنید. حدس خاموش، ارزش پژوهشی متن را از بین میبرد.
بعد از OCR چه کنیم؟
اگر هدف پرسش از سند است، متن پاکسازیشده یا PDF مناسب را در اسناد و دانش بارگذاری کنید. آن ابزار فایل را ایندکس و پاسخ را با قطعات منبع نشان میدهد. راهنمای پرسش از PDF جزئیات آن مرحله را دارد.
اگر هدف خلاصه است، ابتدا OCR را بازبینی و بعد از اصول خلاصهسازی متن فارسی استفاده کنید. خلاصه کردن متن رونویسینشده ممکن است خطای کوچک را به نتیجهٔ اصلی تبدیل کند.
برای انتشار، علائم نگارشی و پاراگراف را ویرایش کنید، اما معنی و عدد را تغییر ندهید. تصویر اصلی مرجع نهایی باقی میماند.
حریم خصوصی و حق استفاده
تصویر کارت شناسایی، پرونده، قرارداد یا رسید میتواند دادهٔ حساس داشته باشد. فقط در صورت نیاز و مجوز آن را پردازش کنید. بخشهای غیرضروری را پیش از بارگذاری بپوشانید، نه بعد از دریافت متن.
استخراج متن به معنای داشتن حق انتشار نیست. برای کتاب، سند سازمانی یا محتوای شخص دیگر، حق استفاده را جدا بررسی کنید. فایل خروجی را نیز با همان سطح حفاظت اصل سند نگه دارید.
در محیط مشترک، نام فایل نباید اطلاعات محرمانهٔ اضافی افشا کند. نسخهٔ خام و اصلاحشده را در محل کنترلشده ذخیره کنید.
چکلیست کیفیت
- صفحه صاف، روشن و واضح است.
- حاشیهٔ بیربط حذف شده است.
- یک صفحهٔ نماینده پیش از پردازش مجموعه آزموده شده است.
- عدد، تاریخ، نام و واحد با اصل تصویر تطبیق داده شدهاند.
- ترتیب ستون و ساختار جدول دستی بررسی شده است.
- نویسههای فارسی و عربی در صورت نیاز یکدست شدهاند.
- عبارت ناخوانا حدس زده نشده و علامت خورده است.
- نسخهٔ اصلی برای ارجاع نگه داشته شده است.
جمعبندی
OCR PiGPT ابزار واقعی تبدیل تصویر یا PDF به متن در استودیوی رسانه است. نتیجه را یک پیشنویس رونویسی بدانید. عکس خوب تهیه کنید، موارد حساس را حذف کنید و عدد و نام را با اصل سند کنترل کنید. پس از این بازبینی میتوانید متن را برای خلاصه، جستوجو یا پرسش از سند آماده کنید.