راهنما · ۶ دقیقه مطالعه

استخراج متن فارسی از عکس با OCR در PiGPT

راهنمای واقعی استفاده از OCR استودیوی رسانه برای تبدیل تصویر و PDF به متن قابل ویرایش.

دوربین اسکن بالای سند قدیمی و نوارهای خالی متن استخراج‌شده در کنار آن

استخراج متن فارسی از عکس با OCR تصویر نوشته را به متن قابل کپی و ویرایش تبدیل می‌کند. در استودیوی رسانهٔ PiGPT بخش «OCR / منبع کپشن» وجود دارد: فایل تصویر یا PDF را انتخاب می‌کنید، «استخراج متن» را می‌زنید و نتیجه در همان کارت نمایش داده می‌شود.

OCR رونویسی اولیه است، نه تأیید صحت سند. کیفیت عکس، فونت، جدول، دست‌خط و ترکیب فارسی و انگلیسی بر نتیجه اثر دارند. عدد و نام ممکن است ظاهراً درست اما واقعاً اشتباه باشند؛ بنابراین بازبینی با تصویر اصلی بخش ضروری کار است.

OCR چه فایل‌هایی را می‌گیرد؟

فرم فعلی /app/media تصویر و PDF را می‌پذیرد. در سمت سرور، PDF از مسیر استخراج متن سند پردازش می‌شود و تصویر با قابلیت بینایی برای استخراج نوشته خوانده می‌شود. خروجی متن ساختاریافتهٔ فارسی یا انگلیسی است.

اگر PDF متن انتخاب‌پذیر دارد، استخراج مستقیم معمولاً بهتر از عکس گرفتن از صفحه است. اگر PDF اسکن‌شده باشد، کیفیت هر صفحه تعیین‌کننده است. فایل خالی رد می‌شود و قابلیت رسانه و اسناد باید برای حساب فعال باشند.

برای مجموعهٔ بزرگ، نخست یک صفحهٔ نماینده را آزمایش کنید. اگر ستون، جدول یا حاشیه در همان نمونه به‌هم می‌ریزد، پردازش صد صفحه مشکل را بزرگ‌تر می‌کند.

عکس مناسب برای تبدیل به متن

صفحه را صاف و موازی دوربین بگیرید. زاویهٔ زیاد شکل حروف را تغییر می‌دهد. نور باید یکنواخت باشد؛ سایهٔ دست، بازتاب کاغذ براق و نور نقطه‌ای بخشی از متن را می‌پوشاند. وضوح را روی نوشته تنظیم کنید.

تمام حاشیه‌های بی‌ربط را ببرید، اما شمارهٔ صفحه و عنوانی را که برای فهم لازم است نگه دارید. اگر دو صفحه در یک عکس جا نمی‌شوند، جدا ثبت کنید. بزرگ کردن دیجیتال عکس تار، جزئیات واقعی اضافه نمی‌کند.

برای رسید، کارت یا برچسب کوچک، پس‌زمینهٔ ساده انتخاب کنید. متن بسیار ریز را از فاصلهٔ نزدیک و با بیشترین وضوح ثبت کنید. تصویر را پیش از ارسال باز کنید و خودتان خوانایی عددهای کوچک را بسنجید.

مسیر استفاده در PiGPT

وارد استودیوی رسانه شوید و کارت OCR را پیدا کنید. فایل را انتخاب و دکمهٔ «استخراج متن» را بزنید. درخواست با حساب شما ارسال می‌شود و نتیجهٔ متنی در پایین همان فرم ظاهر می‌شود.

صفحهٔ فعلی گزینهٔ زبان، محدودهٔ صفحه یا قالب جدول جداگانه ندارد. پس نباید انتظار تنظیماتی را داشته باشید که در رابط نیست. اگر سند پیچیده است، صفحه‌ها را جدا کنید و خروجی هر بخش را مستقل نگه دارید.

بعد از دریافت متن، آن را مستقیم منتشر نکنید. در یک ویرایشگر قرار دهید، شکست خط‌ها را مرتب کنید و با تصویر اصلی مقابله کنید. نسخهٔ خام را نیز نگه دارید تا معلوم باشد چه اصلاحی انجام شده است.

بازبینی متن فارسی

نخست عددها، تاریخ‌ها، مبالغ، شماره‌ها و کدها را بررسی کنید. تفاوت «۰» و «۵»، یا رقم فارسی و لاتین، در بعضی تصویرها دشوار است. سپس نام افراد، مکان و محصول را کنترل کنید؛ موتور ممکن است نزدیک‌ترین واژهٔ آشنا را جایگزین کند.

حروف فارسی و عربی مانند «ی/ي» و «ک/ك» ممکن است مخلوط شوند. برای جست‌وجو و پردازش بعدی، نویسه‌ها را یکدست کنید، ولی متن تاریخی یا نقل قول را بی‌دلیل مدرن نکنید.

منفی‌ها، ممیز، درصد و واحد نیز حیاتی‌اند. «۱٫۵» با «۱۵» تفاوت بزرگی دارد. هر عدد را همراه خط یا خانهٔ جدول اصلی ببینید.

جدول و چندستون

OCR ممکن است متن جدول را استخراج کند اما رابطهٔ سطر و ستون را از دست بدهد. اگر جدول برای تصمیم مهم است، خروجی را با ساختار دستی بازسازی کنید. از مدل نخواهید جای خالی را حدس بزند؛ خانهٔ ناخوانا باید «نامشخص» بماند.

در صفحهٔ دو ستونه، ترتیب خواندن ممکن است میان ستون‌ها جابه‌جا شود. هر ستون را جدا برش دهید یا پس از استخراج ترتیب پاراگراف را با اصل صفحه تطبیق دهید. تیتر و زیرنویس تصویر را نیز از بدنه جدا کنید.

برای CSV نهایی، عددها را پیش از وارد کردن به ابزار تحلیل داده کنترل کنید. تحلیل دقیق روی دادهٔ اشتباه فقط نتیجهٔ اشتباه را منظم‌تر می‌کند.

دست‌خط و سند قدیمی

دست‌خط از متن چاپی دشوارتر است. شکل شخصی حروف، خط‌خوردگی و اتصال واژه‌ها خطا را بالا می‌برد. با نمونهٔ کوتاه شروع کنید و انتظار رونویسی کامل نداشته باشید.

سند قدیمی ممکن است لکه، کاغذ زرد، چاپ کم‌رنگ یا املای تاریخی داشته باشد. اصلاح کنتراست می‌تواند کمک کند، اما فیلتر شدید بخش‌هایی از حروف را حذف می‌کند. اصل فایل را نگه دارید.

برای آرشیو پژوهشی، هر عبارت نامطمئن را با نشانه مشخص کنید و شمارهٔ صفحه یا ناحیه را ثبت کنید. حدس خاموش، ارزش پژوهشی متن را از بین می‌برد.

بعد از OCR چه کنیم؟

اگر هدف پرسش از سند است، متن پاک‌سازی‌شده یا PDF مناسب را در اسناد و دانش بارگذاری کنید. آن ابزار فایل را ایندکس و پاسخ را با قطعات منبع نشان می‌دهد. راهنمای پرسش از PDF جزئیات آن مرحله را دارد.

اگر هدف خلاصه است، ابتدا OCR را بازبینی و بعد از اصول خلاصه‌سازی متن فارسی استفاده کنید. خلاصه کردن متن رونویسی‌نشده ممکن است خطای کوچک را به نتیجهٔ اصلی تبدیل کند.

برای انتشار، علائم نگارشی و پاراگراف را ویرایش کنید، اما معنی و عدد را تغییر ندهید. تصویر اصلی مرجع نهایی باقی می‌ماند.

حریم خصوصی و حق استفاده

تصویر کارت شناسایی، پرونده، قرارداد یا رسید می‌تواند دادهٔ حساس داشته باشد. فقط در صورت نیاز و مجوز آن را پردازش کنید. بخش‌های غیرضروری را پیش از بارگذاری بپوشانید، نه بعد از دریافت متن.

استخراج متن به معنای داشتن حق انتشار نیست. برای کتاب، سند سازمانی یا محتوای شخص دیگر، حق استفاده را جدا بررسی کنید. فایل خروجی را نیز با همان سطح حفاظت اصل سند نگه دارید.

در محیط مشترک، نام فایل نباید اطلاعات محرمانهٔ اضافی افشا کند. نسخهٔ خام و اصلاح‌شده را در محل کنترل‌شده ذخیره کنید.

چک‌لیست کیفیت

  • صفحه صاف، روشن و واضح است.
  • حاشیهٔ بی‌ربط حذف شده است.
  • یک صفحهٔ نماینده پیش از پردازش مجموعه آزموده شده است.
  • عدد، تاریخ، نام و واحد با اصل تصویر تطبیق داده شده‌اند.
  • ترتیب ستون و ساختار جدول دستی بررسی شده است.
  • نویسه‌های فارسی و عربی در صورت نیاز یکدست شده‌اند.
  • عبارت ناخوانا حدس زده نشده و علامت خورده است.
  • نسخهٔ اصلی برای ارجاع نگه داشته شده است.

جمع‌بندی

OCR PiGPT ابزار واقعی تبدیل تصویر یا PDF به متن در استودیوی رسانه است. نتیجه را یک پیش‌نویس رونویسی بدانید. عکس خوب تهیه کنید، موارد حساس را حذف کنید و عدد و نام را با اصل سند کنترل کنید. پس از این بازبینی می‌توانید متن را برای خلاصه، جست‌وجو یا پرسش از سند آماده کنید.