امکانات · ۶ دقیقه مطالعه

گفتار به متن فارسی در PiGPT؛ وضعیت و کاربرد

توضیح صادقانهٔ قابلیت STT PiGPT، بدون ساختن دکمه یا مسیر کاربری که هنوز در صفحهٔ رسانه نیست.

میکروفون سفالی که موج‌های صدا را به نوارهای کاغذی مرتب تبدیل می‌کند

گفتار به متن فارسی یا STT صدای ضبط‌شده را به متن قابل ویرایش تبدیل می‌کند. این قابلیت در هستهٔ رسانهٔ PiGPT تعریف و فعال است و مسیر پردازش صوت در سمت سرور وجود دارد. با این حال، صفحهٔ فعلی /app/media هنوز کنترل بارگذاری فایل برای STT را نشان نمی‌دهد. بنابراین این مقاله یک راهنمای دکمه‌به‌دکمهٔ ساختگی نیست.

آنچه امروز می‌توان با اطمینان گفت این است: سرویس احراز هویت‌شده فایل صوتی را دریافت می‌کند، آن را برای رونویسی می‌فرستد و متن برمی‌گرداند؛ قابلیت stt_studio نیز در فهرست قابلیت‌های فعال محصول است. اما تا وقتی ورودی فایل در رابط رسانه منتشر نشده، کاربر عادی نباید انتظار یک دکمهٔ «آپلود صدا» در صفحه داشته باشد.

گفتار به متن دقیقاً چه مسئله‌ای را حل می‌کند؟

STT برای تبدیل جلسه، یادداشت صوتی، مصاحبه یا توضیح شفاهی به پیش‌نویس متنی است. خروجی معمولاً مادهٔ اولیه است، نه متن آمادهٔ انتشار. نام‌ها، عددها، علائم نگارشی و تفکیک گوینده نیاز به بازبینی دارند.

مزیت اصلی، کاهش زمان تایپ اولیه است. اگر یک ساعت گفت‌وگو دارید، رونویسی ماشینی می‌تواند متن پایه بسازد تا شما روی اصلاح و استخراج نکته تمرکز کنید. اما صدای نامفهوم یا محیط شلوغ را به واقعیت قطعی تبدیل نمی‌کند.

برای فرمان زنده یا دستیار صوتی نیز STT بخشی از زنجیره است، ولی وجود رونویسی به‌تنهایی به معنای وجود کنترل صوتی کامل نیست. محصول باید ضبط، مجوز میکروفون، ارسال، وضعیت و ویرایش را نیز در رابط فراهم کند.

وضعیت واقعی رابط PiGPT

استودیوی رسانه اکنون بخش‌های OCR، متن به صدا، ساخت پرامپت ویرایش تصویر و تایم‌لاین رسانه را نشان می‌دهد. در کد رابط فعلی فرم مستقلی برای STT وجود ندارد. در سمت سرور، مسیر رسانهٔ STT فایل را می‌گیرد و متن رونویسی‌شده برمی‌گرداند.

این تفاوت مهم است. فعال بودن قابلیت فنی با آماده بودن گردش‌کار عمومی یکسان نیست. تا وقتی کنترل کاربری منتشر نشده، نباید از مخاطب خواست روی دکمه‌ای کلیک کند که وجود ندارد یا مسیر داخلی را مانند API عمومی مستندشده معرفی کرد.

برای بررسی دسترسی حساب، فهرست استودیوها و پلن‌ها منبع واقعی‌اند. ماتریس محلی محصول قابلیت‌های صوتی را از پلن پلاس به بالا قرار می‌دهد؛ آنچه خود حساب در اپ نشان می‌دهد معیار نهایی است.

فایل صوتی مناسب چه ویژگی‌هایی دارد؟

کیفیت ورودی بیشترین اثر را بر رونویسی دارد. میکروفون را نزدیک گوینده بگذارید، صدای پس‌زمینه را کم کنید و از ضبطی که چند نفر روی هم صحبت می‌کنند پرهیز کنید. فرمت و اندازهٔ قابل قبول باید هنگام انتشار رابط از همان صفحه خوانده شود؛ پیش از آن حدس دربارهٔ سقف فایل درست نیست.

در گفتار فارسی، نام خاص، واژهٔ تخصصی، عدد و ترکیب فارسی‌ـ‌انگلیسی می‌تواند اشتباه شود. پیش از ضبط، فهرست نام‌ها را آماده کنید تا در بازبینی با متن تطبیق دهید. اگر یک اصطلاح حیاتی است، گوینده آن را شمرده و در جملهٔ کامل بیان کند.

جلسهٔ طولانی را به بخش‌های منطقی تقسیم کنید. فایل‌های کوتاه‌تر عیب‌یابی و اصلاح را آسان می‌کنند. زمان و موضوع هر بخش را در نام فایل خودتان ثبت کنید، بدون قرار دادن دادهٔ حساس غیرضروری.

چه انتظاری از خروجی داشته باشیم؟

خروجی STT متن است، نه صورت‌جلسهٔ کامل. رونویسی ممکن است مکث، تکرار و جملهٔ نیمه‌کاره را همان‌طور بیاورد یا علائم را به شکل متفاوت حدس بزند. نخست یک نسخهٔ وفادار نگه دارید و سپس نسخهٔ خوانا بسازید.

برای جلسه، بعد از رونویسی می‌توانید متن را در گفتگو قرار دهید و درخواست کنید تصمیم‌ها، اقدام‌ها، مسئول و موعد جدا شوند. مدل نباید مسئول یا تاریخی را که در متن نیست بسازد. اصول خلاصه‌سازی متن فارسی برای همین مرحله مناسب است.

برای مصاحبه، حذف تکیه‌کلام باید با حفظ معنی انجام شود. نقل قولی که قرار است منتشر شود باید دوباره با فایل صوتی تطبیق داده شود. متن روان‌شده ممکن است ناخواسته لحن یا قطعیت گوینده را تغییر دهد.

بازبینی رونویسی فارسی

بازبینی را با نام‌ها و عددها شروع کنید، چون خطای آن‌ها بیشترین آسیب را دارد. سپس منفی‌ها و شرط‌ها را ببینید؛ «نمی‌شود» و «می‌شود» با یک خطای کوچک معنای مخالف دارند. در مرحلهٔ سوم، مرز گوینده و جمله را اصلاح کنید.

برای فایل فنی، واژه‌نامهٔ کوتاه بسازید. جست‌وجوی همهٔ شکل‌های احتمالی یک اصطلاح کمک می‌کند خطاها را یکجا ببینید. اگر چند زبان در فایل است، بخش‌های تغییر زبان را جداگانه گوش دهید.

هر بخش نامطمئن را با نشان مشخص علامت بزنید، نه این‌که حدس خود را جای صدای اصلی بگذارید. زمان تقریبی آن بخش را ثبت کنید تا شخص دیگری بتواند سریع بررسی کند.

حریم خصوصی و رضایت

صدای انسان دادهٔ شخصی است. پیش از ضبط و ارسال، رضایت افراد و سیاست سازمان را بررسی کنید. جلسهٔ داخلی، اطلاعات پزشکی، شمارهٔ تماس و اطلاعات مشتری را فقط وقتی پردازش کنید که مجوز و نیاز روشن دارید.

فایل را در کانال عمومی به اشتراک نگذارید و متن خروجی را نیز مانند اصل صدا محافظت کنید. تبدیل صدا به متن حساسیت داده را کم نمی‌کند؛ جست‌وجو و کپی متن حتی آسان‌تر است.

برای فایل بسیار حساس، پیش از استفاده از هر سرویس ابری، شرایط نگهداری و الزامات سازمانی را بررسی کنید. این مقاله مجوز حقوقی برای ضبط یا پردازش نیست.

چه چیزهایی هنوز نباید ادعا شود؟

صفحهٔ رسانه هنوز بارگذاری STT را نمایش نمی‌دهد، پس نمی‌توان مسیر کلیک یا گزینه‌های فرمت را به کاربر وعده داد. کد سمت سرور از مدل رونویسی استفاده می‌کند، اما کیفیت فارسی باید با نمونهٔ واقعی خودتان سنجیده شود؛ درصد دقت ثابتی وجود ندارد.

تفکیک خودکار گویندگان، زمان‌کد، زیرنویس آماده و رونویسی زنده نیز در رابط فعلی برای STT مستند نشده‌اند. اگر این موارد برای پروژه ضروری‌اند، وجودشان را فرض نکنید.

همچنین قابلیت داخلی را با API عمومی یکی ندانید. مستند عمومی /docs/api اکنون چت CLI را توضیح می‌دهد، نه endpoint عمومی STT.

آماده‌سازی یک فرایند درست

پیش از در دسترس شدن کنترل عمومی، می‌توانید فرایند سازمانی را آماده کنید: رضایت ضبط، نام‌گذاری فایل، فهرست اصطلاح‌ها، مسئول بازبینی و سیاست حذف. این کار از خود رونویسی مهم‌تر است.

پس از انتشار رابط، با یک فایل کوتاه و غیرحساس آزمایش کنید. متن را با صدا تطبیق دهید، الگوی خطا را پیدا کنید و بعد سراغ فایل بلند بروید. اگر کیفیت مناسب نیست، ضبط را بهتر کنید؛ تکرار پردازش روی همان صدای ضعیف الزاماً نتیجه را عوض نمی‌کند.

برای خروجی نهایی نیز نسخهٔ خام و ویرایش‌شده را جدا نگه دارید. هر تغییر معنایی باید قابل پیگیری باشد.

جمع‌بندی

گفتار به متن فارسی در هستهٔ PiGPT قابلیت واقعی و فعال است، اما رابط عمومی رسانه هنوز فرم STT ندارد. به همین دلیل مسیر ساختگی ارائه نکردیم. استودیوی رسانه را برای وضعیت واقعی ببینید و وقتی کنترل فایل منتشر شد، با صدای کوتاه، رضایت روشن و بازبینی دقیق شروع کنید.