امکانات · ۶ دقیقه مطالعه
گفتار به متن فارسی در PiGPT؛ وضعیت و کاربرد
توضیح صادقانهٔ قابلیت STT PiGPT، بدون ساختن دکمه یا مسیر کاربری که هنوز در صفحهٔ رسانه نیست.
گفتار به متن فارسی یا STT صدای ضبطشده را به متن قابل ویرایش تبدیل میکند. این قابلیت در هستهٔ رسانهٔ PiGPT تعریف و فعال است و مسیر پردازش صوت در سمت سرور وجود دارد. با این حال، صفحهٔ فعلی /app/media هنوز کنترل بارگذاری فایل برای STT را نشان نمیدهد. بنابراین این مقاله یک راهنمای دکمهبهدکمهٔ ساختگی نیست.
آنچه امروز میتوان با اطمینان گفت این است: سرویس احراز هویتشده فایل صوتی را دریافت میکند، آن را برای رونویسی میفرستد و متن برمیگرداند؛ قابلیت stt_studio نیز در فهرست قابلیتهای فعال محصول است. اما تا وقتی ورودی فایل در رابط رسانه منتشر نشده، کاربر عادی نباید انتظار یک دکمهٔ «آپلود صدا» در صفحه داشته باشد.
گفتار به متن دقیقاً چه مسئلهای را حل میکند؟
STT برای تبدیل جلسه، یادداشت صوتی، مصاحبه یا توضیح شفاهی به پیشنویس متنی است. خروجی معمولاً مادهٔ اولیه است، نه متن آمادهٔ انتشار. نامها، عددها، علائم نگارشی و تفکیک گوینده نیاز به بازبینی دارند.
مزیت اصلی، کاهش زمان تایپ اولیه است. اگر یک ساعت گفتوگو دارید، رونویسی ماشینی میتواند متن پایه بسازد تا شما روی اصلاح و استخراج نکته تمرکز کنید. اما صدای نامفهوم یا محیط شلوغ را به واقعیت قطعی تبدیل نمیکند.
برای فرمان زنده یا دستیار صوتی نیز STT بخشی از زنجیره است، ولی وجود رونویسی بهتنهایی به معنای وجود کنترل صوتی کامل نیست. محصول باید ضبط، مجوز میکروفون، ارسال، وضعیت و ویرایش را نیز در رابط فراهم کند.
وضعیت واقعی رابط PiGPT
استودیوی رسانه اکنون بخشهای OCR، متن به صدا، ساخت پرامپت ویرایش تصویر و تایملاین رسانه را نشان میدهد. در کد رابط فعلی فرم مستقلی برای STT وجود ندارد. در سمت سرور، مسیر رسانهٔ STT فایل را میگیرد و متن رونویسیشده برمیگرداند.
این تفاوت مهم است. فعال بودن قابلیت فنی با آماده بودن گردشکار عمومی یکسان نیست. تا وقتی کنترل کاربری منتشر نشده، نباید از مخاطب خواست روی دکمهای کلیک کند که وجود ندارد یا مسیر داخلی را مانند API عمومی مستندشده معرفی کرد.
برای بررسی دسترسی حساب، فهرست استودیوها و پلنها منبع واقعیاند. ماتریس محلی محصول قابلیتهای صوتی را از پلن پلاس به بالا قرار میدهد؛ آنچه خود حساب در اپ نشان میدهد معیار نهایی است.
فایل صوتی مناسب چه ویژگیهایی دارد؟
کیفیت ورودی بیشترین اثر را بر رونویسی دارد. میکروفون را نزدیک گوینده بگذارید، صدای پسزمینه را کم کنید و از ضبطی که چند نفر روی هم صحبت میکنند پرهیز کنید. فرمت و اندازهٔ قابل قبول باید هنگام انتشار رابط از همان صفحه خوانده شود؛ پیش از آن حدس دربارهٔ سقف فایل درست نیست.
در گفتار فارسی، نام خاص، واژهٔ تخصصی، عدد و ترکیب فارسیـانگلیسی میتواند اشتباه شود. پیش از ضبط، فهرست نامها را آماده کنید تا در بازبینی با متن تطبیق دهید. اگر یک اصطلاح حیاتی است، گوینده آن را شمرده و در جملهٔ کامل بیان کند.
جلسهٔ طولانی را به بخشهای منطقی تقسیم کنید. فایلهای کوتاهتر عیبیابی و اصلاح را آسان میکنند. زمان و موضوع هر بخش را در نام فایل خودتان ثبت کنید، بدون قرار دادن دادهٔ حساس غیرضروری.
چه انتظاری از خروجی داشته باشیم؟
خروجی STT متن است، نه صورتجلسهٔ کامل. رونویسی ممکن است مکث، تکرار و جملهٔ نیمهکاره را همانطور بیاورد یا علائم را به شکل متفاوت حدس بزند. نخست یک نسخهٔ وفادار نگه دارید و سپس نسخهٔ خوانا بسازید.
برای جلسه، بعد از رونویسی میتوانید متن را در گفتگو قرار دهید و درخواست کنید تصمیمها، اقدامها، مسئول و موعد جدا شوند. مدل نباید مسئول یا تاریخی را که در متن نیست بسازد. اصول خلاصهسازی متن فارسی برای همین مرحله مناسب است.
برای مصاحبه، حذف تکیهکلام باید با حفظ معنی انجام شود. نقل قولی که قرار است منتشر شود باید دوباره با فایل صوتی تطبیق داده شود. متن روانشده ممکن است ناخواسته لحن یا قطعیت گوینده را تغییر دهد.
بازبینی رونویسی فارسی
بازبینی را با نامها و عددها شروع کنید، چون خطای آنها بیشترین آسیب را دارد. سپس منفیها و شرطها را ببینید؛ «نمیشود» و «میشود» با یک خطای کوچک معنای مخالف دارند. در مرحلهٔ سوم، مرز گوینده و جمله را اصلاح کنید.
برای فایل فنی، واژهنامهٔ کوتاه بسازید. جستوجوی همهٔ شکلهای احتمالی یک اصطلاح کمک میکند خطاها را یکجا ببینید. اگر چند زبان در فایل است، بخشهای تغییر زبان را جداگانه گوش دهید.
هر بخش نامطمئن را با نشان مشخص علامت بزنید، نه اینکه حدس خود را جای صدای اصلی بگذارید. زمان تقریبی آن بخش را ثبت کنید تا شخص دیگری بتواند سریع بررسی کند.
حریم خصوصی و رضایت
صدای انسان دادهٔ شخصی است. پیش از ضبط و ارسال، رضایت افراد و سیاست سازمان را بررسی کنید. جلسهٔ داخلی، اطلاعات پزشکی، شمارهٔ تماس و اطلاعات مشتری را فقط وقتی پردازش کنید که مجوز و نیاز روشن دارید.
فایل را در کانال عمومی به اشتراک نگذارید و متن خروجی را نیز مانند اصل صدا محافظت کنید. تبدیل صدا به متن حساسیت داده را کم نمیکند؛ جستوجو و کپی متن حتی آسانتر است.
برای فایل بسیار حساس، پیش از استفاده از هر سرویس ابری، شرایط نگهداری و الزامات سازمانی را بررسی کنید. این مقاله مجوز حقوقی برای ضبط یا پردازش نیست.
چه چیزهایی هنوز نباید ادعا شود؟
صفحهٔ رسانه هنوز بارگذاری STT را نمایش نمیدهد، پس نمیتوان مسیر کلیک یا گزینههای فرمت را به کاربر وعده داد. کد سمت سرور از مدل رونویسی استفاده میکند، اما کیفیت فارسی باید با نمونهٔ واقعی خودتان سنجیده شود؛ درصد دقت ثابتی وجود ندارد.
تفکیک خودکار گویندگان، زمانکد، زیرنویس آماده و رونویسی زنده نیز در رابط فعلی برای STT مستند نشدهاند. اگر این موارد برای پروژه ضروریاند، وجودشان را فرض نکنید.
همچنین قابلیت داخلی را با API عمومی یکی ندانید. مستند عمومی /docs/api اکنون چت CLI را توضیح میدهد، نه endpoint عمومی STT.
آمادهسازی یک فرایند درست
پیش از در دسترس شدن کنترل عمومی، میتوانید فرایند سازمانی را آماده کنید: رضایت ضبط، نامگذاری فایل، فهرست اصطلاحها، مسئول بازبینی و سیاست حذف. این کار از خود رونویسی مهمتر است.
پس از انتشار رابط، با یک فایل کوتاه و غیرحساس آزمایش کنید. متن را با صدا تطبیق دهید، الگوی خطا را پیدا کنید و بعد سراغ فایل بلند بروید. اگر کیفیت مناسب نیست، ضبط را بهتر کنید؛ تکرار پردازش روی همان صدای ضعیف الزاماً نتیجه را عوض نمیکند.
برای خروجی نهایی نیز نسخهٔ خام و ویرایششده را جدا نگه دارید. هر تغییر معنایی باید قابل پیگیری باشد.
جمعبندی
گفتار به متن فارسی در هستهٔ PiGPT قابلیت واقعی و فعال است، اما رابط عمومی رسانه هنوز فرم STT ندارد. به همین دلیل مسیر ساختگی ارائه نکردیم. استودیوی رسانه را برای وضعیت واقعی ببینید و وقتی کنترل فایل منتشر شد، با صدای کوتاه، رضایت روشن و بازبینی دقیق شروع کنید.