راهنما · ۶ دقیقه مطالعه
تبدیل متن فارسی به صدا در PiGPT
مسیر واقعی ساخت MP3 از متن در استودیوی رسانه، همراه با روش آمادهسازی و کنترل کیفیت شنیداری.
تبدیل متن فارسی به صدا یا TTS برای ساخت نسخهٔ شنیداری یک متن، پیشنویس نریشن یا نمونهٔ صداگذاری کاربرد دارد. در استودیوی رسانهٔ PiGPT بخش «صداگذاری» واقعاً وجود دارد: متن را وارد میکنید، راوی را از گزینههای صفحه انتخاب میکنید و پس از ساخت، فایل صوتی MP3 در حساب ایجاد میشود.
کیفیت خروجی فقط به موتور صدا وابسته نیست. جملهبندی، علائم نگارشی، شکل نوشتن عدد و واژهٔ غیرفارسی بر مکث و تلفظ اثر دارد. به همین دلیل متن آمادهٔ خواندن با متن آمادهٔ چاپ یکسان نیست.
مسیر واقعی متن به صدا
از استودیوها وارد «رسانه» شوید یا مستقیم /app/media را باز کنید. در کارت «صداگذاری» گزینهٔ راوی و حالت ارائه دیده میشود و یک کادر متن دارد. کد فعلی درخواست را با سرعت استاندارد میفرستد و نتیجه را بهصورت دارایی صوتی MP3 ذخیره میکند.
قابلیت TTS و خود استودیوی رسانه باید برای حساب فعال باشند. در ماتریس محصول، قابلیتهای TTS از پلن پلاس به بالا قرار دارند؛ صفحهٔ پلنها و وضعیت داخل اپ معیار نهایی دسترسی شماست.
پس از زدن «ساخت صدا»، منتظر پیام نتیجه بمانید. دکمه را پشتسرهم نزنید؛ هر درخواست میتواند فایل جدا بسازد. ابتدا با نمونهٔ کوتاه آزمایش کنید و بعد متن کامل را بفرستید.
متن را برای شنیدن بازنویسی کنید
متن نوشتاری اغلب جملههای بلند، پرانتز و ارجاع دیداری دارد. شنونده نمیتواند به ابتدای پاراگراف برگردد. جملهها را کوتاه کنید، یک ایده را در هر جمله نگه دارید و عبارتهایی مثل «جدول زیر» را به توضیح شنیداری تبدیل کنید.
علائم نگارشی برای مکث مهماند. نقطه پایان روشن میسازد؛ ویرگول مکث کوتاه میدهد. استفادهٔ افراطی از سهنقطه یا خط تیره میتواند ریتم را نامنظم کند. متن را یکبار با صدای خودتان بخوانید؛ جایی که نفس کم میآورید، جمله احتمالاً برای TTS نیز سنگین است.
برای آمادهسازی پیشنویس میتوانید از استودیوی نوشتن کمک بگیرید، اما نسخهٔ نهایی را خودتان برای شنیدن ویرایش کنید. مدل نباید واقعیت یا نام محصول را هنگام روانسازی عوض کند.
عدد، تاریخ و نشانی را چگونه بنویسیم؟
عدد ممکن است رقمبهرقم یا بهصورت مقدار خوانده شود. اگر تلفظ دقیق مهم است، شکل نوشتاری را با یک نمونهٔ کوتاه آزمایش کنید. برای شمارهٔ تلفن یا کد، فاصله و گروهبندی روشن بگذارید. برای مبلغ، واحد را کامل بنویسید.
تاریخهای عددی میتوانند مبهم باشند. «۱۴۰۵/۰۶/۱۲» را به شکل گفتاری روشن مثل «دوازدهم شهریور هزار و چهارصد و پنج» تبدیل کنید، اگر همین معنا مدنظر است. ساعت و درصد را نیز با واژهٔ واحد همراه کنید.
URL، ایمیل و رشتهٔ فنی معمولاً برای شنیدن خوشآهنگ نیستند. در نریشن، بهجای خواندن کامل نشانی، مقصد را بگویید؛ مثلاً «به وبسایت PiGPT مراجعه کنید». اگر خود نشانی لازم است، آن را جدا و شمرده آماده کنید.
واژههای فارسی و غیرفارسی
نام خاص و واژهٔ خارجی بیشترین نیاز به آزمون دارند. املای رایج فارسی را امتحان کنید و در صورت لزوم واژه را آوانویسی کنید. یک روش ثابت برای کل متن انتخاب کنید؛ نوشتن یک نام به دو شکل، دو تلفظ متفاوت میسازد.
اعرابگذاری محدود میتواند ابهام برخی واژهها را کم کند، اما متن را شلوغ نکنید. ابتدا فقط واژهٔ مشکلدار را در یک جملهٔ نمونه بسازید. سپس همان شکل موفق را در متن کامل جایگزین کنید.
کلمات اختصاری را بر اساس کاربرد بنویسید. بعضی باید حرفبهحرف خوانده شوند و برخی مانند یک واژه. خروجی را با مخاطب واقعی بسنجید، نه فقط با درست بودن فنی.
انتخاب راوی و لحن
رابط فعلی دو گزینهٔ راوی نمایشی دارد و حالتهایی مانند confident، warm و urgent در صفحه دیده میشوند. درخواست سمت سرور از صدای انتخابشده و سرعت استفاده میکند، اما همهٔ کنترلهای ظاهری صفحه لزوماً به یک ویژگی شنیداری تضمینشده تبدیل نمیشوند. نتیجه را با گوش ارزیابی کنید.
راوی را بر اساس موضوع انتخاب کنید، نه جنسیت یا شهرت فرضی. یک متن آموزشی به وضوح و ریتم یکنواخت نیاز دارد؛ اعلان اضطراری کوتاه است؛ روایت داستانی مکث و تنوع بیشتری میخواهد.
برای مقایسه، یک پاراگراف ثابت را با گزینههای موجود بسازید. اگر متن میان نمونهها تغییر کند، نمیفهمید تفاوت از راوی است یا محتوا.
کنترل کیفیت فایل صوتی
اول تلفظ نام، عدد و واژهٔ تخصصی را بررسی کنید. دوم، مکثهای ناخواسته و جملههای بههمچسبیده را پیدا کنید. سوم، بلندی و وضوح را با هدفون و بلندگوی معمولی بشنوید. چهارم، متن را همزمان دنبال کنید تا افتادگی یا تغییر را تشخیص دهید.
اگر یک جمله مشکل دارد، کل متن را بدون تغییر دوباره نسازید. همان جمله را سادهتر و کوتاهتر کنید. گاهی افزودن نقطه یا نوشتن شکل کامل واژه مشکل را حل میکند.
فایل نهایی را با ابزار مناسب مقصد تنظیم کنید؛ برش سکوت، سطح صدا و موسیقی پسزمینه جزو رابط TTS فعلی نیستند. صدای خروجی را قبل از انتشار با استاندارد کانال خود تطبیق دهید.
کاربردهای مناسب و نامناسب
کاربردهای مناسب شامل نسخهٔ شنیداری مقاله، پیشنویس نریشن آموزشی، راهنمای کوتاه محصول و نمونهٔ تلفظ است. برای هرکدام متن باید مخصوص شنیدن آماده شود.
ساخت صدای منتسب به یک فرد واقعی یا تقلید هویت او موضوع دیگری است. قابلیت فعلی TTS از راویهای سرویس استفاده میکند و نباید بهعنوان شبیهسازی صدای شخص معرفی شود. رضایت و حق استفاده از محتوا را نیز رعایت کنید.
برای اعلان پزشکی، حقوقی یا ایمنی، بازبینی متخصص ضروری است. صدای روان نشانهٔ درست بودن محتوا نیست.
حریم خصوصی و هزینه
متن ارسالی ممکن است حاوی نام یا اطلاعات محرمانه باشد. فقط بخش لازم را وارد کنید و دادهٔ شخصی غیرضروری را حذف کنید. نسخهٔ صوتی نیز میتواند همان اطلاعات را افشا کند، پس دسترسی به فایل خروجی را مدیریت کنید.
ابتدا نمونهٔ کوتاه بسازید تا توکن و زمان برای متن نامناسب مصرف نشود. متن بسیار بلند را به بخشهای منطقی تقسیم کنید، ولی سبک و تلفظ نامها را میان بخشها ثابت نگه دارید.
فهرستی از نسخهها نگه دارید: متن، راوی، تاریخ و وضعیت تأیید. این کار مانع انتشار فایل آزمایشی اشتباه میشود.
چکلیست پیش از ساخت
- متن برای شنیدن بازنویسی شده است.
- جملههای بلند شکسته شدهاند.
- عدد، تاریخ و واحد شکل گفتاری روشن دارند.
- نامها و واژههای خارجی با نمونهٔ کوتاه آزموده شدهاند.
- راوی با یک پاراگراف ثابت مقایسه شده است.
- خروجی از نظر تلفظ، مکث و افتادگی با متن کنترل میشود.
- فایل نهایی پیش از انتشار در دستگاه معمول مخاطب شنیده میشود.
جمعبندی
تبدیل متن فارسی به صدا در PiGPT از بخش «صداگذاری» استودیوی رسانه انجام میشود و خروجی MP3 میسازد. نتیجهٔ خوب از متن شنیداری روشن شروع میشود. یک پاراگراف کوتاه را آماده کنید، تلفظهای حساس را بسنجید و فقط پس از بازبینی سراغ متن کامل بروید.