راهنما · ۶ دقیقه مطالعه

تبدیل متن فارسی به صدا در PiGPT

مسیر واقعی ساخت MP3 از متن در استودیوی رسانه، همراه با روش آماده‌سازی و کنترل کیفیت شنیداری.

صفحه‌های کاغذی که از یک سازوکار بلندگو عبور می‌کنند و به موج صدا تبدیل می‌شوند

تبدیل متن فارسی به صدا یا TTS برای ساخت نسخهٔ شنیداری یک متن، پیش‌نویس نریشن یا نمونهٔ صداگذاری کاربرد دارد. در استودیوی رسانهٔ PiGPT بخش «صداگذاری» واقعاً وجود دارد: متن را وارد می‌کنید، راوی را از گزینه‌های صفحه انتخاب می‌کنید و پس از ساخت، فایل صوتی MP3 در حساب ایجاد می‌شود.

کیفیت خروجی فقط به موتور صدا وابسته نیست. جمله‌بندی، علائم نگارشی، شکل نوشتن عدد و واژهٔ غیرفارسی بر مکث و تلفظ اثر دارد. به همین دلیل متن آمادهٔ خواندن با متن آمادهٔ چاپ یکسان نیست.

مسیر واقعی متن به صدا

از استودیوها وارد «رسانه» شوید یا مستقیم /app/media را باز کنید. در کارت «صداگذاری» گزینهٔ راوی و حالت ارائه دیده می‌شود و یک کادر متن دارد. کد فعلی درخواست را با سرعت استاندارد می‌فرستد و نتیجه را به‌صورت دارایی صوتی MP3 ذخیره می‌کند.

قابلیت TTS و خود استودیوی رسانه باید برای حساب فعال باشند. در ماتریس محصول، قابلیت‌های TTS از پلن پلاس به بالا قرار دارند؛ صفحهٔ پلن‌ها و وضعیت داخل اپ معیار نهایی دسترسی شماست.

پس از زدن «ساخت صدا»، منتظر پیام نتیجه بمانید. دکمه را پشت‌سرهم نزنید؛ هر درخواست می‌تواند فایل جدا بسازد. ابتدا با نمونهٔ کوتاه آزمایش کنید و بعد متن کامل را بفرستید.

متن را برای شنیدن بازنویسی کنید

متن نوشتاری اغلب جمله‌های بلند، پرانتز و ارجاع دیداری دارد. شنونده نمی‌تواند به ابتدای پاراگراف برگردد. جمله‌ها را کوتاه کنید، یک ایده را در هر جمله نگه دارید و عبارت‌هایی مثل «جدول زیر» را به توضیح شنیداری تبدیل کنید.

علائم نگارشی برای مکث مهم‌اند. نقطه پایان روشن می‌سازد؛ ویرگول مکث کوتاه می‌دهد. استفادهٔ افراطی از سه‌نقطه یا خط تیره می‌تواند ریتم را نامنظم کند. متن را یک‌بار با صدای خودتان بخوانید؛ جایی که نفس کم می‌آورید، جمله احتمالاً برای TTS نیز سنگین است.

برای آماده‌سازی پیش‌نویس می‌توانید از استودیوی نوشتن کمک بگیرید، اما نسخهٔ نهایی را خودتان برای شنیدن ویرایش کنید. مدل نباید واقعیت یا نام محصول را هنگام روان‌سازی عوض کند.

عدد، تاریخ و نشانی را چگونه بنویسیم؟

عدد ممکن است رقم‌به‌رقم یا به‌صورت مقدار خوانده شود. اگر تلفظ دقیق مهم است، شکل نوشتاری را با یک نمونهٔ کوتاه آزمایش کنید. برای شمارهٔ تلفن یا کد، فاصله و گروه‌بندی روشن بگذارید. برای مبلغ، واحد را کامل بنویسید.

تاریخ‌های عددی می‌توانند مبهم باشند. «۱۴۰۵/۰۶/۱۲» را به شکل گفتاری روشن مثل «دوازدهم شهریور هزار و چهارصد و پنج» تبدیل کنید، اگر همین معنا مدنظر است. ساعت و درصد را نیز با واژهٔ واحد همراه کنید.

URL، ایمیل و رشتهٔ فنی معمولاً برای شنیدن خوش‌آهنگ نیستند. در نریشن، به‌جای خواندن کامل نشانی، مقصد را بگویید؛ مثلاً «به وب‌سایت PiGPT مراجعه کنید». اگر خود نشانی لازم است، آن را جدا و شمرده آماده کنید.

واژه‌های فارسی و غیرفارسی

نام خاص و واژهٔ خارجی بیشترین نیاز به آزمون دارند. املای رایج فارسی را امتحان کنید و در صورت لزوم واژه را آوانویسی کنید. یک روش ثابت برای کل متن انتخاب کنید؛ نوشتن یک نام به دو شکل، دو تلفظ متفاوت می‌سازد.

اعراب‌گذاری محدود می‌تواند ابهام برخی واژه‌ها را کم کند، اما متن را شلوغ نکنید. ابتدا فقط واژهٔ مشکل‌دار را در یک جملهٔ نمونه بسازید. سپس همان شکل موفق را در متن کامل جایگزین کنید.

کلمات اختصاری را بر اساس کاربرد بنویسید. بعضی باید حرف‌به‌حرف خوانده شوند و برخی مانند یک واژه. خروجی را با مخاطب واقعی بسنجید، نه فقط با درست بودن فنی.

انتخاب راوی و لحن

رابط فعلی دو گزینهٔ راوی نمایشی دارد و حالت‌هایی مانند confident، warm و urgent در صفحه دیده می‌شوند. درخواست سمت سرور از صدای انتخاب‌شده و سرعت استفاده می‌کند، اما همهٔ کنترل‌های ظاهری صفحه لزوماً به یک ویژگی شنیداری تضمین‌شده تبدیل نمی‌شوند. نتیجه را با گوش ارزیابی کنید.

راوی را بر اساس موضوع انتخاب کنید، نه جنسیت یا شهرت فرضی. یک متن آموزشی به وضوح و ریتم یکنواخت نیاز دارد؛ اعلان اضطراری کوتاه است؛ روایت داستانی مکث و تنوع بیشتری می‌خواهد.

برای مقایسه، یک پاراگراف ثابت را با گزینه‌های موجود بسازید. اگر متن میان نمونه‌ها تغییر کند، نمی‌فهمید تفاوت از راوی است یا محتوا.

کنترل کیفیت فایل صوتی

اول تلفظ نام، عدد و واژهٔ تخصصی را بررسی کنید. دوم، مکث‌های ناخواسته و جمله‌های به‌هم‌چسبیده را پیدا کنید. سوم، بلندی و وضوح را با هدفون و بلندگوی معمولی بشنوید. چهارم، متن را هم‌زمان دنبال کنید تا افتادگی یا تغییر را تشخیص دهید.

اگر یک جمله مشکل دارد، کل متن را بدون تغییر دوباره نسازید. همان جمله را ساده‌تر و کوتاه‌تر کنید. گاهی افزودن نقطه یا نوشتن شکل کامل واژه مشکل را حل می‌کند.

فایل نهایی را با ابزار مناسب مقصد تنظیم کنید؛ برش سکوت، سطح صدا و موسیقی پس‌زمینه جزو رابط TTS فعلی نیستند. صدای خروجی را قبل از انتشار با استاندارد کانال خود تطبیق دهید.

کاربردهای مناسب و نامناسب

کاربردهای مناسب شامل نسخهٔ شنیداری مقاله، پیش‌نویس نریشن آموزشی، راهنمای کوتاه محصول و نمونهٔ تلفظ است. برای هرکدام متن باید مخصوص شنیدن آماده شود.

ساخت صدای منتسب به یک فرد واقعی یا تقلید هویت او موضوع دیگری است. قابلیت فعلی TTS از راوی‌های سرویس استفاده می‌کند و نباید به‌عنوان شبیه‌سازی صدای شخص معرفی شود. رضایت و حق استفاده از محتوا را نیز رعایت کنید.

برای اعلان پزشکی، حقوقی یا ایمنی، بازبینی متخصص ضروری است. صدای روان نشانهٔ درست بودن محتوا نیست.

حریم خصوصی و هزینه

متن ارسالی ممکن است حاوی نام یا اطلاعات محرمانه باشد. فقط بخش لازم را وارد کنید و دادهٔ شخصی غیرضروری را حذف کنید. نسخهٔ صوتی نیز می‌تواند همان اطلاعات را افشا کند، پس دسترسی به فایل خروجی را مدیریت کنید.

ابتدا نمونهٔ کوتاه بسازید تا توکن و زمان برای متن نامناسب مصرف نشود. متن بسیار بلند را به بخش‌های منطقی تقسیم کنید، ولی سبک و تلفظ نام‌ها را میان بخش‌ها ثابت نگه دارید.

فهرستی از نسخه‌ها نگه دارید: متن، راوی، تاریخ و وضعیت تأیید. این کار مانع انتشار فایل آزمایشی اشتباه می‌شود.

چک‌لیست پیش از ساخت

  • متن برای شنیدن بازنویسی شده است.
  • جمله‌های بلند شکسته شده‌اند.
  • عدد، تاریخ و واحد شکل گفتاری روشن دارند.
  • نام‌ها و واژه‌های خارجی با نمونهٔ کوتاه آزموده شده‌اند.
  • راوی با یک پاراگراف ثابت مقایسه شده است.
  • خروجی از نظر تلفظ، مکث و افتادگی با متن کنترل می‌شود.
  • فایل نهایی پیش از انتشار در دستگاه معمول مخاطب شنیده می‌شود.

جمع‌بندی

تبدیل متن فارسی به صدا در PiGPT از بخش «صداگذاری» استودیوی رسانه انجام می‌شود و خروجی MP3 می‌سازد. نتیجهٔ خوب از متن شنیداری روشن شروع می‌شود. یک پاراگراف کوتاه را آماده کنید، تلفظ‌های حساس را بسنجید و فقط پس از بازبینی سراغ متن کامل بروید.