مجله ایرانیکاسرور آموزش سرور، هاست، وردپرس و شبکه پنل کاربری

راه‌اندازی سیستم تبدیل متن به گفتار (TTS) روی سرور شخصی؛ جایگزین هوشمند APIهای گران‌قیمت

فناوری تبدیل متن به گفتار (Text-to-Speech) امروزه از یک قابلیت لوکس فراتر رفته و به بخش جدانشدنی دستیارهای صوتی، تولید محتوای ویدیویی، پادکست‌های خودکار و سیستم‌های پاسخگوی سازمانی تبدیل شده است. بسیاری از کسب‌وکارها…

✍ Amir Jabbari 📅 6 مهر 1405 ⏱ 8 دقیقه مطالعه 👁 14 بازدید 💬 0 دیدگاه

فناوری تبدیل متن به گفتار (Text-to-Speech) امروزه از یک قابلیت لوکس فراتر رفته و به بخش جدانشدنی دستیارهای صوتی، تولید محتوای ویدیویی، پادکست‌های خودکار و سیستم‌های پاسخگوی سازمانی تبدیل شده است. بسیاری از کسب‌وکارها برای شروع از سرویس‌های ابری مانند Google Cloud Text-to-Speech یا Amazon Polly استفاده می‌کنند، غافل از اینکه با رشد مقیاس پروژه، هزینه هر کاراکتر به سرعت افزایش می‌یابد و داده‌های متنی حساس شما از سرور خارج می‌شود.

خبر خوب این است که با پیشرفت مدل‌های متن‌باز، امروز می‌توانید یک سرور TTS کاملاً شخصی روی سرور مجازی (VPS) خود داشته باشید؛ بدون وابستگی به API خارجی، بدون محدودیت درخواست و با کنترل کامل بر داده‌ها. در این راهنمای جامع، علاوه بر معرفی مدل‌های برتر، نحوه نصب، پیکربندی و ساخت یک API اختصاصی را به‌صورت گام‌به‌گام آموزش می‌دهیم.

📌 نکته کلیدی قبل از شروع: راه‌اندازی TTS روی سرور شخصی نه‌تنها هزینه‌های ماهانه شما را به یک رقم ثابت و قابل پیش‌بینی تبدیل می‌کند، بلکه حریم خصوصی کامل داده‌های متنی و صوتی را تضمین می‌نماید. این موضوع برای پروژه‌های سازمانی، آموزشی و پشتیبانی مشتریان یک مزیت رقابتی جدی محسوب می‌شود.

TTS چیست و چرا باید روی سرور شخصی اجرا شود؟

تبدیل متن به گفتار فرآیندی است که در آن یک مدل هوش مصنوعی، متن ورودی را تحلیل کرده و آن را به موج صوتی قابل پخش تبدیل می‌کند. برخلاف سیستم‌های قدیمی که بر پایه قوانین ثابت کار می‌کردند، مدل‌های عصبی امروزی قادرند لحن طبیعی، مکث‌های هوشمند و حتی احساسات را در صدای تولیدشده شبیه‌سازی کنند.

اجرای این سیستم روی یک سرور مجازی چند مزیت اساسی دارد:

🔹 حذف هزینه‌های متغیر: به‌جای پرداخت به‌ازای هر کاراکتر، فقط هزینه ثابت سرور را می‌پردازید.

🔹 حریم خصوصی کامل: متن‌های سازمانی و اطلاعات مشتریان هرگز از سرور شما خارج نمی‌شوند.

🔹 API اختصاصی: می‌توانید سرویسی مشابه APIهای تجاری بسازید و آن را به سایت، اپلیکیشن یا ربات تلگرام متصل کنید.

🔹 مقیاس‌پذیری: با ارتقای منابع سرور، ظرفیت پردازش خود را بدون تغییر کد افزایش دهید.

مقایسه بهترین مدل‌های متن‌باز TTS در سال ۲۰۲۶

انتخاب مدل مناسب، مهم‌ترین تصمیم در راه‌اندازی سرور TTS است. عوامل مؤثر عبارتند از: کیفیت صدا، سرعت تولید، میزان مصرف RAM، پشتیبانی از زبان فارسی و نیاز یا عدم نیاز به GPU. جدول زیر مقایسه دقیقی از گزینه‌های برتر ارائه می‌دهد.

مدل حجم مدل نیاز به GPU پشتیبانی فارسی مناسب برای
Kokoro ۸۲ میلیون پارامتر خیر (CPU کافی است) خیر (انگلیسی و چند زبان دیگر) سرعت بالا، مصرف کم
Piper TTS حدود ۶۰ مگابایت خیر (طراحی‌شده برای CPU) محدود (مدل‌های فارسی موجود است) VPS معمولی، ربات تلگرام
Coqui TTS (XTTS-v2) حدود ۱.۸ میلیارد پارامتر توصیه‌شده (CPU کند است) بله (۱۷ زبان از جمله فارسی) تولید صدای طبیعی، کلونینگ صدا
Chatterbox متوسط خیر (CPU قابل قبول) خیر (انگلیسی) کلونینگ صدا، کنترل احساسات
Gooya (فارسی) حدود ۹ میلیون پارامتر خیر (کاملاً CPU) بله (اختصاصی فارسی) پروژه‌های فارسی‌زبان با منابع محدود

⚠️ توجه: برای پروژه‌های فارسی‌زبان که روی VPS معمولی اجرا می‌شوند، مدل Gooya یا مدل‌های ONNX بهینه‌شده Persian TTS انتخاب هوشمندانه‌ای هستند، زیرا بدون نیاز به GPU کار می‌کنند و کیفیت قابل قبولی ارائه می‌دهند .

سخت‌افزار مورد نیاز برای TTS روی سرور مجازی

نیاز سخت‌افزاری مستقیماً به مدل انتخابی شما بستگی دارد. برای مدل‌های سبک مانند Piper یا Gooya، یک VPS معمولی با منابع متوسط کافی است. اما اگر قصد استفاده از مدل‌های سنگین مانند XTTS-v2 یا Bark را دارید، باید سروری با رم بالا یا GPU در نظر بگیرید.

⚠️ حداقل منابع برای مدل‌های سبک (Piper / Gooya):

🔹 پردازنده: ۲ هسته

🔹 رم: ۴ گیگابایت

🔹 فضای ذخیره‌سازی: ۲۰ گیگابایت SSD

⚠️ منابع پیشنهادی برای مدل‌های سنگین (XTTS-v2):

🔹 پردازنده: ۸ هسته

🔹 رم: ۱۶ گیگابایت یا بیشتر

🔹 GPU: NVIDIA با حداقل ۶ گیگابایت VRAM (اختیاری اما توصیه‌شده)

🔹 فضای ذخیره‌سازی: SSD NVMe

🚀 پروژه TTS خود را روی سرور پایدار اجرا کنید

برای اجرای مداوم سیستم تبدیل متن به گفتار، به یک سرور مجازی با آپ‌تایم بالا و منابع اختصاصی نیاز دارید. ایرانیکاسرور با ارائه VPS ایران و خارج، پهنای باند مناسب و پشتیبانی ۲۴ ساعته، بستر ایده‌آلی برای میزبانی سرویس‌های هوش مصنوعی فراهم می‌کند. منابع CPU و RAM اختصاصی، تضمین‌کننده پردازش روان مدل‌های TTS بدون افت سرعت است.

📞 تماس با پشتیبانی: 021-91302460 | ایرانیکاسرور

آموزش نصب Piper TTS روی VPS اوبونتو (گام‌به‌گام)

مدل Piper به دلیل سبک بودن و اجرای روان روی CPU، گزینه ایده‌آلی برای شروع است. در این بخش نصب آن را روی Ubuntu 22.04/24.04 آموزش می‌دهیم.

گام ۱: به‌روزرسانی سیستم و نصب پیش‌نیازها

ابتدا سیستم را به‌روزرسانی کرده و پایتون را نصب کنید:

sudo apt update
sudo apt upgrade -y
sudo apt install python3 python3-pip python3-venv -y

گام ۲: ساخت محیط مجازی و نصب Piper

برای جلوگیری از تداخل پکیج‌ها، یک محیط مجازی بسازید:

mkdir piper-tts
cd piper-tts
python3 -m venv venv
source venv/bin/activate
pip install piper-tts

گام ۳: دانلود مدل صوتی و تست

یک مدل فارسی یا انگلیسی دانلود کنید و یک تست ساده بگیرید:

# دانلود یک مدل نمونه (انگلیسی)
wget https://huggingface.co/rhasspy/piper-voices/resolve/main/en/en_US/lessac/medium/en_US-lessac-medium.onnx
wget https://huggingface.co/rhasspy/piper-voices/resolve/main/en/en_US/lessac/medium/en_US-lessac-medium.onnx.json

# تبدیل متن به گفتار
echo “Hello from my private AI server” | piper –model en_US-lessac-medium.onnx –output_file test.wav

اگر فایل test.wav ساخته شد، نصب شما با موفقیت انجام شده است.

ساخت API اختصاصی برای سیستم TTS

برای استفاده در وب‌سایت، اپلیکیشن موبایل یا ربات، بهتر است یک API بسازید تا درخواست‌ها را دریافت و فایل صوتی را برگرداند. در ادامه یک نمونه ساده با Flask ارائه می‌شود.

نصب Flask و ایجاد فایل API

pip install flask

سپس فایل app.py را با محتوای زیر ایجاد کنید:

from flask import Flask, request, send_file
import subprocess
import os

app = Flask(__name__)

@app.route(“/tts”, methods=[“POST”])
def generate():
text = request.json[“text”]
output_file = “output.wav”
subprocess.run([
“piper”,
“–model”, “en_US-lessac-medium.onnx”,
“–output_file”, output_file
], input=text.encode(), check=True)
return send_file(output_file, mimetype=”audio/wav”)

if __name__ == “__main__”:
app.run(host=”0.0.0.0″, port=5000)

با اجرای این کد، API شما روی آدرس http://SERVER-IP:5000/tts در دسترس خواهد بود. می‌توانید با ارسال یک درخواست POST شامل JSON {“text”:”سلام”} فایل صوتی را دریافت کنید.

اجرای دائمی سرویس با Systemd

برای اینکه سرویس TTS پس از ری‌استارت سرور به‌طور خودکار اجرا شود، از Systemd استفاده کنید.

sudo nano /etc/systemd/system/tts.service

محتوای فایل را به‌صورت زیر تنظیم کنید:

[Unit]
Description=AI Text To Speech Server
After=network.target

[Service]
User=root
WorkingDirectory=/root/piper-tts
ExecStart=/root/piper-tts/venv/bin/python app.py
Restart=always

[Install]
WantedBy=multi-user.target

سپس سرویس را فعال و اجرا کنید:

sudo systemctl daemon-reload
sudo systemctl enable tts
sudo systemctl start tts
sudo systemctl status tts

مشکلات رایج و راه‌حل‌های عملی

مشکل ۱: خطای Killed هنگام بارگذاری مدل

این خطا نشان‌دهنده کمبود RAM است. راه‌حل: فایل Swap ایجاد کنید یا منابع سرور را ارتقا دهید. دستور ساخت Swap به‌صورت زیر است:

sudo fallocate -l 4G /swapfile
sudo chmod 600 /swapfile
sudo mkswap /swapfile
sudo swapon /swapfile

مشکل ۲: سرعت پایین تولید صدا

دلایل اصلی: ضعف CPU، انتخاب مدل سنگین یا نبود GPU. راه‌حل: از مدل‌های سبک مانند Piper استفاده کنید یا به سروری با منابع بیشتر مهاجرت نمایید.

مشکل ۳: کیفیت پایین صدای فارسی

استفاده از مدل‌های اختصاصی فارسی مانند Gooya یا Persian TTS که روی CPU اجرا می‌شوند، کیفیت بهتری ارائه می‌دهد .

ترکیب Voice AI کامل روی سرور شخصی

یک سیستم Voice AI حرفه‌ای ترکیبی از سه بخش است:

🔹 Speech-to-Text: تبدیل صدای کاربر به متن با مدل Whisper

🔹 LLM: پردازش متن و تولید پاسخ با یک مدل زبانی محلی

🔹 Text-to-Speech: تبدیل پاسخ متنی به صدای طبیعی (موضوع همین مقاله)

با ترکیب این سه ماژول، می‌توانید یک دستیار صوتی کاملاً اختصاصی بسازید که بدون وابستگی به سرویس‌های ابری کار می‌کند.

⚙️ نیاز به کانفیگ سرور برای پروژه TTS دارید؟

اگر در انتخاب منابع سرور، نصب مدل‌ها یا پیکربندی API سؤال یا مشکلی دارید، کارشناسان ایرانیکاسرور آماده کمک هستند. کافی است درخواست خود را ارسال کنید تا بر اساس نیاز پروژه، بهترین کانفیگ پیشنهاد شود.

📞 تماس با پشتیبانی: 021-91302460 | ایرانیکاسرور

جمع‌بندی

راه‌اندازی سیستم تبدیل متن به گفتار هوش مصنوعی روی سرور مجازی شخصی یک سرمایه‌گذاری هوشمندانه برای کسب‌وکارها و توسعه‌دهندگانی است که به دنبال حذف هزینه‌های متغیر API، حفظ حریم خصوصی داده‌ها و ساخت سرویس اختصاصی خود هستند. با ابزارهایی مانند Piper، Coqui TTS و مدل‌های فارسی سبک، می‌توانید حتی روی یک VPS معمولی نیز سرویس صوتی باکیفیت راه‌اندازی کنید.

انتخاب سرور مناسب با منابع کافی (RAM، CPU و در صورت نیاز GPU) مستقیماً بر کیفیت و سرعت تولید صدا تأثیر می‌گذارد. برای پروژه‌های کوچک، VPS معمولی کافی است؛ اما برای مدل‌های حرفه‌ای و تولید انبوه، ارتقا به سرور اختصاصی یا GPU سرور توصیه می‌شود.

با راه‌اندازی سرویس TTS شخصی، می‌توانید آن را به سایت وردپرس، اپلیکیشن موبایل، ربات تلگرام یا سیستم پشتیبانی مشتریان متصل کرده و یک تجربه تعاملی مدرن برای کاربران خود بسازید.

این آموزش برایت مفید بود؟ می‌توانی لینک آن را ذخیره یا برای دیگران ارسال کنی.

Amir Jabbari

نویسنده مجله ایرانیکاسرور؛ منتشرکننده آموزش‌ها و راهنماهای کاربردی در حوزه هاست، سرور، وردپرس و شبکه.

برای اجرای آموزش به زیرساخت نیاز داری؟

سرویس مرتبط را ببین؛ معرفی خدمات در این بخش کوتاه نگه داشته شده تا تمرکز اصلی صفحه روی آموزش باقی بماند.

ایرانیکاسرور
گفت‌وگو درباره آموزش

دیدگاه‌ها

0 دیدگاه برای این مطلب ثبت شده است.

هنوز دیدگاهی ثبت نشده است؛ اگر سؤال یا تجربه‌ای درباره این آموزش داری، همین‌جا بنویس. پاسخ‌های مدیریت و کاربران به‌صورت مشخص از هم تفکیک می‌شوند.

دیدگاه یا سؤال خود را بنویسید

ایمیل شما منتشر نمی‌شود. فیلدهای ضروری مشخص شده‌اند.