← همه‌ی بوک‌لت‌ها
بوک‌لت · ۲۵ خرداد ۱۴۰۵ · ۱۲ دقیقه خواندن · سطح: مقدماتی تا متوسط پلتفرم: ویندوز / لینوکس / مک به‌روزرسانی: خرداد ۱۴۰۵ ابزارها: Ollama · Piper · Coqui
کارگاه خانگی هوش مصنوعی فارسی — تولید متن و صدا، رایگان و آفلاین

Local AI · Text & Voice · Offline

کارگاه خانگی هوش مصنوعی فارسی:
تولید متن و صدا، رایگان و آفلاین

سه ابزار متن‌بازِ کلیدی برای راه‌اندازی یک «استودیوی محتوای فارسی» روی کامپیوتر شخصی — بدون اشتراک، بدون API پولی، و پس از نصب اولیه، بدون نیاز به اینترنت. این نسخه با تمرکز بر دقت فنی، آخرین وضعیت پروژه‌ها، و دستورهای عملیِ قابل‌اجرا بازنویسی شده است.

سطح: مقدماتی تا متوسط پلتفرم: ویندوز / لینوکس / مک به‌روزرسانی: خرداد ۱۴۰۵ ابزارها: Ollama · Piper · Coqui
۰

چرا محلی و آفلاین؟

بسیاری از ما برای تولید محتوا یا ساخت سیستم‌های خودمان به سراغ سرویس‌های ابریِ گران یا APIهای پولی می‌رویم. اما امروز ابزارهای متن‌بازِ بسیار توانمندی وجود دارند که می‌توانید آن‌ها را کاملاً رایگان و روی سیستم شخصی خودتان اجرا کنید و خروجی‌های باکیفیت فارسی بگیرید. مزیت‌های اصلی این رویکرد روشن است:

  • حریم خصوصی: داده و متن شما از کامپیوترتان خارج نمی‌شود و به سرور هیچ شرکتی ارسال نمی‌گردد.
  • هزینهٔ صفر و بدون سقف مصرف: پس از دانلود، می‌توانید بی‌نهایت متن و صدا تولید کنید؛ خبری از اشتراک ماهانه یا شمارش توکن نیست.
  • کارکرد آفلاین: پردازش روی دستگاه شما انجام می‌شود و به اینترنتِ پایدار وابسته نیست.
  • کنترل کامل و تجمیع در محصول: هر سه ابزار را می‌توانید در برنامه‌ها و خطوط اتوماسیون خودتان جای دهید.
▪ یک نکتهٔ مهمِ صادقانه

«آفلاین» به معنای «بدون نیاز به اینترنت در همان لحظه» است، نه «بدون نیاز به اینترنت هرگز». شما برای دانلود اولیهٔ خود ابزار و مدل‌ها یک‌بار به اینترنت نیاز دارید (مدل‌های زبانی چند گیگابایت و مدل‌های صوتی چند ده مگابایت‌اند). پس از آن، اجرای کامل بدون اینترنت ممکن است. اگر دسترسی شما به اینترنت محدود است، بهتر است فایل مدل‌ها را یک‌بار در فرصت مناسب دانلود و نگه‌داری کنید.

۱

Ollama — موتور تولید متنِ محلی

کاربرد اصلی
اجرای مدل‌های زبانی (LLM) و چت
پشتیبانی فارسی
خوب تا عالی (وابسته به مدل)
سخت‌افزار
۱۶GB رم؛ GPU اختیاری
سرعت روی CPU
قابل‌قبول (مدل‌های کوچک)

Ollama یک ابزار متن‌باز برای دانلود و اجرای سادهٔ مدل‌های زبانی بزرگ روی کامپیوتر شخصی است. تمام پیچیدگی‌های راه‌اندازی را پنهان می‌کند و با یک دستور، مدل را دانلود و اجرا می‌کند. این پروژه بسیار فعال است و تقریباً هر چند هفته به‌روزرسانی می‌شود.

نصب و اولین اجرا

پس از دانلود نصب‌کننده از ollama.com، کافی است در ترمینال یک مدل را اجرا کنید؛ اگر مدل روی سیستم نباشد، خودش دانلود می‌شود:

# یک مدل را اجرا کن (اگر نباشد، دانلود می‌شود)
$ ollama run gemma3

# فقط دانلود بدون اجرا
$ ollama pull qwen3

# فهرست مدل‌های نصب‌شده
$ ollama list

کدام مدل برای فارسی؟

اینجا مهم‌ترین اصلاح نسبت به نوشته‌های قدیمی است: مدل‌ها سریع کهنه می‌شوند. دو دستهٔ کاربردی وجود دارد.

الف) مدل‌های چندزبانهٔ عمومی (توصیهٔ اول)

مدل‌های جدیدِ چندزبانه معمولاً فارسیِ روان‌تری نسبت به فاین‌تیون‌های قدیمیِ کوچک تولید می‌کنند و انتخاب امن‌تری‌اند:

  • gemma3 — از گوگل، در اندازه‌های 1B/4B/12B/27B، با پنجرهٔ متن ۱۲۸هزارتایی و پشتیبانی از بیش از ۱۴۰ زبان (از جمله فارسی) و قابلیت پردازش تصویر.
  • qwen3 — خانوادهٔ Qwen با عملکرد قوی در زبان‌های غیرانگلیسی و گزینه‌های متنوع از کوچک تا بزرگ.
  • llama3.1 / llama3.2 — مدل‌های متا، انتخاب‌های متعادل و پرکاربرد.
  • aya — از Cohere، با تمرکز ویژه بر چندزبانگی.

ب) مدل‌های تخصصی فارسی

  • mshojaei77/gemma3persian — یک فاین‌تیونِ تخصصی فارسی روی پایهٔ Gemma 3 با حدود ۴ میلیارد پارامتر و پنجرهٔ متن ۱۲۸هزارتایی (حجم ≈ ۴٫۱GB). نسخه‌ای با قابلیت فراخوانی ابزار (gemma3persian-tools) هم دارد.
  • partai/dorna-llama3 — ساختهٔ مرکز تحقیقات هوش مصنوعی «پارت» بر پایهٔ Llama-3-8B-Instruct با پنجرهٔ ۸هزارتایی. نکته: این مدل مربوط به سال ۲۰۲۴ است و دیگر «قوی‌ترین مدل فارسی» نیست؛ همچنان قابل‌استفاده اما نسبتاً قدیمی است.
# اجرای مدل تخصصی فارسی
$ ollama run mshojaei77/gemma3persian
>>> سلام، می‌توانی خودت را معرفی کنی؟
▪ معیار انتخاب مدل

برای مقایسهٔ بی‌طرفانهٔ مدل‌های فارسی می‌توانید به لیدربوردهای مستقل مانند Open Persian LLM Leaderboard و MIZAN (حاصل همکاری مرکز پارت و دانشگاه امیرکبیر) سر بزنید؛ این جدول‌ها مدل‌ها را در دانش عمومی، استدلال و مهارت زبانی می‌سنجند.

سخت‌افزار و کوانتیزیشن

پسوندهایی مثل q4_0، q5_0 و q8_0 سطح فشرده‌سازی (کوانتیزیشن) را نشان می‌دهند: عدد کوچک‌تر یعنی حجم و مصرف حافظهٔ کمتر اما کیفیت اندکی پایین‌تر. به‌عنوان یک قاعدهٔ سرانگشتی:

  • یک مدل ۴ میلیاردی با کوانت q4 حدود ۳ تا ۵ گیگابایت حافظه می‌خواهد.
  • یک مدل ۷ تا ۸ میلیاردی حدود ۵ تا ۹ گیگابایت.
  • اجرای روی CPU + رم ممکن است (کندتر)؛ اجرای روی VRAM کارت گرافیک بسیار سریع‌تر است. حداقل ۱۶GB رم پیشنهاد می‌شود.

اتصال به برنامه‌ها (نکتهٔ کاربردی)

Ollama پس از اجرا یک سرویس با API سازگار با OpenAI روی پورت 11434 بالا می‌آورد. یعنی می‌توانید آن را مثل یک سرویس ابری اما کاملاً محلی در کد خود صدا بزنید:

$ curl http://localhost:11434/api/generate -d '{
    "model": "gemma3persian",
    "prompt": "یک توییت دربارهٔ یادگیری مادام‌العمر بنویس",
    "stream": false
  }'

برای رابط گرافیکی هم می‌توانید از ابزارهایی مثل Open WebUI استفاده کنید تا تجربه‌ای شبیه ChatGPT اما محلی داشته باشید.

⚠ انتظار واقع‌بینانه

مدل‌های محلیِ کوچک (زیر ۱۰ میلیارد پارامتر) از مدل‌های بزرگ ابری (مثل GPT، Gemini یا Claude) ضعیف‌ترند؛ گاهی در فارسی دچار خطای دستوری یا «توهم» می‌شوند. این ابزارها برای پیش‌نویس، کارهای حساس به حریم خصوصی، اجرای آفلاین و اتوماسیون عالی‌اند، اما جایگزین کامل مدل‌های پرچم‌دار نیستند.

۲

Piper — سیستم تبدیل متن به صدا، سریع و سبک

کاربرد اصلی
روخوانی متن (TTS)
پشتیبانی فارسی
صدای آماده و باکیفیت
سخت‌افزار
فقط CPU کافی است
سرعت
بسیار بالا (بلادرنگ)

Piper یک موتور عصبیِ تبدیل متن به گفتارِ سریع و محلی است که حتی روی سیستم‌های معمولی و بدون کارت گرافیکِ قوی هم به‌راحتی اجرا می‌شود و خروجی صدای طبیعی می‌دهد.

⚠ تغییر مهم در مخزن پروژه

توسعهٔ Piper از مخزن قدیمی rhasspy/piper به مخزن جدید OHF-Voice/piper1-gpl منتقل شده است. روش نصب توصیه‌شدهٔ امروز از طریق pip است؛ به نوشته‌های قدیمی که فقط فایل اجرایی ویندوز را معرفی می‌کنند تکیه نکنید.

نصب و صدای فارسی

# نصب از طریق pip
$ pip install piper-tts

دو صدای فارسیِ آمادهٔ شناخته‌شده روی مخزن rhasspy/piper-voices در Hugging Face وجود دارد (هرکدام چند ده مگابایت):

  • fa_IR-gyro-medium — مدلی که «کسرهٔ اضافه» را خوب تشخیص می‌دهد و برای فارسی نتیجهٔ روانی می‌دهد.
  • fa_IR-amir-medium — یک صدای مردانهٔ دیگر با کیفیت خوب.

برای هر صدا دو فایل لازم است: فایل مدل .onnx و فایل پیکربندی .onnx.json. پس از قرار دادن آن‌ها در یک پوشه:

# روخوانی یک جمله و ذخیره در فایل صوتی
$ echo "سلام و درود بر همهٔ فارسی‌زبانان" | piper \
    --model fa_IR-gyro-medium.onnx \
    --output_file dorood.wav

رابط گرافیکی و نرمال‌سازی متن

اگر کار با خط فرمان راحت نیستید، پروژهٔ متن‌بازِ pertts (یک رابط ساده مبتنی بر Streamlit، با نسخهٔ Docker) کار با صدای فارسی Piper را آسان می‌کند.

یک نکتهٔ کلیدی برای کیفیت بهتر: اعداد و تاریخ‌ها را پیش از روخوانی به حروف تبدیل کنید (مثلاً «۱۴۰۵» → «هزار و چهارصد و پنج»). کتابخانه‌هایی مثل num2fawords، hazm و parsivar برای این نرمال‌سازی مفیدند (هرچند مدل gyro در زمینهٔ کسرهٔ اضافه کار را راحت‌تر کرده است).

▪ محدودیت‌ها را بدانید

Piper برای هر مدل یک گویندهٔ ثابت دارد و قابلیت شبیه‌سازی صدا ندارد؛ دامنهٔ احساسی صدا هم محدود است. در مقابل، فوق‌العاده سریع و سبک است و برای روخوانی مقاله، تولید زیرنویس صوتی و پادکست‌های سادهٔ حجیم انتخابی عالی محسوب می‌شود.

۳

Coqui TTS — تولید پیشرفته و شبیه‌سازی صدا

کاربرد اصلی
TTS پیشرفته + شبیه‌سازی
پشتیبانی فارسی
محدود (جزئیات را بخوانید)
سخت‌افزار
GPU توصیه می‌شود
لایسنس مدل XTTS
غیرتجاری (CPML)

Coqui TTS یک جعبه‌ابزار قدرتمند برای تولید صداست که شاخص‌ترین مدلش، XTTS v2، می‌تواند تنها با چند ثانیه نمونه صدا، صدای یک نفر را شبیه‌سازی کند (Voice Cloning). اما در مورد این ابزار دو واقعیت مهم باید روشن شود که در معرفی‌های قدیمی اغلب نادیده گرفته می‌شوند.

⚠ واقعیت اول: شرکت تعطیل شد، پروژه زنده است

شرکت Coqui AI در اوایل ۲۰۲۴ تعطیل شد و مخزن اصلی آرشیو شده است. اما جامعهٔ متن‌باز پروژه را زنده نگه داشت: نسخهٔ نگه‌داری‌شدهٔ فعال اکنون idiap/coqui-ai-TTS (از مؤسسهٔ تحقیقاتی Idiap) است و بستهٔ pip آن نام جدیدی دارد:

# بستهٔ جدید (نه TTS قدیمی) — نیازمند Python 3.12+ و PyTorch 2.5+
$ pip install coqui-tts
⚠ واقعیت دوم: فارسی و مسئلهٔ لایسنس

برخلاف تصور رایج، زبان فارسی جزو ۱۷ زبان رسمیِ XTTS v2 نیست (درخواست افزودن فارسی هنوز باز است). یعنی شبیه‌سازی صدای فارسی با خودِ XTTS به‌صورت آماده نتیجهٔ قابل‌اتکایی نمی‌دهد. همچنین وزن‌های مدل XTTS v2 تحت لایسنس غیرتجاری Coqui Public Model License هستند؛ بنابراین این مدل را نمی‌توان در محصول تجاری به‌کار برد (هرچند کدِ خود جعبه‌ابزار با لایسنس MPL-2.0 است).

پس فارسی را روی Coqui چطور کار کنیم؟

راه عملی، استفاده از مدل‌های VITS فارسی است که جامعهٔ ایرانی از صفر آموزش داده‌اند. این‌ها گویندهٔ ثابت دارند (شبیه‌سازی نمی‌کنند) اما آزادانه قابل‌استفاده‌اند:

  • مخزن karim23657/Persian-tts-coqui (به‌همراه مجموعه‌داده‌ها و نمونه‌کدهای آموزش).
  • مدل‌های آمادهٔ Kamtera/persian-tts-male1-vits و نسخهٔ زنانهٔ آن روی Hugging Face.
from TTS.api import TTS

tts = TTS(
    model_path="checkpoint_88000.pth",
    config_path="config.json"
)
tts.tts_to_file(
    "زندگی فقط یک بار است؛ از آن به خوبی استفاده کن",
    file_path="output.wav"
)
▪ جمع‌بندی Coqui

قدرت اصلی Coqui یعنی شبیه‌سازی صدا (XTTS) مستقیماً به درد فارسی نمی‌خورد و تجاری هم نیست. اگر صرفاً صدای فارسی باکیفیت می‌خواهید، مدل‌های VITS فارسی بالا کافی‌اند؛ و اگر واقعاً به شبیه‌سازی صدای فارسی نیاز دارید، گزینهٔ بخش بعد را ببینید.

۴

گزینه‌های مدرن‌تر (برای کامل‌بودن، ۲۰۲۶)

اکوسیستم صدای متن‌باز سریع جلو می‌رود. اگر نیاز شما فراتر از سه ابزار بالاست، این گزینه‌های تازه ارزش امتحان دارند:

شبیه‌سازی صدای فارسی: Chatterbox

Chatterbox TTS از شرکت Resemble AI (با پایهٔ MIT) به‌تازگی فاین‌تیون فارسی پیدا کرده است؛ مدل چندزبانهٔ آن با وزن‌های فارسی (t3_fa.safetensors) می‌تواند صدای فارسی را شبیه‌سازی کند — همان کاری که XTTS برای فارسی انجام نمی‌داد. این امروز عملی‌ترین مسیر برای کلونینگ صدای فارسی است.

$ pip install chatterbox-tts
# سپس وزن‌های فارسی t3_fa.safetensors را روی مدل چندزبانه بار کنید

سایر موتورهای صوتیِ ارزشمند

  • F5-TTS — مدل دیفیوژنیِ سریع با کلونینگ از روی چند ثانیه صدا.
  • StyleTTS2 و Fish Speech — کیفیت بالا و کنترل سبک.
  • Bark (از Suno) و OpenVoice — گزینه‌های شناخته‌شدهٔ دیگر.

مسیر معکوس: تبدیل گفتار به متن (STT)

اگر به استخراج متن از صدا نیاز دارید (مثلاً پیاده‌سازی مصاحبه)، این‌ها محلی و رایگان‌اند:

  • Whisper (وزن‌های باز از OpenAI) — استاندارد عملیِ تبدیل گفتار به متن چندزبانه.
  • wav2vec2-large-xlsr-53-persian — مدل‌های فاین‌تیون‌شدهٔ فارسی برای تشخیص گفتار.
۵

ترکیب ابزارها: کارگاه عملی

قدرت واقعی وقتی آزاد می‌شود که این ابزارها را به‌هم وصل کنید و خط تولید محتوای خود را بسازید. دو سناریوی پرکاربرد:

سناریوی الف — سریع و سبک (روی هر سیستمی)

  1. با Ollama متن یا اسکریپت فارسی را تولید کنید.
  2. خروجی را به Piper بدهید تا روخوانی شود.
  3. تمام؛ کاملاً آفلاین و بدون نیاز به کارت گرافیک.

سناریوی ب — کیفیت بالا یا صدای اختصاصی

  1. با Ollama متن را تولید و ویرایش کنید.
  2. برای صدای طبیعی‌تر از مدل‌های VITS فارسی (Coqui) یا برای شبیه‌سازی صدا از Chatterbox استفاده کنید.
  3. فایل‌های صوتی را با ffmpeg به‌هم بچسبانید و در صورت نیاز موسیقی پس‌زمینه اضافه کنید.

نمونهٔ یک خط تولید ساده (مفهومی)

# ۱) تولید متن با Ollama و ذخیره در فایل
$ echo "یک متن ۸۰ کلمه‌ای دربارهٔ تاب‌آوری بنویس" \
    | ollama run gemma3persian > matn.txt

# ۲) روخوانی همان فایل با Piper
$ cat matn.txt | piper \
    --model fa_IR-gyro-medium.onnx \
    --output_file sedaye-nahayi.wav

# ۳) (اختیاری) ترکیب چند فایل صوتی با ffmpeg
$ ffmpeg -i "concat:p1.wav|p2.wav" khoroji.wav

همین زنجیره را می‌توان در یک اسکریپت یا زمان‌بند (cron) قرار داد تا مثل یک «استودیوی تک‌نفره» به‌صورت خودکار محتوا تولید کند: متن را بخواند، از API محلی Ollama عبور دهد و خروجی صوتی بسازد.

۶

جدول مقایسهٔ سریع

ابزار کاربرد فارسی سخت‌افزار شبیه‌سازی صدا استفادهٔ تجاری
Ollama تولید متن (LLM) خوب تا عالی رم بالا / GPU اختیاری وابسته به لایسنس مدل
Piper متن به صدا صدای آماده دارد فقط CPU ندارد بله (آزاد)
Coqui (XTTS) صدا + کلونینگ رسمی نیست GPU توصیه می‌شود دارد خیر (CPML)
Coqui (VITS فارسی) متن به صدا بله سبک ندارد اغلب آزاد
Chatterbox صدا + کلونینگ با وزن فارسی GPU توصیه می‌شود دارد پایهٔ MIT (وزن‌ها را بررسی کنید)
۷

نکته‌های حقوقی و اخلاقی

⚠ شبیه‌سازی صدا، مسئولانه

صدای هر فرد را فقط با رضایت صریح خودش شبیه‌سازی کنید. استفاده از این فناوری برای جعل هویت، کلاهبرداری تلفنی، یا انتشار اطلاعات گمراه‌کننده به‌نام دیگران، هم آسیب‌زاست و هم در بسیاری از کشورها جرم محسوب می‌شود.

▪ لایسنس‌ها را پیش از استفادهٔ تجاری بخوانید

هر مدل لایسنس خود را دارد. برای نمونه: وزن‌های XTTS v2 غیرتجاری (CPML)، مدل‌های Gemma تحت «شرایط استفادهٔ Gemma»، و مدل‌های Llama تحت لایسنس مخصوص متا هستند. پیش از به‌کارگیری در محصول، شرایط را بررسی کنید.

و یک یادآوری دوباره: کیفیت مدل‌های محلی خوب است اما هنوز به پای بهترین مدل‌های ابری نمی‌رسد؛ این ابزارها را برای آنچه واقعاً خوب انجام می‌دهند به‌کار بگیرید — حریم خصوصی، هزینهٔ صفر، و کارکرد آفلاین.

خواندنی‌های مرتبط