Local AI · Text & Voice · Offline
کارگاه خانگی هوش مصنوعی فارسی:
تولید متن و صدا، رایگان و آفلاین
سه ابزار متنبازِ کلیدی برای راهاندازی یک «استودیوی محتوای فارسی» روی کامپیوتر شخصی — بدون اشتراک، بدون API پولی، و پس از نصب اولیه، بدون نیاز به اینترنت. این نسخه با تمرکز بر دقت فنی، آخرین وضعیت پروژهها، و دستورهای عملیِ قابلاجرا بازنویسی شده است.
چرا محلی و آفلاین؟
بسیاری از ما برای تولید محتوا یا ساخت سیستمهای خودمان به سراغ سرویسهای ابریِ گران یا APIهای پولی میرویم. اما امروز ابزارهای متنبازِ بسیار توانمندی وجود دارند که میتوانید آنها را کاملاً رایگان و روی سیستم شخصی خودتان اجرا کنید و خروجیهای باکیفیت فارسی بگیرید. مزیتهای اصلی این رویکرد روشن است:
- حریم خصوصی: داده و متن شما از کامپیوترتان خارج نمیشود و به سرور هیچ شرکتی ارسال نمیگردد.
- هزینهٔ صفر و بدون سقف مصرف: پس از دانلود، میتوانید بینهایت متن و صدا تولید کنید؛ خبری از اشتراک ماهانه یا شمارش توکن نیست.
- کارکرد آفلاین: پردازش روی دستگاه شما انجام میشود و به اینترنتِ پایدار وابسته نیست.
- کنترل کامل و تجمیع در محصول: هر سه ابزار را میتوانید در برنامهها و خطوط اتوماسیون خودتان جای دهید.
«آفلاین» به معنای «بدون نیاز به اینترنت در همان لحظه» است، نه «بدون نیاز به اینترنت هرگز». شما برای دانلود اولیهٔ خود ابزار و مدلها یکبار به اینترنت نیاز دارید (مدلهای زبانی چند گیگابایت و مدلهای صوتی چند ده مگابایتاند). پس از آن، اجرای کامل بدون اینترنت ممکن است. اگر دسترسی شما به اینترنت محدود است، بهتر است فایل مدلها را یکبار در فرصت مناسب دانلود و نگهداری کنید.
Ollama — موتور تولید متنِ محلی
Ollama یک ابزار متنباز برای دانلود و اجرای سادهٔ مدلهای زبانی بزرگ روی کامپیوتر شخصی است. تمام پیچیدگیهای راهاندازی را پنهان میکند و با یک دستور، مدل را دانلود و اجرا میکند. این پروژه بسیار فعال است و تقریباً هر چند هفته بهروزرسانی میشود.
نصب و اولین اجرا
پس از دانلود نصبکننده از ollama.com، کافی است در ترمینال یک مدل را اجرا کنید؛ اگر مدل روی سیستم نباشد، خودش دانلود میشود:
# یک مدل را اجرا کن (اگر نباشد، دانلود میشود) $ ollama run gemma3 # فقط دانلود بدون اجرا $ ollama pull qwen3 # فهرست مدلهای نصبشده $ ollama list
کدام مدل برای فارسی؟
اینجا مهمترین اصلاح نسبت به نوشتههای قدیمی است: مدلها سریع کهنه میشوند. دو دستهٔ کاربردی وجود دارد.
الف) مدلهای چندزبانهٔ عمومی (توصیهٔ اول)
مدلهای جدیدِ چندزبانه معمولاً فارسیِ روانتری نسبت به فاینتیونهای قدیمیِ کوچک تولید میکنند و انتخاب امنتریاند:
gemma3— از گوگل، در اندازههای 1B/4B/12B/27B، با پنجرهٔ متن ۱۲۸هزارتایی و پشتیبانی از بیش از ۱۴۰ زبان (از جمله فارسی) و قابلیت پردازش تصویر.qwen3— خانوادهٔ Qwen با عملکرد قوی در زبانهای غیرانگلیسی و گزینههای متنوع از کوچک تا بزرگ.llama3.1/llama3.2— مدلهای متا، انتخابهای متعادل و پرکاربرد.aya— از Cohere، با تمرکز ویژه بر چندزبانگی.
ب) مدلهای تخصصی فارسی
mshojaei77/gemma3persian— یک فاینتیونِ تخصصی فارسی روی پایهٔ Gemma 3 با حدود ۴ میلیارد پارامتر و پنجرهٔ متن ۱۲۸هزارتایی (حجم ≈ ۴٫۱GB). نسخهای با قابلیت فراخوانی ابزار (gemma3persian-tools) هم دارد.partai/dorna-llama3— ساختهٔ مرکز تحقیقات هوش مصنوعی «پارت» بر پایهٔ Llama-3-8B-Instruct با پنجرهٔ ۸هزارتایی. نکته: این مدل مربوط به سال ۲۰۲۴ است و دیگر «قویترین مدل فارسی» نیست؛ همچنان قابلاستفاده اما نسبتاً قدیمی است.
# اجرای مدل تخصصی فارسی $ ollama run mshojaei77/gemma3persian >>> سلام، میتوانی خودت را معرفی کنی؟
برای مقایسهٔ بیطرفانهٔ مدلهای فارسی میتوانید به لیدربوردهای مستقل مانند Open Persian LLM Leaderboard و MIZAN (حاصل همکاری مرکز پارت و دانشگاه امیرکبیر) سر بزنید؛ این جدولها مدلها را در دانش عمومی، استدلال و مهارت زبانی میسنجند.
سختافزار و کوانتیزیشن
پسوندهایی مثل q4_0، q5_0 و q8_0 سطح فشردهسازی (کوانتیزیشن) را نشان میدهند: عدد کوچکتر یعنی حجم و مصرف حافظهٔ کمتر اما کیفیت اندکی پایینتر. بهعنوان یک قاعدهٔ سرانگشتی:
- یک مدل ۴ میلیاردی با کوانت
q4حدود ۳ تا ۵ گیگابایت حافظه میخواهد. - یک مدل ۷ تا ۸ میلیاردی حدود ۵ تا ۹ گیگابایت.
- اجرای روی CPU + رم ممکن است (کندتر)؛ اجرای روی VRAM کارت گرافیک بسیار سریعتر است. حداقل ۱۶GB رم پیشنهاد میشود.
اتصال به برنامهها (نکتهٔ کاربردی)
Ollama پس از اجرا یک سرویس با API سازگار با OpenAI روی پورت 11434 بالا میآورد. یعنی میتوانید آن را مثل یک سرویس ابری اما کاملاً محلی در کد خود صدا بزنید:
$ curl http://localhost:11434/api/generate -d '{ "model": "gemma3persian", "prompt": "یک توییت دربارهٔ یادگیری مادامالعمر بنویس", "stream": false }'
برای رابط گرافیکی هم میتوانید از ابزارهایی مثل Open WebUI استفاده کنید تا تجربهای شبیه ChatGPT اما محلی داشته باشید.
مدلهای محلیِ کوچک (زیر ۱۰ میلیارد پارامتر) از مدلهای بزرگ ابری (مثل GPT، Gemini یا Claude) ضعیفترند؛ گاهی در فارسی دچار خطای دستوری یا «توهم» میشوند. این ابزارها برای پیشنویس، کارهای حساس به حریم خصوصی، اجرای آفلاین و اتوماسیون عالیاند، اما جایگزین کامل مدلهای پرچمدار نیستند.
Piper — سیستم تبدیل متن به صدا، سریع و سبک
Piper یک موتور عصبیِ تبدیل متن به گفتارِ سریع و محلی است که حتی روی سیستمهای معمولی و بدون کارت گرافیکِ قوی هم بهراحتی اجرا میشود و خروجی صدای طبیعی میدهد.
توسعهٔ Piper از مخزن قدیمی rhasspy/piper به مخزن جدید OHF-Voice/piper1-gpl منتقل شده است. روش نصب توصیهشدهٔ امروز از طریق pip است؛ به نوشتههای قدیمی که فقط فایل اجرایی ویندوز را معرفی میکنند تکیه نکنید.
نصب و صدای فارسی
# نصب از طریق pip $ pip install piper-tts
دو صدای فارسیِ آمادهٔ شناختهشده روی مخزن rhasspy/piper-voices در Hugging Face وجود دارد (هرکدام چند ده مگابایت):
fa_IR-gyro-medium— مدلی که «کسرهٔ اضافه» را خوب تشخیص میدهد و برای فارسی نتیجهٔ روانی میدهد.fa_IR-amir-medium— یک صدای مردانهٔ دیگر با کیفیت خوب.
برای هر صدا دو فایل لازم است: فایل مدل .onnx و فایل پیکربندی .onnx.json. پس از قرار دادن آنها در یک پوشه:
# روخوانی یک جمله و ذخیره در فایل صوتی $ echo "سلام و درود بر همهٔ فارسیزبانان" | piper \ --model fa_IR-gyro-medium.onnx \ --output_file dorood.wav
رابط گرافیکی و نرمالسازی متن
اگر کار با خط فرمان راحت نیستید، پروژهٔ متنبازِ pertts (یک رابط ساده مبتنی بر Streamlit، با نسخهٔ Docker) کار با صدای فارسی Piper را آسان میکند.
یک نکتهٔ کلیدی برای کیفیت بهتر: اعداد و تاریخها را پیش از روخوانی به حروف تبدیل کنید (مثلاً «۱۴۰۵» → «هزار و چهارصد و پنج»). کتابخانههایی مثل num2fawords، hazm و parsivar برای این نرمالسازی مفیدند (هرچند مدل gyro در زمینهٔ کسرهٔ اضافه کار را راحتتر کرده است).
Piper برای هر مدل یک گویندهٔ ثابت دارد و قابلیت شبیهسازی صدا ندارد؛ دامنهٔ احساسی صدا هم محدود است. در مقابل، فوقالعاده سریع و سبک است و برای روخوانی مقاله، تولید زیرنویس صوتی و پادکستهای سادهٔ حجیم انتخابی عالی محسوب میشود.
Coqui TTS — تولید پیشرفته و شبیهسازی صدا
Coqui TTS یک جعبهابزار قدرتمند برای تولید صداست که شاخصترین مدلش، XTTS v2، میتواند تنها با چند ثانیه نمونه صدا، صدای یک نفر را شبیهسازی کند (Voice Cloning). اما در مورد این ابزار دو واقعیت مهم باید روشن شود که در معرفیهای قدیمی اغلب نادیده گرفته میشوند.
شرکت Coqui AI در اوایل ۲۰۲۴ تعطیل شد و مخزن اصلی آرشیو شده است. اما جامعهٔ متنباز پروژه را زنده نگه داشت: نسخهٔ نگهداریشدهٔ فعال اکنون idiap/coqui-ai-TTS (از مؤسسهٔ تحقیقاتی Idiap) است و بستهٔ pip آن نام جدیدی دارد:
# بستهٔ جدید (نه TTS قدیمی) — نیازمند Python 3.12+ و PyTorch 2.5+ $ pip install coqui-tts
برخلاف تصور رایج، زبان فارسی جزو ۱۷ زبان رسمیِ XTTS v2 نیست (درخواست افزودن فارسی هنوز باز است). یعنی شبیهسازی صدای فارسی با خودِ XTTS بهصورت آماده نتیجهٔ قابلاتکایی نمیدهد. همچنین وزنهای مدل XTTS v2 تحت لایسنس غیرتجاری Coqui Public Model License هستند؛ بنابراین این مدل را نمیتوان در محصول تجاری بهکار برد (هرچند کدِ خود جعبهابزار با لایسنس MPL-2.0 است).
پس فارسی را روی Coqui چطور کار کنیم؟
راه عملی، استفاده از مدلهای VITS فارسی است که جامعهٔ ایرانی از صفر آموزش دادهاند. اینها گویندهٔ ثابت دارند (شبیهسازی نمیکنند) اما آزادانه قابلاستفادهاند:
- مخزن
karim23657/Persian-tts-coqui(بههمراه مجموعهدادهها و نمونهکدهای آموزش). - مدلهای آمادهٔ
Kamtera/persian-tts-male1-vitsو نسخهٔ زنانهٔ آن روی Hugging Face.
from TTS.api import TTS tts = TTS( model_path="checkpoint_88000.pth", config_path="config.json" ) tts.tts_to_file( "زندگی فقط یک بار است؛ از آن به خوبی استفاده کن", file_path="output.wav" )
قدرت اصلی Coqui یعنی شبیهسازی صدا (XTTS) مستقیماً به درد فارسی نمیخورد و تجاری هم نیست. اگر صرفاً صدای فارسی باکیفیت میخواهید، مدلهای VITS فارسی بالا کافیاند؛ و اگر واقعاً به شبیهسازی صدای فارسی نیاز دارید، گزینهٔ بخش بعد را ببینید.
گزینههای مدرنتر (برای کاملبودن، ۲۰۲۶)
اکوسیستم صدای متنباز سریع جلو میرود. اگر نیاز شما فراتر از سه ابزار بالاست، این گزینههای تازه ارزش امتحان دارند:
شبیهسازی صدای فارسی: Chatterbox
Chatterbox TTS از شرکت Resemble AI (با پایهٔ MIT) بهتازگی فاینتیون فارسی پیدا کرده است؛ مدل چندزبانهٔ آن با وزنهای فارسی (t3_fa.safetensors) میتواند صدای فارسی را شبیهسازی کند — همان کاری که XTTS برای فارسی انجام نمیداد. این امروز عملیترین مسیر برای کلونینگ صدای فارسی است.
$ pip install chatterbox-tts # سپس وزنهای فارسی t3_fa.safetensors را روی مدل چندزبانه بار کنید
سایر موتورهای صوتیِ ارزشمند
- F5-TTS — مدل دیفیوژنیِ سریع با کلونینگ از روی چند ثانیه صدا.
- StyleTTS2 و Fish Speech — کیفیت بالا و کنترل سبک.
- Bark (از Suno) و OpenVoice — گزینههای شناختهشدهٔ دیگر.
مسیر معکوس: تبدیل گفتار به متن (STT)
اگر به استخراج متن از صدا نیاز دارید (مثلاً پیادهسازی مصاحبه)، اینها محلی و رایگاناند:
- Whisper (وزنهای باز از OpenAI) — استاندارد عملیِ تبدیل گفتار به متن چندزبانه.
wav2vec2-large-xlsr-53-persian— مدلهای فاینتیونشدهٔ فارسی برای تشخیص گفتار.
ترکیب ابزارها: کارگاه عملی
قدرت واقعی وقتی آزاد میشود که این ابزارها را بههم وصل کنید و خط تولید محتوای خود را بسازید. دو سناریوی پرکاربرد:
سناریوی الف — سریع و سبک (روی هر سیستمی)
- با Ollama متن یا اسکریپت فارسی را تولید کنید.
- خروجی را به Piper بدهید تا روخوانی شود.
- تمام؛ کاملاً آفلاین و بدون نیاز به کارت گرافیک.
سناریوی ب — کیفیت بالا یا صدای اختصاصی
- با Ollama متن را تولید و ویرایش کنید.
- برای صدای طبیعیتر از مدلهای VITS فارسی (Coqui) یا برای شبیهسازی صدا از Chatterbox استفاده کنید.
- فایلهای صوتی را با
ffmpegبههم بچسبانید و در صورت نیاز موسیقی پسزمینه اضافه کنید.
نمونهٔ یک خط تولید ساده (مفهومی)
# ۱) تولید متن با Ollama و ذخیره در فایل $ echo "یک متن ۸۰ کلمهای دربارهٔ تابآوری بنویس" \ | ollama run gemma3persian > matn.txt # ۲) روخوانی همان فایل با Piper $ cat matn.txt | piper \ --model fa_IR-gyro-medium.onnx \ --output_file sedaye-nahayi.wav # ۳) (اختیاری) ترکیب چند فایل صوتی با ffmpeg $ ffmpeg -i "concat:p1.wav|p2.wav" khoroji.wav
همین زنجیره را میتوان در یک اسکریپت یا زمانبند (cron) قرار داد تا مثل یک «استودیوی تکنفره» بهصورت خودکار محتوا تولید کند: متن را بخواند، از API محلی Ollama عبور دهد و خروجی صوتی بسازد.
جدول مقایسهٔ سریع
| ابزار | کاربرد | فارسی | سختافزار | شبیهسازی صدا | استفادهٔ تجاری |
|---|---|---|---|---|---|
| Ollama | تولید متن (LLM) | خوب تا عالی | رم بالا / GPU اختیاری | — | وابسته به لایسنس مدل |
| Piper | متن به صدا | صدای آماده دارد | فقط CPU | ندارد | بله (آزاد) |
| Coqui (XTTS) | صدا + کلونینگ | رسمی نیست | GPU توصیه میشود | دارد | خیر (CPML) |
| Coqui (VITS فارسی) | متن به صدا | بله | سبک | ندارد | اغلب آزاد |
| Chatterbox | صدا + کلونینگ | با وزن فارسی | GPU توصیه میشود | دارد | پایهٔ MIT (وزنها را بررسی کنید) |
نکتههای حقوقی و اخلاقی
صدای هر فرد را فقط با رضایت صریح خودش شبیهسازی کنید. استفاده از این فناوری برای جعل هویت، کلاهبرداری تلفنی، یا انتشار اطلاعات گمراهکننده بهنام دیگران، هم آسیبزاست و هم در بسیاری از کشورها جرم محسوب میشود.
هر مدل لایسنس خود را دارد. برای نمونه: وزنهای XTTS v2 غیرتجاری (CPML)، مدلهای Gemma تحت «شرایط استفادهٔ Gemma»، و مدلهای Llama تحت لایسنس مخصوص متا هستند. پیش از بهکارگیری در محصول، شرایط را بررسی کنید.
و یک یادآوری دوباره: کیفیت مدلهای محلی خوب است اما هنوز به پای بهترین مدلهای ابری نمیرسد؛ این ابزارها را برای آنچه واقعاً خوب انجام میدهند بهکار بگیرید — حریم خصوصی، هزینهٔ صفر، و کارکرد آفلاین.