داشبورد توسعه‌دهنده
پرسش از هوش مصنوعی
پرسش از هوش مصنوعی

مدل‌های گفتاری ElevenLabs

ElevenLabs یک شرکت پیشرو در حوزه صوت هوش مصنوعی است که در سنتز گفتار طبیعی و رسا و تشخیص گفتار دقیق تخصص دارد. از طریق AvalAI، شما می‌توانید به ۸ مدل قدرتمند ElevenLabs برای تبدیل متن به گفتار و گفتار به متن با کیفیت و عملکرد پیشرو در صنعت دسترسی داشته باشید.

مدل‌های موجود

مدل‌های ElevenLabs دو دسته را پوشش می‌دهند: تبدیل متن به گفتار (TTS) برای تولید صدای طبیعی از متن، و تبدیل گفتار به متن (STT) برای رونویسی صوت گفتاری با دقت بالا.

مدل‌های تبدیل متن به گفتار

شش مدل TTS از طریق نقطه پایانی v1/audio/speech در دسترس است، هر کدام برای موارد استفاده مختلف بهینه‌سازی شده‌اند:

مدلتوضیحاتتأخیرزبان‌هامحدودیت کاراکتر
eleven_v3پیشرفته‌ترین TTS چند گوینده با غنای احساسیبالاتربیش از ۷۰ زبان۵,۰۰۰
eleven_multilingual_v2واقع‌گرایانه‌ترین TTS با غنای احساسیبالاتر۲۹ زبان۱۰,۰۰۰
eleven_turbo_v2_5کیفیت بالا، تأخیر کم، چندزبانه~۲۵۰-۳۰۰ میلی‌ثانیه۳۲ زبان۴۰,۰۰۰
eleven_turbo_v2کیفیت بالا، تأخیر کم، انگلیسی~۲۵۰-۳۰۰ میلی‌ثانیهانگلیسی۴۰,۰۰۰
eleven_flash_v2_5TTS چندزبانه فوق‌سریع~۷۵ میلی‌ثانیه۳۲ زبان۴۰,۰۰۰
eleven_flash_v2TTS انگلیسی فوق‌سریع~۷۵ میلی‌ثانیهانگلیسی۴۰,۰۰۰

Eleven v3 - جدیدترین و پیشرفته‌ترین

Eleven v3 جدیدترین و پیشرفته‌ترین مدل سنتز گفتار ElevenLabs است. این مدل گفتار طبیعی و زنده با بازه احساسی بالا و درک متنی در بیش از ۷۰ زبان تولید می‌کند.

بهترین برای:

  • مکالمات شخصیت‌ها با چندین گوینده در تعامل
  • تولید کتاب صوتی با ارائه احساسی پیچیده
  • تولید گفتار احساسی با بازه احساسی بالا
  • پشتیبانی از مکالمه طبیعی چند گوینده

ویژگی‌های کلیدی:

  • پشتیبانی از مکالمه طبیعی چند گوینده
  • بازه احساسی بالا و درک متنی
  • پشتیبانی از بیش از ۷۰ زبان
  • محدودیت ۵,۰۰۰ کاراکتر در هر درخواست

زبان‌های پشتیبانی‌شده: آفریکانس، عربی، ارمنی، آسامی، آذربایجانی، بلاروسی، بنگالی، بوسنیایی، بلغاری، کاتالان، سبوانو، چیچوا، کرواتی، چکی، دانمارکی، هلندی، انگلیسی، استونیایی، فیلیپینی، فنلاندی، فرانسوی، گالیسیایی، گرجی، آلمانی، یونانی، گجراتی، هوسا، عبری، هندی، مجارستانی، ایسلندی، اندونزیایی، ایرلندی، ایتالیایی، ژاپنی، جاوه‌ای، کانادا، قزاقی، قرقیزی، کره‌ای، لتونی، لینگالا، لیتوانیایی، لوکزامبورگی، مقدونی، مالایی، مالایالام، چینی ماندارین، مراتی، نپالی، نروژی، پشتو، فارسی، لهستانی، پرتغالی، پنجابی، رومانیایی، روسی، صربی، سندی، اسلواکی، اسلوونیایی، سومالیایی، اسپانیایی، سواحیلی، سوئدی، تامیلی، تلوگو، تایلندی، ترکی، اوکراینی، اردو، ویتنامی، ولزی

Eleven Multilingual v2 - کیفیت برتر

پیشرفته‌ترین مدل سنتز گفتار با آگاهی احساسی، بیان احساسی غنی و کیفیت صدای یکنواخت در تمام زبان‌ها.

بهترین برای:

  • صداگذاری شخصیت‌ها برای بازی و انیمیشن
  • ویدیوهای شرکتی حرفه‌ای و آموزش الکترونیکی
  • پروژه‌های چندزبانه نیازمند صدای یکنواخت
  • برنامه‌هایی که گفتار واقع‌گرایانه در آن‌ها حیاتی است

زبان‌های پشتیبانی‌شده: انگلیسی، ژاپنی، چینی، آلمانی، هندی، فرانسوی، کره‌ای، پرتغالی، ایتالیایی، اسپانیایی، اندونزیایی، هلندی، ترکی، فیلیپینی، لهستانی، سوئدی، بلغاری، رومانیایی، عربی، چکی، یونانی، فنلاندی، کرواتی، مالایی، اسلواکی، دانمارکی، تامیلی، اوکراینی، روسی

Eleven Turbo v2.5 - عملکرد متعادل

مدل با کیفیت بالا و تأخیر کم با تعادل عالی بین کیفیت و سرعت، پشتیبانی از ۳۲ زبان.

بهترین برای:

  • عامل‌های صوتی بلادرنگ و چت‌بات‌ها
  • برنامه‌های تعاملی نیازمند پاسخ سریع
  • استقرار چندزبانه در محیط تولید
  • تعادل بین کیفیت و تأخیر

زبان‌های پشتیبانی‌شده: تمام زبان‌های Multilingual v2 به علاوه مجارستانی، نروژی، ویتنامی

Eleven Flash v2.5 - تأخیر فوق‌کم

سریع‌ترین مدل سنتز گفتار طراحی شده برای برنامه‌های بلادرنگ با تأخیر ~۷۵ میلی‌ثانیه.

بهترین برای:

  • عامل‌های صوتی بلادرنگ (پلتفرم Agents)
  • بازی‌ها و برنامه‌های تعاملی
  • پردازش انبوه TTS در مقیاس بزرگ
  • سنتز گفتار سریع و مقرون‌به‌صرفه

مدل‌های تبدیل گفتار به متن

دو مدل پیشرفته رونویسی از طریق نقطه پایانی v1/audio/transcriptions:

مدلتوضیحاتزبان‌هاویژگی‌ها
scribe_v2تشخیص گفتار پیشرفتهبیش از ۹۰ زبانتفکیک گوینده، مهر زمانی، تشخیص موجودیت
scribe_v1مدل رونویسی قدیمیبیش از ۹۰ زبانرونویسی پایه

Scribe v2 - رونویسی پیشرفته

تشخیص گفتار پیشرفته با ویژگی‌های جامع:

  • رونویسی دقیق: پشتیبانی از بیش از ۹۰ زبان
  • اعلان کلیدواژه: تا ۱۰۰ اصطلاح برای دقت در حوزه‌های خاص
  • تشخیص موجودیت: شناسایی تا ۵۶ نوع موجودیت
  • مهر زمانی کلمه‌ای: زمان‌بندی دقیق برای هر کلمه
  • تفکیک گوینده: شناسایی تا ۳۲ گوینده
  • برچسب‌گذاری پویای صوت: تشخیص خودکار رویدادهای صوتی
  • تشخیص هوشمند زبان: شناسایی خودکار زبان

قیمت‌گذاری

قیمت‌گذاری تبدیل متن به گفتار

مدل‌های TTS ElevenLabs بر اساس هر ثانیه صدای تولید شده قیمت‌گذاری می‌شوند:

مدلهزینه خروجی (در ثانیه)بهترین برای
eleven_v3$۰.۰۰۵/ثانیهپیشرفته‌ترین، چند گوینده
eleven_turbo_v2$۰.۰۰۲۵/ثانیهانگلیسی، تأخیر کم
eleven_turbo_v2_5$۰.۰۰۲۵/ثانیهچندزبانه، متعادل
eleven_flash_v2$۰.۰۰۲۵/ثانیهانگلیسی، سریع‌ترین
eleven_flash_v2_5$۰.۰۰۲۵/ثانیهچندزبانه، سریع‌ترین
eleven_multilingual_v2$۰.۰۰۵/ثانیهبالاترین کیفیت

قیمت‌گذاری تبدیل گفتار به متن

مدل‌های Scribe بر اساس هر ثانیه صدای ورودی قیمت‌گذاری می‌شوند:

مدلهزینه ورودی (در ثانیه)
scribe_v2$۰.۰۰۰۰۹۷۲۲/ثانیه
scribe_v1$۰.۰۰۰۰۹۷۲۲/ثانیه

نقاط پایانی API

مدل‌های ElevenLabs از طریق API سازگار با OpenAI در AvalAI در دسترس هستند:

مثال‌های استفاده

تولید تبدیل متن به گفتار

python
from openai import OpenAI
from pathlib import Path

client = OpenAI(api_key="your-avalai-api-key", base_url="https://api.avalai.ir/v1")

# تولید گفتار با مدل Flash برای تأخیر کم
speech_file = Path("./speech.mp3")

response = client.audio.speech.create(
    model="eleven_flash_v2_5",
    input="سلام! این یک نمایش از تبدیل متن به گفتار ElevenLabs از طریق AvalAI است.",
    voice="coral",
)

response.stream_to_file(speech_file)
print(f"صدا در {speech_file} ذخیره شد")

مثال cURL - TTS

bash
curl https://api.avalai.ir/v1/audio/speech \
  -H "Authorization: Bearer $AVALAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "eleven_flash_v2_5",
    "input": "روباه قهوه‌ای سریع از روی سگ تنبل پرید.",
    "voice": "coral"
  }' \
  --output speech.mp3

TTS با کیفیت بالا با Multilingual v2

python
# استفاده از Multilingual v2 برای بالاترین کیفیت خروجی
response = client.audio.speech.create(
    model="eleven_multilingual_v2",
    input="به پلتفرم ما خوش آمدید. از حضور شما خوشحالیم.",
    voice="alloy",
)

response.stream_to_file("premium_speech.mp3")

رونویسی گفتار

bash
curl https://api.avalai.ir/v1/audio/transcriptions \
  -H "Authorization: Bearer $AVALAI_API_KEY" \
  -F file=@audio.mp3 \
  -F model=scribe_v2

نمونه پاسخ:

json
{
  "text": "سلام، این یک نمونه رونویسی از فایل صوتی است.",
  "task": "transcribe",
  "language": "fa",
  "duration": 3.5,
  "words": [
    {
      "word": "سلام",
      "start": 0.0,
      "end": 0.35
    },
    {
      "word": "این",
      "start": 0.4,
      "end": 0.55
    },
    {
      "word": "یک",
      "start": 0.55,
      "end": 0.65
    },
    {
      "word": "نمونه",
      "start": 0.65,
      "end": 0.72
    },
    {
      "word": "رونویسی",
      "start": 0.72,
      "end": 1.0
    }
  ]
}

صداهای موجود

مدل‌های ElevenLabs از چندین صدا پشتیبانی می‌کنند. صداهای رایج شامل:

  • alloy - خنثی، حرفه‌ای
  • coral - گرم، دوستانه
  • echo - واضح، رسا
  • fable - داستان‌گویی، روایتی
  • nova - پرانرژی، شاد
  • onyx - عمیق، با اقتدار
  • sage - آرام، خردمند
  • shimmer - روشن، سرحال

راهنمای انتخاب مدل

مورد استفادهمدل توصیه‌شده
عامل‌های صوتی بلادرنگeleven_flash_v2_5
برنامه‌های تعاملیeleven_flash_v2_5 یا eleven_turbo_v2_5
تولید کتاب صوتیeleven_multilingual_v2
صداگذاری شخصیت‌هاeleven_multilingual_v2
پردازش انبوهeleven_flash_v2_5
پروژه‌های فقط انگلیسیeleven_turbo_v2 یا eleven_flash_v2
محتوای چندزبانهeleven_turbo_v2_5 یا eleven_multilingual_v2
رونویسی با دقت بالاscribe_v2

بهترین شیوه‌ها

برای تبدیل متن به گفتار

۱. انتخاب مدل مناسب: از Flash برای سرعت، از Multilingual v2 برای کیفیت استفاده کنید ۲. انتخاب صدا: ویژگی‌های صدا را با محتوای خود تطبیق دهید ۳. آماده‌سازی متن: متن را برای الگوهای گفتار طبیعی پاکسازی و فرمت کنید ۴. یکنواختی زبان: از مدل‌های مناسب زبان برای بهترین نتایج استفاده کنید

برای رونویسی

۱. کیفیت صدا: ورودی با کیفیت بالاتر رونویسی بهتری تولید می‌کند ۲. استفاده از اعلان کلیدواژه: اصطلاحات خاص حوزه را برای دقت اضافه کنید ۳. تفکیک گوینده: هنگام وجود چند گوینده فعال کنید ۴. راهنمای زبان: در صورت شناخته بودن، زبان را مشخص کنید

منابع مرتبط