مدلهای گفتاری ElevenLabs
ElevenLabs یک شرکت پیشرو در حوزه صوت هوش مصنوعی است که در سنتز گفتار طبیعی و رسا و تشخیص گفتار دقیق تخصص دارد. از طریق AvalAI، شما میتوانید به ۸ مدل قدرتمند ElevenLabs برای تبدیل متن به گفتار و گفتار به متن با کیفیت و عملکرد پیشرو در صنعت دسترسی داشته باشید.
مدلهای موجود
مدلهای ElevenLabs دو دسته را پوشش میدهند: تبدیل متن به گفتار (TTS) برای تولید صدای طبیعی از متن، و تبدیل گفتار به متن (STT) برای رونویسی صوت گفتاری با دقت بالا.
مدلهای تبدیل متن به گفتار
شش مدل TTS از طریق نقطه پایانی v1/audio/speech در دسترس است، هر کدام برای موارد استفاده مختلف بهینهسازی شدهاند:
| مدل | توضیحات | تأخیر | زبانها | محدودیت کاراکتر |
|---|---|---|---|---|
eleven_v3 | پیشرفتهترین TTS چند گوینده با غنای احساسی | بالاتر | بیش از ۷۰ زبان | ۵,۰۰۰ |
eleven_multilingual_v2 | واقعگرایانهترین TTS با غنای احساسی | بالاتر | ۲۹ زبان | ۱۰,۰۰۰ |
eleven_turbo_v2_5 | کیفیت بالا، تأخیر کم، چندزبانه | ~۲۵۰-۳۰۰ میلیثانیه | ۳۲ زبان | ۴۰,۰۰۰ |
eleven_turbo_v2 | کیفیت بالا، تأخیر کم، انگلیسی | ~۲۵۰-۳۰۰ میلیثانیه | انگلیسی | ۴۰,۰۰۰ |
eleven_flash_v2_5 | TTS چندزبانه فوقسریع | ~۷۵ میلیثانیه | ۳۲ زبان | ۴۰,۰۰۰ |
eleven_flash_v2 | TTS انگلیسی فوقسریع | ~۷۵ میلیثانیه | انگلیسی | ۴۰,۰۰۰ |
Eleven v3 - جدیدترین و پیشرفتهترین
Eleven v3 جدیدترین و پیشرفتهترین مدل سنتز گفتار ElevenLabs است. این مدل گفتار طبیعی و زنده با بازه احساسی بالا و درک متنی در بیش از ۷۰ زبان تولید میکند.
بهترین برای:
- مکالمات شخصیتها با چندین گوینده در تعامل
- تولید کتاب صوتی با ارائه احساسی پیچیده
- تولید گفتار احساسی با بازه احساسی بالا
- پشتیبانی از مکالمه طبیعی چند گوینده
ویژگیهای کلیدی:
- پشتیبانی از مکالمه طبیعی چند گوینده
- بازه احساسی بالا و درک متنی
- پشتیبانی از بیش از ۷۰ زبان
- محدودیت ۵,۰۰۰ کاراکتر در هر درخواست
زبانهای پشتیبانیشده: آفریکانس، عربی، ارمنی، آسامی، آذربایجانی، بلاروسی، بنگالی، بوسنیایی، بلغاری، کاتالان، سبوانو، چیچوا، کرواتی، چکی، دانمارکی، هلندی، انگلیسی، استونیایی، فیلیپینی، فنلاندی، فرانسوی، گالیسیایی، گرجی، آلمانی، یونانی، گجراتی، هوسا، عبری، هندی، مجارستانی، ایسلندی، اندونزیایی، ایرلندی، ایتالیایی، ژاپنی، جاوهای، کانادا، قزاقی، قرقیزی، کرهای، لتونی، لینگالا، لیتوانیایی، لوکزامبورگی، مقدونی، مالایی، مالایالام، چینی ماندارین، مراتی، نپالی، نروژی، پشتو، فارسی، لهستانی، پرتغالی، پنجابی، رومانیایی، روسی، صربی، سندی، اسلواکی، اسلوونیایی، سومالیایی، اسپانیایی، سواحیلی، سوئدی، تامیلی، تلوگو، تایلندی، ترکی، اوکراینی، اردو، ویتنامی، ولزی
Eleven Multilingual v2 - کیفیت برتر
پیشرفتهترین مدل سنتز گفتار با آگاهی احساسی، بیان احساسی غنی و کیفیت صدای یکنواخت در تمام زبانها.
بهترین برای:
- صداگذاری شخصیتها برای بازی و انیمیشن
- ویدیوهای شرکتی حرفهای و آموزش الکترونیکی
- پروژههای چندزبانه نیازمند صدای یکنواخت
- برنامههایی که گفتار واقعگرایانه در آنها حیاتی است
زبانهای پشتیبانیشده: انگلیسی، ژاپنی، چینی، آلمانی، هندی، فرانسوی، کرهای، پرتغالی، ایتالیایی، اسپانیایی، اندونزیایی، هلندی، ترکی، فیلیپینی، لهستانی، سوئدی، بلغاری، رومانیایی، عربی، چکی، یونانی، فنلاندی، کرواتی، مالایی، اسلواکی، دانمارکی، تامیلی، اوکراینی، روسی
Eleven Turbo v2.5 - عملکرد متعادل
مدل با کیفیت بالا و تأخیر کم با تعادل عالی بین کیفیت و سرعت، پشتیبانی از ۳۲ زبان.
بهترین برای:
- عاملهای صوتی بلادرنگ و چتباتها
- برنامههای تعاملی نیازمند پاسخ سریع
- استقرار چندزبانه در محیط تولید
- تعادل بین کیفیت و تأخیر
زبانهای پشتیبانیشده: تمام زبانهای Multilingual v2 به علاوه مجارستانی، نروژی، ویتنامی
Eleven Flash v2.5 - تأخیر فوقکم
سریعترین مدل سنتز گفتار طراحی شده برای برنامههای بلادرنگ با تأخیر ~۷۵ میلیثانیه.
بهترین برای:
- عاملهای صوتی بلادرنگ (پلتفرم Agents)
- بازیها و برنامههای تعاملی
- پردازش انبوه TTS در مقیاس بزرگ
- سنتز گفتار سریع و مقرونبهصرفه
مدلهای تبدیل گفتار به متن
دو مدل پیشرفته رونویسی از طریق نقطه پایانی v1/audio/transcriptions:
| مدل | توضیحات | زبانها | ویژگیها |
|---|---|---|---|
scribe_v2 | تشخیص گفتار پیشرفته | بیش از ۹۰ زبان | تفکیک گوینده، مهر زمانی، تشخیص موجودیت |
scribe_v1 | مدل رونویسی قدیمی | بیش از ۹۰ زبان | رونویسی پایه |
Scribe v2 - رونویسی پیشرفته
تشخیص گفتار پیشرفته با ویژگیهای جامع:
- رونویسی دقیق: پشتیبانی از بیش از ۹۰ زبان
- اعلان کلیدواژه: تا ۱۰۰ اصطلاح برای دقت در حوزههای خاص
- تشخیص موجودیت: شناسایی تا ۵۶ نوع موجودیت
- مهر زمانی کلمهای: زمانبندی دقیق برای هر کلمه
- تفکیک گوینده: شناسایی تا ۳۲ گوینده
- برچسبگذاری پویای صوت: تشخیص خودکار رویدادهای صوتی
- تشخیص هوشمند زبان: شناسایی خودکار زبان
قیمتگذاری
قیمتگذاری تبدیل متن به گفتار
مدلهای TTS ElevenLabs بر اساس هر ثانیه صدای تولید شده قیمتگذاری میشوند:
| مدل | هزینه خروجی (در ثانیه) | بهترین برای |
|---|---|---|
eleven_v3 | $۰.۰۰۵/ثانیه | پیشرفتهترین، چند گوینده |
eleven_turbo_v2 | $۰.۰۰۲۵/ثانیه | انگلیسی، تأخیر کم |
eleven_turbo_v2_5 | $۰.۰۰۲۵/ثانیه | چندزبانه، متعادل |
eleven_flash_v2 | $۰.۰۰۲۵/ثانیه | انگلیسی، سریعترین |
eleven_flash_v2_5 | $۰.۰۰۲۵/ثانیه | چندزبانه، سریعترین |
eleven_multilingual_v2 | $۰.۰۰۵/ثانیه | بالاترین کیفیت |
قیمتگذاری تبدیل گفتار به متن
مدلهای Scribe بر اساس هر ثانیه صدای ورودی قیمتگذاری میشوند:
| مدل | هزینه ورودی (در ثانیه) |
|---|---|
scribe_v2 | $۰.۰۰۰۰۹۷۲۲/ثانیه |
scribe_v1 | $۰.۰۰۰۰۹۷۲۲/ثانیه |
نقاط پایانی API
مدلهای ElevenLabs از طریق API سازگار با OpenAI در AvalAI در دسترس هستند:
- تبدیل متن به گفتار:
v1/audio/speech - رونویسی:
v1/audio/transcriptions
مثالهای استفاده
تولید تبدیل متن به گفتار
from openai import OpenAI
from pathlib import Path
client = OpenAI(api_key="your-avalai-api-key", base_url="https://api.avalai.ir/v1")
# تولید گفتار با مدل Flash برای تأخیر کم
speech_file = Path("./speech.mp3")
response = client.audio.speech.create(
model="eleven_flash_v2_5",
input="سلام! این یک نمایش از تبدیل متن به گفتار ElevenLabs از طریق AvalAI است.",
voice="coral",
)
response.stream_to_file(speech_file)
print(f"صدا در {speech_file} ذخیره شد")مثال cURL - TTS
curl https://api.avalai.ir/v1/audio/speech \
-H "Authorization: Bearer $AVALAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "eleven_flash_v2_5",
"input": "روباه قهوهای سریع از روی سگ تنبل پرید.",
"voice": "coral"
}' \
--output speech.mp3TTS با کیفیت بالا با Multilingual v2
# استفاده از Multilingual v2 برای بالاترین کیفیت خروجی
response = client.audio.speech.create(
model="eleven_multilingual_v2",
input="به پلتفرم ما خوش آمدید. از حضور شما خوشحالیم.",
voice="alloy",
)
response.stream_to_file("premium_speech.mp3")رونویسی گفتار
curl https://api.avalai.ir/v1/audio/transcriptions \
-H "Authorization: Bearer $AVALAI_API_KEY" \
-F file=@audio.mp3 \
-F model=scribe_v2نمونه پاسخ:
{
"text": "سلام، این یک نمونه رونویسی از فایل صوتی است.",
"task": "transcribe",
"language": "fa",
"duration": 3.5,
"words": [
{
"word": "سلام",
"start": 0.0,
"end": 0.35
},
{
"word": "این",
"start": 0.4,
"end": 0.55
},
{
"word": "یک",
"start": 0.55,
"end": 0.65
},
{
"word": "نمونه",
"start": 0.65,
"end": 0.72
},
{
"word": "رونویسی",
"start": 0.72,
"end": 1.0
}
]
}صداهای موجود
مدلهای ElevenLabs از چندین صدا پشتیبانی میکنند. صداهای رایج شامل:
alloy- خنثی، حرفهایcoral- گرم، دوستانهecho- واضح، رساfable- داستانگویی، روایتیnova- پرانرژی، شادonyx- عمیق، با اقتدارsage- آرام، خردمندshimmer- روشن، سرحال
راهنمای انتخاب مدل
| مورد استفاده | مدل توصیهشده |
|---|---|
| عاملهای صوتی بلادرنگ | eleven_flash_v2_5 |
| برنامههای تعاملی | eleven_flash_v2_5 یا eleven_turbo_v2_5 |
| تولید کتاب صوتی | eleven_multilingual_v2 |
| صداگذاری شخصیتها | eleven_multilingual_v2 |
| پردازش انبوه | eleven_flash_v2_5 |
| پروژههای فقط انگلیسی | eleven_turbo_v2 یا eleven_flash_v2 |
| محتوای چندزبانه | eleven_turbo_v2_5 یا eleven_multilingual_v2 |
| رونویسی با دقت بالا | scribe_v2 |
بهترین شیوهها
برای تبدیل متن به گفتار
۱. انتخاب مدل مناسب: از Flash برای سرعت، از Multilingual v2 برای کیفیت استفاده کنید ۲. انتخاب صدا: ویژگیهای صدا را با محتوای خود تطبیق دهید ۳. آمادهسازی متن: متن را برای الگوهای گفتار طبیعی پاکسازی و فرمت کنید ۴. یکنواختی زبان: از مدلهای مناسب زبان برای بهترین نتایج استفاده کنید
برای رونویسی
۱. کیفیت صدا: ورودی با کیفیت بالاتر رونویسی بهتری تولید میکند ۲. استفاده از اعلان کلیدواژه: اصطلاحات خاص حوزه را برای دقت اضافه کنید ۳. تفکیک گوینده: هنگام وجود چند گوینده فعال کنید ۴. راهنمای زبان: در صورت شناخته بودن، زبان را مشخص کنید