داشبورد توسعه‌دهنده
پرسش از هوش مصنوعی
پرسش از هوش مصنوعی

ارائه‌دهنده جدید: مدل‌های گفتاری ElevenLabs و ۱۲ مدل جدید هوش مصنوعی Cloudflare

تاریخ: ۱۴۰۴-۱۱-۱۴ / (2026-02-03)

خلاصه

AvalAI ارائه‌دهنده جدید ElevenLabs را با ۷ مدل گفتاری پیشرفته برای تبدیل متن به گفتار و گفتار به متن اضافه می‌کند. همچنین ۱۲ مدل جدید هوش مصنوعی Cloudflare شامل مدل‌های تولید تصویر FLUX، مدل‌های embedding و مدل‌های چت از ارائه‌دهندگان مختلف اکنون در دسترس است.


جزئیات

ElevenLabs - ارائه‌دهنده جدید گفتار

ElevenLabs اکنون در AvalAI در دسترس است و قابلیت‌های پیشرو در صنعت برای تبدیل متن به گفتار و گفتار به متن را ارائه می‌دهد. مدل‌های ElevenLabs سنتز گفتار طبیعی و رسا و رونویسی دقیق در چندین زبان را فراهم می‌کنند. مستندات

مدل‌های تبدیل متن به گفتار (TTS)

پنج مدل TTS از طریق نقطه پایانی v1/audio/speech در دسترس است:

مدلتوضیحاتتأخیرزبان‌ها
eleven_turbo_v2TTS انگلیسی با کیفیت بالا و تأخیر کم~۲۵۰-۳۰۰ میلی‌ثانیهانگلیسی
eleven_turbo_v2_5TTS چندزبانه با کیفیت بالا و تأخیر کم~۲۵۰-۳۰۰ میلی‌ثانیه۳۲ زبان
eleven_flash_v2TTS انگلیسی فوق‌سریع~۷۵ میلی‌ثانیهانگلیسی
eleven_flash_v2_5TTS چندزبانه فوق‌سریع~۷۵ میلی‌ثانیه۳۲ زبان
eleven_multilingual_v2واقع‌گرایانه‌ترین TTS با غنای احساسیبالاتر۲۹ زبان

ویژگی‌های کلیدی:

  • گفتار طبیعی: تولید صدای شبیه انسان و رسا
  • پشتیبانی چندزبانه: تا ۳۲ زبان با Flash v2.5 و Turbo v2.5
  • تأخیر کم: تأخیر فوق‌سریع ~۷۵ میلی‌ثانیه با مدل‌های Flash
  • سازگار با OpenAI: نقطه پایانی استاندارد v1/audio/speech

قیمت‌گذاری:

مدلهزینه خروجی (در ثانیه)
eleven_turbo_v2$۰.۰۰۲۵/ثانیه
eleven_turbo_v2_5$۰.۰۰۲۵/ثانیه
eleven_flash_v2$۰.۰۰۲۵/ثانیه
eleven_flash_v2_5$۰.۰۰۲۵/ثانیه
eleven_multilingual_v2$۰.۰۰۵/ثانیه

مدل‌های تبدیل گفتار به متن (STT)

دو مدل پیشرفته رونویسی از طریق نقطه پایانی v1/audio/transcriptions:

مدلتوضیحاتزبان‌ها
scribe_v2تشخیص گفتار پیشرفتهبیش از ۹۰ زبان
scribe_v1مدل رونویسی قدیمیبیش از ۹۰ زبان

ویژگی‌های Scribe v2:

  • رونویسی دقیق: پشتیبانی از بیش از ۹۰ زبان
  • اعلان کلیدواژه: تا ۱۰۰ اصطلاح برای دقت در حوزه‌های خاص
  • تشخیص موجودیت: تا ۵۶ نوع موجودیت
  • مهر زمانی کلمه‌ای: زمان‌بندی دقیق برای هر کلمه
  • تفکیک گوینده: شناسایی تا ۳۲ گوینده
  • تشخیص هوشمند زبان: شناسایی خودکار زبان

قیمت‌گذاری:

مدلهزینه ورودی (در ثانیه)
scribe_v2$۰.۰۰۰۰۹۷۲۲/ثانیه
scribe_v1$۰.۰۰۰۰۹۷۲۲/ثانیه

Cloudflare AI - ۱۲ مدل جدید

مجموعه مدل‌های هوش مصنوعی Cloudflare را با ۱۲ مدل جدید در حوزه‌های تولید تصویر، embedding و چت گسترش داده‌ایم. مستندات

مدل‌های تولید تصویر (v1/images/generations)

پنج مدل جدید تولید تصویر اکنون در دسترس است:

مدلتوضیحاتقیمت پایه (۱ مگاپیکسل)
cf.flux-2-klein-9bمدل FLUX 2 Klein با ۹ میلیارد پارامتر$۰.۰۱۵/تصویر
cf.flux-2-klein-4bمدل فشرده FLUX 2 Klein با ۴ میلیارد پارامتر$۰.۰۱۰/تصویر
cf.flux-2-devمدل توسعه FLUX 2$۰.۰۱۰/تصویر
cf.lucid-originتولید تصویر Lucid Origin$۰.۰۱۵/تصویر
cf.phoenix-1.0تولید تصویر Phoenix 1.0$۰.۰۱۵/تصویر

قیمت‌گذاری بر اساس رزولوشن:

مدل۱ مگاپیکسل۲ مگاپیکسل۳ مگاپیکسل۴ مگاپیکسل
cf.flux-2-klein-9b$۰.۰۱۵$۰.۰۱۷$۰.۰۱۹$۰.۰۲۱
cf.flux-2-klein-4b$۰.۰۱۰$۰.۰۱۲$۰.۰۱۴$۰.۰۱۶
cf.flux-2-dev$۰.۰۱۰$۰.۰۱۱$۰.۰۱۲$۰.۰۱۳
cf.lucid-origin$۰.۰۱۵$۰.۰۱۷$۰.۰۱۹$۰.۰۲۱
cf.phoenix-1.0$۰.۰۱۵$۰.۰۱۷$۰.۰۱۹$۰.۰۲۱

مدل‌های Embedding (v1/embeddings)

سه مدل embedding جدید برای جستجوی معنایی و تحلیل متن:

مدلتوضیحاتقیمت ورودی (دلار/۱م توکن)
cf.qwen3-embedding-0.6bQwen3 Embedding ۰.۶ میلیارد از Alibaba$۰.۰۱۲
cf.plamo-embedding-1bPLaMo Embedding ۱ میلیارد از PFN$۰.۰۱۹
cf.embeddinggemma-300mEmbeddingGemma ۳۰۰ میلیون از Google$۰.۰۱۲

مدل‌های تکمیل چت (v1/chat/completions, v1/responses)

چهار مدل چت جدید با پشتیبانی جزئی از v1/responses:

مدلصاحبورودی (دلار/۱م)ورودی کش شده (دلار/۱م)خروجی (دلار/۱م)
cf.qwen3-30b-a3b-fp8Alibaba$۰.۰۵۱$۰.۰۲۵$۰.۳۴
cf.granite-4.0-h-microIBM$۰.۰۱۷$۰.۰۰۸$۰.۱۱
cf.gpt-oss-120bOpenAI$۰.۳۵$۰.۱۷۵$۰.۷۵
cf.gpt-oss-20bOpenAI$۰.۲۰$۰.۱۰$۰.۳۰

مثال‌های درخواست/پاسخ API

مثال تبدیل متن به گفتار ElevenLabs

bash
curl https://api.avalai.ir/v1/audio/speech \
  -H "Authorization: Bearer $AVALAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "eleven_flash_v2_5",
    "input": "روباه قهوه‌ای سریع از روی سگ تنبل پرید.",
    "voice": "coral"
  }' \
  --output speech.mp3

مثال رونویسی ElevenLabs

bash
curl https://api.avalai.ir/v1/audio/transcriptions \
  -H "Authorization: Bearer $AVALAI_API_KEY" \
  -F file=@audio.mp3 \
  -F model=scribe_v2

نمونه پاسخ:

json
{
  "text": "روباه قهوه‌ای سریع از روی سگ تنبل پرید.",
  "task": "transcribe",
  "language": "fa",
  "duration": 2.5,
  "words": [
    {"word": "روباه", "start": 0.0, "end": 0.25},
    {"word": "قهوه‌ای", "start": 0.25, "end": 0.45},
    ...
  ]
}

مثال تولید تصویر Cloudflare

bash
curl https://api.avalai.ir/v1/images/generations \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $AVALAI_API_KEY" \
  -d '{
    "model": "cf.flux-2-klein-9b",
    "prompt": "یک شهر آینده‌نگر در غروب خورشید با ماشین‌های پرنده",
    "n": 1,
    "size": "1024x1024"
  }'

مثال Embedding Cloudflare

bash
curl https://api.avalai.ir/v1/embeddings \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $AVALAI_API_KEY" \
  -d '{
    "model": "cf.qwen3-embedding-0.6b",
    "input": "یادگیری ماشین به کامپیوترها امکان یادگیری از داده‌ها را می‌دهد."
  }'

مقایسه قیمت‌ها

مدل‌های TTS ElevenLabs

مدلهزینه/ثانیهبهترین برای
eleven_flash_v2_5$۰.۰۰۲۵برنامه‌های بلادرنگ، تأخیر کم
eleven_turbo_v2_5$۰.۰۰۲۵تعادل کیفیت و سرعت
eleven_multilingual_v2$۰.۰۰۵بالاترین کیفیت، دامنه احساسی

مدل‌های تصویر Cloudflare

مدلبه ازای تصویر (۱ مگاپیکسل)بهترین برای
cf.flux-2-klein-4b$۰.۰۱۰تولید مقرون‌به‌صرفه
cf.flux-2-dev$۰.۰۱۰توسعه و آزمایش
cf.flux-2-klein-9b$۰.۰۱۵خروجی با کیفیت بالاتر

منابع مرتبط