داشبورد توسعه‌دهنده
پرسش از هوش مصنوعی
پرسش از هوش مصنوعی

مدل‌های جدید اضافه شدند: GPT-4o mini TTS و مدل‌های Stability AI اکنون در دسترس هستند

تاریخ: 1404-02-14

خلاصه

AvalAI از پشتیبانی مدل GPT-4o mini TTS از OpenAI خبر می‌دهد، یک مدل تبدیل متن به گفتار جدید که بر پایه مدل زبانی قدرتمند GPT-4o mini ساخته شده است. این مدل متن را به گفتار طبیعی با کیفیت بالا و سرعت مناسب تبدیل می‌کند و تعادل عالی بین عملکرد و کارایی را ارائه می‌دهد. همچنین، ما از اضافه شدن چندین مدل جدید تولید تصویر از Stability AI برای گسترش گزینه‌های خلاقانه شما خبر می‌دهیم.


جزئیات

OpenAI

  • gpt-4o-mini-tts: یک مدل تبدیل متن به گفتار با پشتیبانی GPT-4o mini که متن را به صدای طبیعی با عملکرد بالا و سرعت پردازش سریع تبدیل می‌کند. مستندات

GPT-4o mini TTS نشان‌دهنده پیشرفت در فناوری تبدیل متن به گفتار است که با بهره‌گیری از قابلیت‌های مدل زبانی GPT-4o mini، گفتار طبیعی‌تر و بیانگرتری تولید می‌کند. این مدل برای برنامه‌هایی که نیازمند خروجی صوتی با کیفیت بالا و پردازش کارآمد هستند، مانند دستیاران مجازی، ویژگی‌های دسترسی‌پذیری محتوا و تولید محتوای صوتی ایده‌آل است.

Stability AI

همچنین با افتخار از پشتیبانی جدیدترین مدل‌های تولید تصویر از Stability AI خبر می‌دهیم:

  • stability.sd3-large-v1:0: جدیدترین مدل بزرگ Stable Diffusion 3 با قابلیت تولید تصاویر با کیفیت بالا
  • stability.sd3-5-large-v1:0: مدل پیشرفته Stable Diffusion 3.5 با قابلیت‌های ارتقا یافته
  • stability.stable-image-ultra-v1:1: تولید تصویر با کیفیت فوق‌العاده بالا و جزئیات استثنایی (نسخه 1.1)
  • stability.stable-image-ultra-v1:0: تولید تصویر با کیفیت فوق‌العاده بالا و جزئیات استثنایی (نسخه 1.0)
  • stability.stable-image-core-v1:1: مدل اصلی تولید تصویر بهینه‌سازی شده برای کارایی و کیفیت (نسخه 1.1)
  • stability.stable-image-core-v1:0: مدل اصلی تولید تصویر بهینه‌سازی شده برای کارایی و کیفیت (نسخه 1.0)

این مدل‌ها طیفی از گزینه‌ها از تولید تصویر کارآمد تا خروجی‌های با کیفیت فوق‌العاده بالا را ارائه می‌دهند که برای کاربردهای مختلف خلاقانه و حرفه‌ای مناسب هستند.

ویژگی‌های کلیدی

  • گفتار طبیعی: تولید گفتار شبیه به انسان با آهنگ و بیان مناسب
  • پردازش سریع: تبدیل سریع متن به صدا
  • عملکرد بالا: کیفیت برتر نسبت به سیستم‌های سنتی TTS
  • مصرف بهینه منابع: ساخته شده بر اساس معماری کارآمد GPT-4o mini
  • محدودیت ورودی 2000 توکن: پشتیبانی از متن‌های ورودی تا سقف 2000 توکن

قیمت‌گذاری

GPT-4o mini TTS قیمت‌گذاری رقابتی ارائه می‌دهد:

  • ورودی: 0.60 دلار به ازای هر 1 میلیون کاراکتر (کاراکترهای متنی در بخش‌های 'prompt' و 'instruction')
  • خروجی: 0.00025 دلار به ازای هر ثانیه صدای تولید شده
  • هزینه تخمینی خروجی: تقریبا 15 دلار به ازای هر دقیقه صدا (ممکن است بسته به محاسبات دقیق OpenAI متفاوت باشد)

این قیمت‌گذاری صرفه‌جویی قابل توجهی نسبت به مدل‌های رده بالاتر مانند GPT-4o Realtime را نشان می‌دهد، در حالی که عملکرد عالی خود را حفظ می‌کند.

مثال‌های استفاده از مدل GPT-4o mini TTS

python
from openai import OpenAI

client = OpenAI(api_key="your-avalai-api-key", base_url="https://api.avalai.ir/v1")

# تولید گفتار از متن
response = client.audio.speech.create(
    model="gpt-4o-mini-tts",
    voice="alloy",
    input="به AvalAI خوش آمدید! ما از معرفی مدل جدید GPT-4o mini TTS برای تولید گفتار طبیعی هیجان‌زده هستیم.",
)

# ذخیره صدا در فایل
response.stream_to_file("output.mp3")
javascript
import { OpenAI } from "openai";
import * as fs from "fs";

const client = new OpenAI({
  apiKey: process.env.AVALAI_API_KEY,
  baseURL: "https://api.avalai.ir/v1",
});

async function generateSpeech() {
  const response = await client.audio.speech.create({
    model: "gpt-4o-mini-tts",
    voice: "alloy",
    input:
      "به AvalAI خوش آمدید! ما از معرفی مدل جدید GPT-4o mini TTS برای تولید گفتار طبیعی هیجان‌زده هستیم.",
  });

  const buffer = Buffer.from(await response.arrayBuffer());
  fs.writeFileSync("output.mp3", buffer);
}

generateSpeech();

محدودیت‌های نرخ

GPT-4o mini TTS در سطوح کاربری زیر در دسترس است:

سطحدرخواست در دقیقه (RPM)توکن در دقیقه (TPM)
سطح 150050,000
سطح 22,000150,000
سطح 35,000600,000
سطح 410,0002,000,000
سطح 510,0008,000,000

توجه داشته باشید که سطح رایگان از این مدل پشتیبانی نمی‌کند.

به‌روزرسانی‌های پاسخ API: اطلاعات هزینه تخمینی

ویژگی جدیدی به پاسخ‌های API خود اضافه کرده‌ایم: یک دیکشنری estimated_cost که اطلاعات قیمت‌گذاری را در چندین ارز ارائه می‌دهد. این به شما کمک می‌کند تا هزینه‌های استفاده از API را به طور مؤثرتری پیگیری و مدیریت کنید. این دیکشنری شامل موارد زیر است:

  • unit: هزینه به دلار آمریکا/تتر (USDT)
  • irt: هزینه به تومان (IRT)، محاسبه شده به صورت هزینه دلار × نرخ تبدیل USDT-IRT
  • exchange_rate: نرخ تبدیل فعلی USDT-IRT مورد استفاده برای تبدیل

مثال پاسخ با هزینه تخمینی:

json
{
  "id": "response-123456",
  "object": "chat.completion",
  "created": 1714911234,
  "model": "gpt-4o-mini-tts",
  "choices": [...],
  "usage": {
    "prompt_tokens": 42,
    "completion_tokens": 128,
    "total_tokens": 170
  },
  "estimated_cost": {
    "unit": 0.0025,
    "irt": 200,
    "exchange_rate": 80000
  }
}

لطفا توجه داشته باشید که:

  • این فیلد ممکن است در تمام پاسخ‌ها موجود نباشد
  • برای درخواست‌های معمولی (غیر جریانی)، در پاسخ اصلی گنجانده شده است
  • برای درخواست‌های جریانی (streaming)، به آخرین بخش پاسخ جریانی متصل می‌شود
  • هزینه تخمینی تضمین نمی‌شود که همیشه موجود باشد زیرا این یک تخمین است، نه مبلغ نهایی صورتحساب

پیوندهای مرتبط