داشبورد توسعه‌دهنده
پرسش از هوش مصنوعی
پرسش از هوش مصنوعی

مدل‌های RunwayML

AvalAI دسترسی به مدل‌های پیشرفته هوش مصنوعی RunwayML برای تولید ویدیو، ویرایش تصویر و تبدیل متن به گفتار را از طریق API یکپارچه ما فراهم می‌کند. این صفحه جزئیات مدل‌های موجود RunwayML، قابلیت‌های آن‌ها و موارد استفاده بهینه را شرح می‌دهد.

مرور کلی

RunwayML یک شرکت پیشرو در زمینه هوش مصنوعی است که در ابزارهای خلاقانه برای تولید ویدیو، ویرایش تصویر و سنتز صدا تخصص دارد. از طریق AvalAI، می‌توانید با استفاده از اندپوینت‌های آشنای سازگار با OpenAI به مدل‌های قدرتمند RunwayML دسترسی داشته باشید که یکپارچه‌سازی با کدهای موجود را یکپارچه می‌کند.

مستندات رسمی: مستندات API RunwayML

مدل‌های تولید ویدیو

gen4.5

مدل پرچمدار تولید ویدیوی RunwayML با کیفیت حرکت پیشرفته، پایبندی به پرامپت و وفاداری بصری. Gen-4.5 مدل برتر تولید ویدیوی جهان با امتیاز 1,247 Elo در معیار Artificial Analysis Text to Video است.

ویژگیجزئیات
شناسه مدلgen4.5
نوعتولید ویدیو
مدت زمان2-10 ثانیه
رزولوشن‌ها1280x720، 720x1280، 1920x1080، 1080x1920 و بیشتر
رزولوشن پیش‌فرض1280x720
مدت زمان پیش‌فرض5 ثانیه
تصویر مرجعپشتیبانی می‌شود (الزامی)
قیمت‌گذاری$0.12 به ازای هر ثانیه ویدیو
اندپوینت APIv1/videos
بهترین برایمحتوای سینمایی، ویدیوهای حرفه‌ای، صحنه‌های پیچیده، شخصیت‌های بیانگر

ویژگی‌های کلیدی

  • برتر جهان: امتیاز 1,247 Elo در معیار Artificial Analysis Text to Video
  • کیفیت پیشرفته: وفاداری بصری بی‌نظیر و پایبندی دقیق به پرامپت
  • دقت فیزیکی: فیزیک واقع‌گرایانه با دینامیک مناسب، برخوردها و حرکت طبیعی
  • رندر صحنه‌های پیچیده: صحنه‌های پیچیده و چند عنصری با ترکیب‌بندی تفصیلی
  • شخصیت‌های بیانگر: احساسات ظریف، حرکات طبیعی و جزئیات صورت واقع‌گرایانه
  • انسجام زمانی: حفظ هماهنگی در طول حرکت و زمان

⚠️ مهم: محدودیت تعداد کاراکترهای پرامپت

فیلد prompt حداکثر 1000 کاراکتر را می‌پذیرد. اگر پرامپت شما از این حد بیشتر شود، API خطا برمی‌گرداند و تولید ویدیو با شکست مواجه می‌شود.

مثال استفاده

bash
curl -X POST "https://api.avalai.ir/v1/videos" \
  -H "Authorization: Bearer $AVALAI_API_KEY" \
  -H "Content-Type: multipart/form-data" \
  -F prompt="صحنه سینمایی از زن جوانی با ویژگی‌های چشمگیر، در نمای نزدیک که نگاه شدید او را برجسته می‌کند." \
  -F model="gen4.5" \
  -F size="1920x1080" \
  -F seconds="5" \
  -F input_reference="@portrait_reference.jpeg;type=image/jpeg"
python
from openai import OpenAI
import time

client = OpenAI(
    api_key="your-avalai-api-key",
    base_url="https://api.avalai.ir/v1",
)

# ایجاد ویدیو با gen4.5
video = client.videos.create(
    prompt="صحنه سینمایی از زن جوانی با ویژگی‌های چشمگیر، در نمای نزدیک که نگاه شدید او را برجسته می‌کند.",
    input_reference=open("portrait_reference.jpeg", "rb"),
    model="gen4.5",
    size="1920x1080",
    seconds="5",
)

print(f"تولید ویدیو شروع شد: {video.id}")

# دریافت وضعیت برای تکمیل
while True:
    video_status = client.videos.retrieve(video.id)

    if video_status.status == "completed":
        print(f"ویدیو آماده است! ID: {video.id}")
        with client.with_streaming_response.videos.retrieve_content(
            video.id
        ) as response:
            with open("gen45_output.mp4", "wb") as f:
                for chunk in response.iter_bytes():
                    f.write(chunk)
        break
    elif video_status.status == "failed":
        print(f"تولید ناموفق بود: {video_status.error}")
        break

    time.sleep(10)
javascript
import { OpenAI } from "openai";
import fs from 'fs';

const client = new OpenAI({
  apiKey: process.env.AVALAI_API_KEY,
  baseURL: "https://api.avalai.ir/v1",
});

const video = await client.videos.create({
  prompt: "صحنه سینمایی از زن جوانی با ویژگی‌های چشمگیر، در نمای نزدیک که نگاه شدید او را برجسته می‌کند.",
  input_reference: fs.createReadStream("portrait_reference.jpeg"),
  model: "gen4.5",
  size: "1920x1080",
  seconds: "5"
});

console.log(`تولید ویدیو شروع شد: ${video.id}`);

gen4_turbo

مدل تولید ویدیوی پرسرعت که از ویدیوهای 2 تا 10 ثانیه‌ای با ورودی تصویر مرجع پشتیبانی می‌کند. عالی برای نمونه‌سازی سریع و گردش‌های کاری تولید محتوا.

ویژگیجزئیات
شناسه مدلgen4_turbo
نوعتولید ویدیو
مدت زمان2-10 ثانیه
رزولوشن‌ها1280x720، 720x1280، 1920x1080، 1080x1920 و بیشتر
رزولوشن پیش‌فرض1280x720
مدت زمان پیش‌فرض5 ثانیه
تصویر مرجعپشتیبانی می‌شود (الزامی)
قیمت‌گذاری$0.05 به ازای هر ثانیه ویدیو
اندپوینت APIv1/videos
بهترین برایتولید سریع ویدیو، نمونه‌سازی، تولید محتوا با مراجع تصویری

⚠️ مهم: محدودیت تعداد کاراکترهای پرامپت

فیلد prompt حداکثر 1000 کاراکتر را می‌پذیرد. اگر پرامپت شما از این حد بیشتر شود، API خطا برمی‌گرداند و تولید ویدیو با شکست مواجه می‌شود. پرامپت‌های خود را مختصر نگه دارید و روی مهم‌ترین عناصر بصری و حرکتی تمرکز کنید.

مدل‌های ویرایش تصویر

gen4_image

مدل ویرایش تصویر پیشرفته که از رزولوشن‌های متعدد تا 1920x1080 پشتیبانی می‌کند.

ویژگیجزئیات
شناسه مدلgen4_image
نوعویرایش تصویر
رزولوشن پیش‌فرض1024x1024
قیمت‌گذاری$0.05 به ازای هر تصویر (720p)
$0.08 به ازای هر تصویر (1080p)
اندپوینت APIv1/images/edits
بهترین برایویرایش تصویر با کیفیت بالا، گردش‌های کاری حرفه‌ای

gen4_image_turbo

نسخه سریع‌تر ویرایش تصویر که برای سرعت بهینه شده است.

ویژگیجزئیات
شناسه مدلgen4_image_turbo
نوعویرایش تصویر (سریع)
رزولوشن پیش‌فرض1024x1024
قیمت‌گذاری$0.02 به ازای هر تصویر
اندپوینت APIv1/images/edits
بهترین برایویرایش سریع تصویر، پردازش دسته‌ای

مدل تبدیل متن به گفتار

runwayml.eleven_multilingual_v2

مدل پیشرفته تبدیل متن به گفتار چندزبانه که از طریق یکپارچه‌سازی RunwayML با ElevenLabs ارائه می‌شود.

توجه

این مدل از طریق یکپارچه‌سازی RunwayML در دسترس است و هنگام فراخوانی از طریق AvalAI از شناسه مدل eleven_multilingual_v2 استفاده می‌کند. برای دسترسی مستقیم به مدل‌های ElevenLabs با ویژگی‌های اضافی (از جمله مدل‌های جدیدتر مانند Turbo v2.5، Flash v2.5 و قابلیت‌های STT)، به مدل‌های ElevenLabs مراجعه کنید.

ویژگیجزئیات
شناسه مدلeleven_multilingual_v2 (از طریق RunwayML)
نوعتبدیل متن به گفتار
زبان‌هاپشتیبانی از زبان‌های متعدد
قیمت‌گذاری$0.000015 به ازای هر کاراکتر
اندپوینت APIv1/audio/speech
بهترین برایبرنامه‌های چندزبانه، سنتز صدای طبیعی

مقایسه ارائه‌دهنده مستقیم ElevenLabs با یکپارچه‌سازی RunwayML

ویژگییکپارچه‌سازی RunwayMLElevenLabs مستقیم
شناسه مدلeleven_multilingual_v2eleven_multilingual_v2، eleven_turbo_v2، eleven_turbo_v2_5، eleven_flash_v2، eleven_flash_v2_5
قیمت‌گذاری$0.000015/کاراکتر$0.0025-$0.005/ثانیه
پشتیبانی STTخیربله (scribe_v1، scribe_v2)
مدل‌های جدیدخیربله (Flash v2.5، Turbo v2.5)
گزینه‌های صداصداهای استاندارد OpenAIصداهای بومی ElevenLabs

خلاصه قیمت‌گذاری

مدلقیمت‌گذاری
gen4_turbo$0.05 به ازای هر ثانیه ویدیو
gen4_image$0.05 به ازای هر تصویر (720p)
$0.08 به ازای هر تصویر (1080p)
gen4_image_turbo$0.02 به ازای هر تصویر
eleven_multilingual_v2$0.000015 به ازای هر کاراکتر

برای اطلاعات دقیق قیمت‌گذاری، به صفحه قیمت‌گذاری مراجعه کنید.

منابع مرتبط