مدلهای RunwayML
AvalAI دسترسی به مدلهای پیشرفته هوش مصنوعی RunwayML برای تولید ویدیو، ویرایش تصویر و تبدیل متن به گفتار را از طریق API یکپارچه ما فراهم میکند. این صفحه جزئیات مدلهای موجود RunwayML، قابلیتهای آنها و موارد استفاده بهینه را شرح میدهد.
مرور کلی
RunwayML یک شرکت پیشرو در زمینه هوش مصنوعی است که در ابزارهای خلاقانه برای تولید ویدیو، ویرایش تصویر و سنتز صدا تخصص دارد. از طریق AvalAI، میتوانید با استفاده از اندپوینتهای آشنای سازگار با OpenAI به مدلهای قدرتمند RunwayML دسترسی داشته باشید که یکپارچهسازی با کدهای موجود را یکپارچه میکند.
مستندات رسمی: مستندات API RunwayML
مدلهای تولید ویدیو
gen4.5
مدل پرچمدار تولید ویدیوی RunwayML با کیفیت حرکت پیشرفته، پایبندی به پرامپت و وفاداری بصری. Gen-4.5 مدل برتر تولید ویدیوی جهان با امتیاز 1,247 Elo در معیار Artificial Analysis Text to Video است.
| ویژگی | جزئیات |
|---|---|
| شناسه مدل | gen4.5 |
| نوع | تولید ویدیو |
| مدت زمان | 2-10 ثانیه |
| رزولوشنها | 1280x720، 720x1280، 1920x1080، 1080x1920 و بیشتر |
| رزولوشن پیشفرض | 1280x720 |
| مدت زمان پیشفرض | 5 ثانیه |
| تصویر مرجع | پشتیبانی میشود (الزامی) |
| قیمتگذاری | $0.12 به ازای هر ثانیه ویدیو |
| اندپوینت API | v1/videos |
| بهترین برای | محتوای سینمایی، ویدیوهای حرفهای، صحنههای پیچیده، شخصیتهای بیانگر |
ویژگیهای کلیدی
- برتر جهان: امتیاز 1,247 Elo در معیار Artificial Analysis Text to Video
- کیفیت پیشرفته: وفاداری بصری بینظیر و پایبندی دقیق به پرامپت
- دقت فیزیکی: فیزیک واقعگرایانه با دینامیک مناسب، برخوردها و حرکت طبیعی
- رندر صحنههای پیچیده: صحنههای پیچیده و چند عنصری با ترکیببندی تفصیلی
- شخصیتهای بیانگر: احساسات ظریف، حرکات طبیعی و جزئیات صورت واقعگرایانه
- انسجام زمانی: حفظ هماهنگی در طول حرکت و زمان
⚠️ مهم: محدودیت تعداد کاراکترهای پرامپت
فیلد
promptحداکثر 1000 کاراکتر را میپذیرد. اگر پرامپت شما از این حد بیشتر شود، API خطا برمیگرداند و تولید ویدیو با شکست مواجه میشود.
مثال استفاده
curl -X POST "https://api.avalai.ir/v1/videos" \
-H "Authorization: Bearer $AVALAI_API_KEY" \
-H "Content-Type: multipart/form-data" \
-F prompt="صحنه سینمایی از زن جوانی با ویژگیهای چشمگیر، در نمای نزدیک که نگاه شدید او را برجسته میکند." \
-F model="gen4.5" \
-F size="1920x1080" \
-F seconds="5" \
-F input_reference="@portrait_reference.jpeg;type=image/jpeg"from openai import OpenAI
import time
client = OpenAI(
api_key="your-avalai-api-key",
base_url="https://api.avalai.ir/v1",
)
# ایجاد ویدیو با gen4.5
video = client.videos.create(
prompt="صحنه سینمایی از زن جوانی با ویژگیهای چشمگیر، در نمای نزدیک که نگاه شدید او را برجسته میکند.",
input_reference=open("portrait_reference.jpeg", "rb"),
model="gen4.5",
size="1920x1080",
seconds="5",
)
print(f"تولید ویدیو شروع شد: {video.id}")
# دریافت وضعیت برای تکمیل
while True:
video_status = client.videos.retrieve(video.id)
if video_status.status == "completed":
print(f"ویدیو آماده است! ID: {video.id}")
with client.with_streaming_response.videos.retrieve_content(
video.id
) as response:
with open("gen45_output.mp4", "wb") as f:
for chunk in response.iter_bytes():
f.write(chunk)
break
elif video_status.status == "failed":
print(f"تولید ناموفق بود: {video_status.error}")
break
time.sleep(10)import { OpenAI } from "openai";
import fs from 'fs';
const client = new OpenAI({
apiKey: process.env.AVALAI_API_KEY,
baseURL: "https://api.avalai.ir/v1",
});
const video = await client.videos.create({
prompt: "صحنه سینمایی از زن جوانی با ویژگیهای چشمگیر، در نمای نزدیک که نگاه شدید او را برجسته میکند.",
input_reference: fs.createReadStream("portrait_reference.jpeg"),
model: "gen4.5",
size: "1920x1080",
seconds: "5"
});
console.log(`تولید ویدیو شروع شد: ${video.id}`);gen4_turbo
مدل تولید ویدیوی پرسرعت که از ویدیوهای 2 تا 10 ثانیهای با ورودی تصویر مرجع پشتیبانی میکند. عالی برای نمونهسازی سریع و گردشهای کاری تولید محتوا.
| ویژگی | جزئیات |
|---|---|
| شناسه مدل | gen4_turbo |
| نوع | تولید ویدیو |
| مدت زمان | 2-10 ثانیه |
| رزولوشنها | 1280x720، 720x1280، 1920x1080، 1080x1920 و بیشتر |
| رزولوشن پیشفرض | 1280x720 |
| مدت زمان پیشفرض | 5 ثانیه |
| تصویر مرجع | پشتیبانی میشود (الزامی) |
| قیمتگذاری | $0.05 به ازای هر ثانیه ویدیو |
| اندپوینت API | v1/videos |
| بهترین برای | تولید سریع ویدیو، نمونهسازی، تولید محتوا با مراجع تصویری |
⚠️ مهم: محدودیت تعداد کاراکترهای پرامپت
فیلد
promptحداکثر 1000 کاراکتر را میپذیرد. اگر پرامپت شما از این حد بیشتر شود، API خطا برمیگرداند و تولید ویدیو با شکست مواجه میشود. پرامپتهای خود را مختصر نگه دارید و روی مهمترین عناصر بصری و حرکتی تمرکز کنید.
مدلهای ویرایش تصویر
gen4_image
مدل ویرایش تصویر پیشرفته که از رزولوشنهای متعدد تا 1920x1080 پشتیبانی میکند.
| ویژگی | جزئیات |
|---|---|
| شناسه مدل | gen4_image |
| نوع | ویرایش تصویر |
| رزولوشن پیشفرض | 1024x1024 |
| قیمتگذاری | $0.05 به ازای هر تصویر (720p) $0.08 به ازای هر تصویر (1080p) |
| اندپوینت API | v1/images/edits |
| بهترین برای | ویرایش تصویر با کیفیت بالا، گردشهای کاری حرفهای |
gen4_image_turbo
نسخه سریعتر ویرایش تصویر که برای سرعت بهینه شده است.
| ویژگی | جزئیات |
|---|---|
| شناسه مدل | gen4_image_turbo |
| نوع | ویرایش تصویر (سریع) |
| رزولوشن پیشفرض | 1024x1024 |
| قیمتگذاری | $0.02 به ازای هر تصویر |
| اندپوینت API | v1/images/edits |
| بهترین برای | ویرایش سریع تصویر، پردازش دستهای |
مدل تبدیل متن به گفتار
runwayml.eleven_multilingual_v2
مدل پیشرفته تبدیل متن به گفتار چندزبانه که از طریق یکپارچهسازی RunwayML با ElevenLabs ارائه میشود.
توجه
این مدل از طریق یکپارچهسازی RunwayML در دسترس است و هنگام فراخوانی از طریق AvalAI از شناسه مدل eleven_multilingual_v2 استفاده میکند. برای دسترسی مستقیم به مدلهای ElevenLabs با ویژگیهای اضافی (از جمله مدلهای جدیدتر مانند Turbo v2.5، Flash v2.5 و قابلیتهای STT)، به مدلهای ElevenLabs مراجعه کنید.
| ویژگی | جزئیات |
|---|---|
| شناسه مدل | eleven_multilingual_v2 (از طریق RunwayML) |
| نوع | تبدیل متن به گفتار |
| زبانها | پشتیبانی از زبانهای متعدد |
| قیمتگذاری | $0.000015 به ازای هر کاراکتر |
| اندپوینت API | v1/audio/speech |
| بهترین برای | برنامههای چندزبانه، سنتز صدای طبیعی |
مقایسه ارائهدهنده مستقیم ElevenLabs با یکپارچهسازی RunwayML
| ویژگی | یکپارچهسازی RunwayML | ElevenLabs مستقیم |
|---|---|---|
| شناسه مدل | eleven_multilingual_v2 | eleven_multilingual_v2، eleven_turbo_v2، eleven_turbo_v2_5، eleven_flash_v2، eleven_flash_v2_5 |
| قیمتگذاری | $0.000015/کاراکتر | $0.0025-$0.005/ثانیه |
| پشتیبانی STT | خیر | بله (scribe_v1، scribe_v2) |
| مدلهای جدید | خیر | بله (Flash v2.5، Turbo v2.5) |
| گزینههای صدا | صداهای استاندارد OpenAI | صداهای بومی ElevenLabs |
خلاصه قیمتگذاری
| مدل | قیمتگذاری |
|---|---|
| gen4_turbo | $0.05 به ازای هر ثانیه ویدیو |
| gen4_image | $0.05 به ازای هر تصویر (720p) $0.08 به ازای هر تصویر (1080p) |
| gen4_image_turbo | $0.02 به ازای هر تصویر |
| eleven_multilingual_v2 | $0.000015 به ازای هر کاراکتر |
برای اطلاعات دقیق قیمتگذاری، به صفحه قیمتگذاری مراجعه کنید.