مدلهای جدید اضافه شدند: GLM-5.1، GLM-5v-Turbo، Nemotron-3-120B، Gemma 4، Qwen3.6-Plus و Qwen-Image-2.0
تاریخ: ۱۴۰۵-۰۱-۲۳ / (2026-04-12)
خلاصه
ما افزودن هشت مدل جدید را اعلام میکنیم: GLM-5.1 مدل پرچمدار Z.AI با عملکرد پیشرو در کدنویسی عاملی و GLM-5v-Turbo مدل چندحالتی، NVIDIA Nemotron-3-120B-A12B از طریق Cloudflare AI با پنجره زمینه ۱ میلیون توکن، مدلهای باز Gemma 4 از گوگل (نسخههای 26B و 31B) با کارایی پیشرو در صنعت، Qwen3.6-Plus از علیبابا با قابلیتهای عاملی پیشرفته و زمینه ۱ میلیون توکن، و سری Qwen-Image-2.0 برای تایپوگرافی حرفهای و تولید تصویر فوتورئالیستی.
جزئیات
Z.AI (GLM)
GLM-5.1
glm-5.1 مدل پرچمدار نسل جدید Z.AI برای مهندسی عاملی است، با قابلیتهای کدنویسی به طور قابل توجهی قویتر از نسخه قبلی. این مدل عملکرد پیشرو را در SWE-Bench Pro (۵۸.۴٪) به دست میآورد و با فاصله زیادی از GLM-5 در NL2Repo (تولید ریپو) و Terminal-Bench 2.0 (وظایف ترمینال دنیای واقعی) پیشتاز است.
| ویژگی | جزئیات |
|---|---|
| پنجره زمینه | ۲۰۰٬۰۰۰ توکن |
| قیمت ورودی | ۱.۵۴ دلار / ۱ میلیون توکن |
| قیمت ورودی کش شده | ۰.۲۸۶ دلار / ۱ میلیون توکن (۸۱٪ کاهش هزینه) |
| قیمت خروجی | ۴.۸۴ دلار / ۱ میلیون توکن |
| ورودیهای پشتیبانیشده | متن |
| خروجیهای پشتیبانیشده | متن |
| نقاط پایانی پشتیبانیشده | v1/chat/completions |
ویژگیهای کلیدی:
- پیشرو در SWE-Bench Pro: عملکرد ۵۸.۴٪، پیشتاز از همه مدلها از جمله GPT-5.4 و Claude Opus 4.6
- بهینهسازی افق بلند: حفظ بهینهسازی مولد در بیش از ۶۰۰ تکرار با بیش از ۶۰۰۰ فراخوانی ابزار
- مهندسی عاملی: ساخته شده برای اثربخشی پایدار در وظایف عاملی در جلسات طولانی
- حل مسائل پیچیده: تجزیه مسائل پیچیده، اجرای آزمایشها، خواندن نتایج و شناسایی موانع با دقت
- بازبینی خود: بازنگری استدلال و تجدیدنظر در استراتژی از طریق تکرار مکرر
- فراخوانی تابع: پشتیبانی کامل از استفاده از ابزار و یکپارچهسازیهای خارجی
- خروجیهای ساختاریافته: بازگرداندن پاسخها در قالبهای خاص و سازمانیافته
عملکرد معیار:
- SWE-Bench Pro: ۵۸.۴٪ (SOTA)
- NL2Repo: ۴۲.۷٪
- Terminal-Bench 2.0: ۶۳.۵٪
- AIME 2026: ۹۵.۳٪
- GPQA-Diamond: ۸۶.۲٪
- HLE (با ابزار): ۵۲.۳٪
GLM-5v-Turbo
glm-5v-turbo مدل بینایی چندحالتی Z.AI است که برای وظایف درک بصری با توان بالا بهینهسازی شده است.
| ویژگی | جزئیات |
|---|---|
| پنجره زمینه | ۲۰۰٬۰۰۰ توکن |
| قیمت ورودی | ۱.۲۰ دلار / ۱ میلیون توکن |
| قیمت ورودی کش شده | ۰.۲۴ دلار / ۱ میلیون توکن (۸۰٪ کاهش هزینه) |
| قیمت خروجی | ۴.۰۰ دلار / ۱ میلیون توکن |
| ورودیهای پشتیبانیشده | متن، تصویر |
| خروجیهای پشتیبانیشده | متن |
| نقاط پایانی پشتیبانیشده | v1/chat/completions |
ویژگیهای کلیدی:
- درک بینایی: پردازش و تحلیل تصاویر با دقت بالا
- پشتیبانی چند تصویر: مدیریت چندین تصویر در یک درخواست
- توان بالا: بهینهسازی شده برای پردازش بصری سریع
- کش زمینه: ۸۰٪ کاهش هزینه در ورودیهای کش شده
- فراخوانی تابع: پشتیبانی کامل از ابزار با ورودیهای بصری
- جریانسازی: پاسخهای جریانی بلادرنگ
Cloudflare AI
Nemotron-3-120B-A12B
cf.nemotron-3-120b-a12b جدیدترین مدل Nemotron از NVIDIA است که از طریق Cloudflare AI در دسترس است. این معماری ترکیبی LatentMoE از Mamba-2 + MoE + Attention با ۱۲۰ میلیارد پارامتر کل (۱۲ میلیارد فعال) استفاده میکند، طراحی شده برای گردشهای کاری عاملی، استدلال زمینه بلند و حجم کاری بالا.
| ویژگی | جزئیات |
|---|---|
| کل پارامترها | ۱۲۰B (۱۲B فعال) |
| معماری | LatentMoE - ترکیب Mamba-2 + MoE + Attention با پیشبینی چند توکن |
| پنجره زمینه | ۱٬۰۰۰٬۰۰۰ توکن |
| قیمت ورودی | ۰.۵۰ دلار / ۱ میلیون توکن |
| قیمت ورودی کش شده | ۰.۰۵ دلار / ۱ میلیون توکن (۹۰٪ کاهش هزینه) |
| قیمت خروجی | ۱.۵۰ دلار / ۱ میلیون توکن |
| ورودیهای پشتیبانیشده | متن |
| خروجیهای پشتیبانیشده | متن |
| زبانهای پشتیبانیشده | انگلیسی، فرانسوی، آلمانی، ایتالیایی، ژاپنی، اسپانیایی، چینی |
| نقاط پایانی پشتیبانیشده | v1/chat/completions |
ویژگیهای کلیدی:
- پنجره زمینه ۱M: طول زمینه پیشرو در صنعت برای اسناد و مکالمات گسترده
- گردشهای کاری عاملی: بهینهسازی شده برای عاملهای همکار و حجم کاری بالا مانند اتوماسیون تیکت IT
- استدلال قابل تنظیم: فعال یا غیرفعال کردن حالت استدلال از طریق الگوی چت
- پیشبینی چند توکن: لایههای MTP برای تولید متن سریعتر و کیفیت بهتر
- استفاده از ابزار و RAG: عالی برای فراخوانی ابزار و تولید مبتنی بر بازیابی
- مقرونبهصرفه: فقط ۱۲B پارامتر فعال برای کارایی استثنایی
نکات برجسته معیار:
- SWE-Bench (OpenHands): ۶۰.۴۷٪
- AIME 2025: ۹۰.۲۱٪
- HMMT Feb 2025 (با ابزار): ۹۴.۷۳٪
- LiveCodeBench: ۸۱.۱۹٪
گوگل
Gemma 4-26B-A4B-IT
gemma-4-26b-a4b-it مدل باز گوگل است که از تحقیقات Gemini 3 ساخته شده، با ارائه هوش بیسابقه به ازای هر پارامتر با معماری Mixture-of-Experts (۲۶B کل، ۴B فعال).
| ویژگی | جزئیات |
|---|---|
| کل پارامترها | ۲۶B (۴B فعال) |
| معماری | Mixture-of-Experts (MoE) |
| پنجره زمینه | ۱۲۸٬۰۰۰ توکن |
| قیمت ورودی | ۰.۱۳ دلار / ۱ میلیون توکن |
| قیمت ورودی کش شده | ۰.۰۱۳ دلار / ۱ میلیون توکن (۹۰٪ کاهش هزینه) |
| قیمت خروجی | ۰.۴۰ دلار / ۱ میلیون توکن |
| ورودیهای پشتیبانیشده | متن، تصویر، صدا |
| خروجیهای پشتیبانیشده | متن |
| زبانهای پشتیبانیشده | ۱۴۰ زبان |
| نقاط پایانی پشتیبانیشده | v1/chat/completions، v1/responses |
ویژگیهای کلیدی:
- هوش پیشرو: ساخته شده از تحقیقات Gemini 3 برای حداکثر هوش به ازای هر پارامتر
- معماری MoE: ۲۶B پارامتر کل با فقط ۴B فعال برای کارایی
- چندحالتی: درک قوی صدا و تصویر
- گردشهای کاری عاملی: پشتیبانی بومی از فراخوانی تابع و عاملهای خودمختار
- ۱۴۰ زبان: پشتیبانی چندزبانه فراتر از ترجمه
- حالت تفکر: استدلال گسترده برای مسائل پیچیده
- GPU مصرفی: بهینهسازی شده برای اجرا روی کامپیوترهای شخصی
عملکرد معیار:
- Arena AI (متن): ۱۴۴۱
- MMMLU: ۸۲.۶٪
- MMMU Pro: ۷۳.۸٪
- AIME 2026: ۸۸.۳٪
- LiveCodeBench v6: ۷۷.۱٪
- GPQA Diamond: ۸۲.۳٪
Gemma 4-31B-IT
gemma-4-31b-it نسخه متراکم Gemma 4 است که حداکثر قابلیت را برای کاربرانی که استفاده کامل از پارامتر را ترجیح میدهند ارائه میدهد.
| ویژگی | جزئیات |
|---|---|
| پارامترها | ۳۱B |
| معماری | ترنسفورمر متراکم |
| پنجره زمینه | ۱۲۸٬۰۰۰ توکن |
| قیمت ورودی | ۰.۱۴ دلار / ۱ میلیون توکن |
| قیمت ورودی کش شده | ۰.۰۱۴ دلار / ۱ میلیون توکن (۹۰٪ کاهش هزینه) |
| قیمت خروجی | ۰.۴۰ دلار / ۱ میلیون توکن |
| ورودیهای پشتیبانیشده | متن، تصویر، صدا |
| خروجیهای پشتیبانیشده | متن |
| زبانهای پشتیبانیشده | ۱۴۰ زبان |
| نقاط پایانی پشتیبانیشده | v1/chat/completions |
ویژگیهای کلیدی:
- کارایی پیشرو در صنعت: بالاترین امتیاز Arena AI ELO (۱۴۵۲) برای کلاس اندازه خود
- معماری متراکم: ۳۱B پارامتر کامل فعال برای حداکثر قابلیت
- استدلال چندحالتی: درک قوی صدا و تصویر
- گردشهای کاری عاملی: فراخوانی تابع بومی و پشتیبانی از عامل
- تنظیم دقیق: بهبود عملکرد برای وظایف خاص با استفاده از فریمورکهای مورد نظر شما
- حالت تفکر: قابلیتهای استدلال گسترده
عملکرد معیار:
- Arena AI (متن): ۱۴۵۲
- MMMLU: ۸۵.۲٪
- MMMU Pro: ۷۶.۹٪
- AIME 2026: ۸۹.۲٪
- LiveCodeBench v6: ۸۰.۰٪
- GPQA Diamond: ۸۴.۳٪
- τ2-bench Retail: ۸۶.۴٪
علیبابا (Qwen)
Qwen3.6-Plus
qwen3.6-plus جدیدترین مدل پرچمدار علیبابا با ارتقاء قابلیتهای عظیم است، با پنجره زمینه ۱ میلیون توکن به صورت پیشفرض، قابلیتهای کدنویسی عاملی بهبود یافته قابل توجه، و درک و استدلال چندحالتی بهتر.
| ویژگی | جزئیات |
|---|---|
| پنجره زمینه | ۱٬۰۰۰٬۰۰۰ توکن (پیشفرض) |
| قیمت ورودی | ۰.۵۰ دلار / ۱ میلیون توکن |
| قیمت ورودی (بالای ۲۵۶K) | ۲.۰۰ دلار / ۱ میلیون توکن |
| ایجاد کش | ۰.۶۲۵ دلار / ۱ میلیون توکن |
| ایجاد کش (بالای ۲۵۶K) | ۲.۵۰ دلار / ۱ میلیون توکن |
| قیمت ورودی کش شده | ۰.۰۵ دلار / ۱ میلیون توکن (۹۰٪ کاهش هزینه) |
| ورودی کش شده (بالای ۲۵۶K) | ۰.۲۰ دلار / ۱ میلیون توکن |
| قیمت خروجی | ۳.۰۰ دلار / ۱ میلیون توکن |
| قیمت خروجی (بالای ۲۵۶K) | ۶.۰۰ دلار / ۱ میلیون توکن |
| ورودیهای پشتیبانیشده | متن، تصویر |
| خروجیهای پشتیبانیشده | متن |
| نقاط پایانی پشتیبانیشده | v1/chat/completions |
ویژگیهای کلیدی:
- پنجره زمینه ۱M: زمینه پیشفرض یک میلیون توکن برای اسناد و مکالمات گسترده
- کدنویسی عاملی SOTA: از توسعه فرانتاند وب تا حل مسائل سطح ریپو پیچیده
- چندحالتی پیشرفته: دقت بیشتر و استدلال چندحالتی تیزتر
- برتری عامل کدنویسی: ۷۸.۸٪ در SWE-bench Verified، ۶۱.۶٪ در Terminal-Bench 2.0
- برنامهریزی عمیق: ۴۱.۵٪ در معیار DeepPlanning (عملکرد پیشرو)
- پشتیبانی MCP: ۴۸.۲٪ در MCPMark برای یکپارچهسازی Model Context Protocol
- دکاتلون ابزار: عملکرد قوی در سناریوهای متنوع استفاده از ابزار
عملکرد معیار:
- SWE-bench Verified: ۷۸.۸٪
- SWE-bench Multilingual: ۷۳.۸٪
- SWE-bench Pro: ۵۶.۶٪
- Terminal-Bench 2.0: ۶۱.۶٪
- TAU3-Bench: ۷۰.۷٪
- DeepPlanning: ۴۱.۵٪
- MCPMark: ۴۸.۲٪
- MMLU-Pro: ۸۸.۵٪
- SuperGPQA: ۷۱.۶٪
Qwen-Image-2.0-Pro
qwen-image-2.0-pro مدل تولید تصویر حرفهای نسل جدید علیبابا با رندر تایپوگرافی پیشرفته است که از دستورات ۱K توکن برای تولید مستقیم اینفوگرافیکهای حرفهای شامل PPT، پوستر و کمیک پشتیبانی میکند.
| ویژگی | جزئیات |
|---|---|
| رزولوشن | ۲K بومی (۲۰۴۸×۲۰۴۸) |
| قیمت ورودی | ۰.۰۰ دلار / درخواست |
| قیمت خروجی | ۷۵.۰۰ دلار / ۱ میلیون توکن (۰.۰۷۵ دلار / تصویر) |
| ورودیهای پشتیبانیشده | متن، تصویر |
| خروجیهای پشتیبانیشده | تصویر |
| نقاط پایانی پشتیبانیشده | /v1/images/generations، /v1/images/edits |
ویژگیهای کلیدی:
- تایپوگرافی حرفهای: پشتیبانی از دستورات ۱K توکن برای PPT، پوستر و اینفوگرافیک
- چیدمان پیچیده: چیدمان چند اسکریپت پیکسل-پرفکت با ترکیب متن-تصویر پیچیده
- رزولوشن ۲K بومی: ۲۰۴۸×۲۰۴۸ برای صحنههای واقعی با جزئیات دقیق
- مدل یکپارچه: تولید و ویرایش در یک مدل واحد
- فوتورئالیسم: جزئیات میکروسکوپی روی منافذ پوست، بافت پارچه، تکسچرهای معماری
- سبکهای خوشنویسی متعدد: پشتیبانی از سبکهای مختلف اسکریپت و فونت
- ویرایش تصویر: پشتیبانی کامل از وظایف ویرایش تصویر به تصویر
Qwen-Image-2.0
qwen-image-2.0 نسخه استاندارد Qwen-Image-2.0 است که همان قابلیتهای پیشرفته را با قیمت قابل دسترستر ارائه میدهد.
| ویژگی | جزئیات |
|---|---|
| رزولوشن | ۲K بومی (۲۰۴۸×۲۰۴۸) |
| قیمت ورودی | ۰.۰۰ دلار / درخواست |
| قیمت خروجی | ۳۵.۰۰ دلار / ۱ میلیون توکن (۰.۰۳۵ دلار / تصویر) |
| ورودیهای پشتیبانیشده | متن، تصویر |
| خروجیهای پشتیبانیشده | تصویر |
| نقاط پایانی پشتیبانیشده | /v1/images/generations، /v1/images/edits |
ویژگیهای کلیدی:
- رندر تایپوگرافی: پشتیبانی از تولید متن در تصویر حرفهای
- رزولوشن ۲K بومی: خروجی تصویر با کیفیت بالا
- مدل یکپارچه: قابلیتهای تولید و ویرایش ترکیب شده
- پایبندی معنایی قوی: پیروی دقیق از پرامپت
- معماری سبکتر: اندازه مدل کوچکتر با استنتاج سریعتر
- مقرونبهصرفه: قیمتگذاری قابل دسترس برای استفاده با حجم بالا
نمونههای درخواست/پاسخ API
نمونه GLM-5.1
درخواست
curl https://api.avalai.ir/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $AVALAI_API_KEY" \
-d '{
"model": "glm-5.1",
"messages": [
{
"role": "user",
"content": "یک تابع پایتون بنویسید که طولانیترین زیردنباله مشترک دو رشته را با استفاده از برنامهنویسی پویا پیدا کند."
}
]
}'پاسخ
{
"id": "chatcmpl-1234567890",
"created": 1744483200,
"model": "glm-5.1",
"object": "chat.completion",
"choices": [
{
"finish_reason": "stop",
"index": 0,
"message": {
"content": "این یک تابع پایتون است که طولانیترین زیردنباله مشترک را با استفاده از برنامهنویسی پویا پیدا میکند:\n\n
```python\ndef longest_common_subsequence(s1: str, s2: str) -> str:\n m, n = len(s1), len(s2)\n dp = [[0] * (n + 1) for _ in range(m + 1)]\n \n for i in range(1, m + 1):\n for j in range(1, n + 1):\n if s1[i-1] == s2[j-1]:\n dp[i][j] = dp[i-1][j-1] + 1\n else:\n dp[i][j] = max(dp[i-1][j], dp[i][j-1])\n \n # بازگشت برای یافتن LCS\n lcs = []\n i, j = m, n\n while i > 0 and j > 0:\n if s1[i-1] == s2[j-1]:\n lcs.append(s1[i-1])\n i -= 1\n j -= 1\n elif dp[i-1][j] > dp[i][j-1]:\n i -= 1\n else:\n j -= 1\n \n return ''.join(reversed(lcs))\n```",
"role": "assistant"
}
}
],
"usage": {
"completion_tokens": 285,
"prompt_tokens": 28,
"total_tokens": 313
},
"estimated_cost": {
"unit": "0.001423",
"irt": 142.30,
"exchange_rate": 100000
}
}نمونه Gemma 4
درخواست
curl https://api.avalai.ir/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $AVALAI_API_KEY" \
-d '{
"model": "gemma-4-31b-it",
"messages": [
{
"role": "user",
"content": "مفهوم معماری mixture-of-experts در شبکههای عصبی را توضیح دهید."
}
]
}'پاسخ
{
"id": "chatcmpl-gemma4-9876543210",
"created": 1744483200,
"model": "gemma-4-31b-it",
"object": "chat.completion",
"choices": [
{
"finish_reason": "stop",
"index": 0,
"message": {
"content": "Mixture-of-Experts (MoE) یک معماری شبکه عصبی است که از چندین زیرشبکه تخصصی (متخصصان) با مکانیزم دروازهبانی برای هدایت ورودیها به متخصصان مرتبطترین استفاده میکند...",
"role": "assistant"
}
}
],
"usage": {
"completion_tokens": 250,
"prompt_tokens": 18,
"total_tokens": 268
},
"estimated_cost": {
"unit": "0.000103",
"irt": 10.3,
"exchange_rate": 100000
}
}نمونه Qwen-Image-2.0
درخواست
curl https://api.avalai.ir/v1/images/generations \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $AVALAI_API_KEY" \
-d '{
"model": "qwen-image-2.0",
"prompt": "یک پوستر اینفوگرافیک حرفهای که مقایسه مدلهای هوش مصنوعی را با تایپوگرافی تمیز و طراحی مدرن نشان میدهد",
"n": 1,
"size": "1024x1024"
}'پاسخ
{
"created": 1744483200,
"data": [
{
"url": "https://api.avalai.ir/files/generated/img-abc123...",
"revised_prompt": "یک پوستر اینفوگرافیک حرفهای که مقایسه مدلهای هوش مصنوعی را با تایپوگرافی تمیز و طراحی مدرن نشان میدهد"
}
],
"estimated_cost": {
"unit": "0.035",
"irt": 3500.00,
"exchange_rate": 100000
}
}خلاصه قیمتگذاری
| مدل | ورودی | ورودی کش شده | خروجی | ویژه |
|---|---|---|---|---|
| glm-5.1 | $۱.۵۴/۱M | $۰.۲۸۶/۱M | $۴.۸۴/۱M | - |
| glm-5v-turbo | $۱.۲۰/۱M | $۰.۲۴/۱M | $۴.۰۰/۱M | - |
| cf.nemotron-3-120b-a12b | $۰.۵۰/۱M | $۰.۰۵/۱M | $۱.۵۰/۱M | زمینه ۱M |
| gemma-4-26b-a4b-it | $۰.۱۳/۱M | $۰.۰۱۳/۱M | $۰.۴۰/۱M | - |
| gemma-4-31b-it | $۰.۱۴/۱M | $۰.۰۱۴/۱M | $۰.۴۰/۱M | - |
| qwen3.6-plus | $۰.۵۰/۱M | $۰.۰۵/۱M | $۳.۰۰/۱M | $۲.۰۰/$۶.۰۰ بالای ۲۵۶K |
| qwen-image-2.0-pro | رایگان | رایگان | $۰.۰۷۵/تصویر | - |
| qwen-image-2.0 | رایگان | رایگان | $۰.۰۳۵/تصویر | - |