داشبورد توسعه‌دهنده
پرسش از هوش مصنوعی
پرسش از هوش مصنوعی

پشتیبانی از پلتفرم Nvidia NIM اضافه شد: مدل‌های Open Weight متمرکز بر تحقیق

تاریخ: 1404-09-01 / (2025-11-22)

خلاصه

ما پشتیبانی از پلتفرم Nvidia NIM را اعلام می‌کنیم که دسترسی به مدل‌های open-weight بهینه‌شده برای تحقیق و ارزیابی را فراهم می‌کند. این مدل‌ها با قیمت‌گذاری مناسب برای تحقیق (1/10 نرخ‌های تولید) و محدودیت‌های نرخ طراحی‌شده برای استفاده آکادمیک و آزمایشی ارائه می‌شوند. پلتفرم شامل 20 مدل است که embedding، reranking، تولید متن و قابلیت‌های بینایی از ارائه‌دهندگانی مانند Meta، Google، Nvidia و Alibaba را پوشش می‌دهد.


جزئیات

پلتفرم Nvidia NIM

Nvidia NIM (Nvidia Inference Microservices) دسترسی به مدل‌های open-weight را فراهم می‌کند که برای محققان، دانشجویان و توسعه‌دهندگانی که قابلیت‌های AI را بررسی می‌کنند ایده‌آل هستند. این مدل‌ها در پلتفرم Nvidia به صورت رایگان با محدودیت‌های نرخ بسیار پایین ارائه می‌شوند، و ما دسترسی به آن‌ها را با قیمت‌گذاری مناسب برای تحقیق (تقریبا 1/10 نرخ مدل‌های تولید) فراهم می‌کنیم.

نکته مهم: این‌ها مدل‌های متمرکز بر تحقیق هستند، نه سرویس‌های عملیاتی. آن‌ها برای موارد زیر طراحی شده‌اند:

  • تحقیقات آکادمیک و آزمایشی
  • ارزیابی و معیارسنجی مدل
  • اهداف آموزشی
  • توسعه اثبات مفهوم (proof-of-concept)

برای بارهای کاری تولیدی، توصیه می‌کنیم از نسخه‌های production-grade موجود از سایر ارائه‌دهندگان استفاده کنید (مثلا Groq برای مدل‌های Llama).

مدل‌های موجود

مدل‌های Embedding

Embeddingهای مبتنی بر Llama:

  • nvidia_nim.llama-3.2-nemoretriever-300m-embed-v1: مدل embedding فشرده (300M پارامتر) - مستندات
  • nvidia_nim.llama-3.2-nemoretriever-300m-embed-v2: مدل embedding فشرده به‌روزشده - مستندات
  • nvidia_nim.llama-3.2-nemoretriever-1b-vlm-embed-v1: مدل embedding vision-language (1B پارامتر) - مستندات
  • nvidia_nim.llama-3.2-nv-embedqa-1b-v2: embeddings متمرکز بر پرسش و پاسخ - مستندات

Embeddingهای عمومی:

  • nvidia_nim.nv-embedqa-e5-v5: معماری E5 برای وظایف پرسش و پاسخ - مستندات
  • nvidia_nim.nv-embed-v1: مدل embedding همه‌منظوره - مستندات
  • nvidia_nim.bge-m3: مدل embedding چندزبانه BAAI - مستندات

مدل‌های Reranking

  • nvidia_nim.llama-3.2-nemoretriever-500m-rerank-v2: مدل reranking فشرده (500M پارامتر) - مستندات
  • nvidia_nim.llama-3.2-nv-rerankqa-1b-v2: reranking متمرکز بر پرسش و پاسخ (1B پارامتر) - مستندات
  • nvidia_nim.nv-rerankqa-mistral-4b-v3: reranking مبتنی بر Mistral (4B پارامتر) - مستندات

مدل‌های تولید متن

مدل‌های تخصصی:

  • nvidia_nim.nemotron-parse: تجزیه و استخراج اسناد - مستندات
  • nvidia_nim.nvidia-nemotron-nano-9b-v2: مدل تولید فشرده (9B پارامتر) - مستندات
  • nvidia_nim.eurollm-9b-instruct: مدل دستوری متمرکز بر اروپا - مستندات
  • nvidia_nim.gemma-3-1b-it: مدل دستوری فشرده Google - مستندات

مدل‌های پیشرفته:

  • nvidia_nim.gpt-oss-20b: معماری GPT متن‌باز (20B پارامتر) - مستندات
  • nvidia_nim.gpt-oss-120b: GPT بزرگ متن‌باز (120B پارامتر) - مستندات
  • nvidia_nim.qwen3-next-80b-a3b-thinking: مدل استدلال Alibaba (80B پارامتر) - مستندات
  • nvidia_nim.llama-4-scout-17b-16e-instruct: نسخه کارآمد Llama از Meta - مستندات
  • nvidia_nim.llama-3.1-nemotron-ultra-253b-v1: مدل Nemotron فوق‌العاده بزرگ - مستندات
  • nvidia_nim.llama-3.3-nemotron-super-49b-v1.5: نسخه بهینه‌شده Nemotron - مستندات

مدل‌های بینایی

  • nvidia_nim.nemotron-nano-12b-v2-vl: مدل vision-language برای وظایف مالتی‌مودال - مستندات

محدودیت‌های نرخ

تمام مدل‌های Nvidia NIM محدودیت‌های نرخ زیر را بر اساس سطح شما دارند:

سطحمحدودیت نرخ
پایه3 (فراخوانی / دقیقه)
سطح ۱5 (فراخوانی / دقیقه)
سطح ۲10 (فراخوانی / دقیقه)
سطح ۳15 (فراخوانی / دقیقه)
سطح ۴20 (فراخوانی / دقیقه)
سطح ۵30 (فراخوانی / دقیقه)

توجه: این محدودیت‌های نرخ برای تحقیق و آزمایش طراحی شده‌اند. برای بارهای کاری تولیدی که نیاز به توان عملیاتی بالاتر دارند، استفاده از معادل‌های production-grade از سایر ارائه‌دهندگان را در نظر بگیرید.

مقایسه قیمت‌گذاری

مدل‌های Nvidia NIM با قیمت تقریبا 1/10 معادل‌های تولیدی ارائه می‌شوند. به عنوان مثال:

قیمت‌گذاری تحقیق در مقابل تولید:

مدلارائه‌دهندهورودی ($/1M)ورودی کش‌شده ($/1M)خروجی ($/1M)
llama-4-scout-17b-16e-instructNvidia NIM (تحقیق)$0.027$0.014$0.085
llama-4-scout-17b-16e-instructGroq (تولید)$0.11$0.055$0.34

این ساختار قیمت‌گذاری مدل‌های Nvidia NIM را برای تحقیق، ارزیابی و یادگیری مقرون‌به‌صرفه می‌کند.

نمونه درخواست/پاسخ API

نمونه مدل Embedding

bash
curl https://api.avalai.ir/v1/embeddings \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $AVALAI_API_KEY" \
  -d '{
    "model": "nvidia_nim.nv-embed-v1",
    "input": "پردازش زبان طبیعی به ماشین‌ها امکان درک زبان انسان را می‌دهد"
  }'

نمونه تولید متن

bash
curl https://api.avalai.ir/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $AVALAI_API_KEY" \
  -d '{
    "model": "nvidia_nim.llama-3.3-nemotron-super-49b-v1.5",
    "messages": [
      {
        "role": "user",
        "content": "تفاوت بین یادگیری با ناظر و بدون ناظر را توضیح دهید."
      }
    ]
  }'

نمونه پاسخ

json
{
  "id": "your-avalai-api-key",
  "created": 1732262400,
  "model": "nvidia_nim.llama-3.3-nemotron-super-49b-v1.5",
  "object": "chat.completion",
  "system_fingerprint": null,
  "choices": [
    {
      "finish_reason": "stop",
      "index": 0,
      "message": {
        "content": "یادگیری با ناظر از داده‌های برچسب‌دار استفاده می‌کند که مدل از جفت‌های ورودی-خروجی یاد می‌گیرد، مانند آموزش مدل برای تشخیص گربه با نشان دادن تصاویر برچسب‌دار شده به عنوان 'گربه' یا 'نه گربه'. یادگیری بدون ناظر با داده‌های بدون برچسب کار می‌کند و الگوها را به طور مستقل پیدا می‌کند، مانند گروه‌بندی مشتریان مشابه بدون دسته‌بندی‌های از پیش تعریف‌شده. تفاوت کلیدی این است که یادگیری با ناظر یک 'معلم' دارد که پاسخ‌های صحیح را ارائه می‌دهد، در حالی که یادگیری بدون ناظر ساختار را به تنهایی کشف می‌کند.",
        "role": "assistant",
        "thinking_blocks": [],
        "annotations": []
      }
    }
  ],
  "usage": {
    "completion_tokens": 85,
    "prompt_tokens": 18,
    "total_tokens": 103,
    "completion_tokens_details": null,
    "prompt_tokens_details": {
      "audio_tokens": null,
      "cached_tokens": null,
      "text_tokens": 18,
      "image_tokens": null
    }
  },
  "estimated_cost": {
    "unit": "0.0000273000",
    "irt": 3.13,
    "exchange_rate": 114600
  }
}

نمونه‌های استفاده از SDK

bash
curl https://api.avalai.ir/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $AVALAI_API_KEY" \
  -d '{
    "model": "nvidia_nim.nvidia-nemotron-nano-9b-v2",
    "messages": [
      {
        "role": "user",
        "content": "کاربردهای transformers در NLP چیست؟"
      }
    ]
  }'
python
from openai import OpenAI

client = OpenAI(api_key="your-avalai-api-key", base_url="https://api.avalai.ir/v1")

completion = client.chat.completions.create(
    model="nvidia_nim.nvidia-nemotron-nano-9b-v2",
    messages=[
        {
            "role": "user",
            "content": "کاربردهای transformers در NLP چیست؟",
        }
    ],
)

print(completion.choices[0].message.content)
javascript
import { OpenAI } from "openai";

const client = new OpenAI({
  apiKey: process.env.AVALAI_API_KEY,
  baseURL: "https://api.avalai.ir/v1",
});

const completion = await client.chat.completions.create({
  model: "nvidia_nim.nvidia-nemotron-nano-9b-v2",
  messages: [
    {
      role: "user",
      content: "کاربردهای transformers در NLP چیست؟",
    },
  ],
});

console.log(completion.choices[0].message.content);

نمونه Reranking

bash
curl https://api.avalai.ir/v1/rerank \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $AVALAI_API_KEY" \
  -d '{
    "model": "nvidia_nim.nv-rerankqa-mistral-4b-v3",
    "query": "یادگیری ماشین چیست؟",
    "documents": [
      "یادگیری ماشین زیرمجموعه‌ای از هوش مصنوعی است.",
      "Python یک زبان برنامه‌نویسی محبوب است.",
      "یادگیری عمیق از شبکه‌های عصبی با چندین لایه استفاده می‌کند."
    ]
  }'
python
from openai import OpenAI

client = OpenAI(api_key="your-avalai-api-key", base_url="https://api.avalai.ir/v1")

# توجه: استفاده از requests برای endpoint rerank
import requests

response = requests.post(
    "https://api.avalai.ir/v1/rerank",
    headers={"Authorization": f"Bearer {api_key}", "Content-Type": "application/json"},
    json={
        "model": "nvidia_nim.nv-rerankqa-mistral-4b-v3",
        "query": "یادگیری ماشین چیست؟",
        "documents": [
            "یادگیری ماشین زیرمجموعه‌ای از هوش مصنوعی است.",
            "Python یک زبان برنامه‌نویسی محبوب است.",
            "یادگیری عمیق از شبکه‌های عصبی با چندین لایه استفاده می‌کند.",
        ],
    },
)

print(response.json())
javascript
const response = await fetch("https://api.avalai.ir/v1/rerank", {
    method: "POST",
    headers: {
        "Authorization": `Bearer ${process.env.AVALAI_API_KEY}`,
        "Content-Type": "application/json"
    },
    body: JSON.stringify({
        model: "nvidia_nim.nv-rerankqa-mistral-4b-v3",
        query: "یادگیری ماشین چیست؟",
        documents: [
            "یادگیری ماشین زیرمجموعه‌ای از هوش مصنوعی است.",
            "Python یک زبان برنامه‌نویسی محبوب است.",
            "یادگیری عمیق از شبکه‌های عصبی با چندین لایه استفاده می‌کند."
        ]
    })
});

const result = await response.json();
console.log(result);

موارد استفاده

تحقیق و آکادمیک:

  • معیارسنجی عملکرد مدل در معماری‌های مختلف
  • پروژه‌های آموزشی و درسی
  • توسعه و آزمایش الگوریتم
  • بازتولید و اعتبارسنجی مقالات

توسعه و نمونه‌سازی:

  • توسعه اثبات مفهوم
  • بررسی ویژگی‌ها قبل از استقرار تولید
  • ارزیابی مدل مقرون‌به‌صرفه
  • تست یکپارچه‌سازی

توصیه نمی‌شود برای:

  • برنامه‌های تولیدی که نیاز به در دسترس بودن بالا دارند
  • سرویس‌ها با ترافیک کاربر قابل توجه
  • برنامه‌های حیاتی
  • سیستم‌های زمان واقعی که نیاز به تاخیر کم در مقیاس دارند

لینک‌های مرتبط