داشبورد توسعه‌دهنده
پرسش از هوش مصنوعی
پرسش از هوش مصنوعی

انتخاب مدل

بهترین مدل را برای عملکرد و هزینه در میان ارائه‌های متنوع ارائه‌دهندگان AvalAI انتخاب کنید.

اصول اساسی

اصول انتخاب مدل ساده است:

  • ابتدا دقت را بهینه کنید: با قدرتمندترین مدل‌ها شروع کنید تا به هدف دقت خود برسید.
  • در مرحله دوم هزینه و تاخیر را بهینه کنید: سپس تلاش کنید با ارزان‌ترین و سریع‌ترین مدل ممکن، دقت را حفظ کنید.

پیش‌فرض‌های GPT-5.5 و Responses-first

برای workloadهای خانواده OpenAI، اگر route برای حساب AvalAI شما فعال است، integrationهای پیچیده جدید را با gpt-5.5 روی /v1/responses شروع کنید. OpenAI، GPT-5.5 را مدل فعلی برای workflowهای production پیچیده، agentهای پرابزار، assistantهای grounded، retrieval با context طولانی، coding و تبدیل product spec به plan معرفی می‌کند. در AvalAI، قبل از rollout نهایی، مدل و endpoint را در نمای کلی مدل‌ها، صفحه provider و tier حساب خود بررسی کنید.

از این الگوی تصمیم‌گیری استفاده کنید:

  • با مدل قوی شروع کنید و سپس route کنید: baseline ارزیابی را با gpt-5.5، gpt-5.4-pro یا یک مدل رده‌بالای دیگر بسازید، سپس caseهای ساده را به gpt-5.4-mini، gpt-5.4-nano، مدل‌های flash، haiku یا مدل‌های سریع provider-specific بسپارید.
  • برای reasoning و ابزارها Responses را ترجیح دهید: برای reasoning، tool calling، نوبت‌های stateful، structured outputs و workflowهای چندوجهی از /v1/responses استفاده کنید. /v1/chat/completions را برای integrationهای موجود، سازگاری frameworkها یا مدل‌هایی نگه دارید که در AvalAI فقط chat-only هستند.
  • فقط مدل را عوض نکنید؛ reasoning را هم تنظیم کنید: gpt-5.5 به‌صورت پیش‌فرض reasoning متعادل medium دارد. برای flowهای حساس به latency، reasoning.effort را روی low آزمایش کنید، high یا xhigh را فقط وقتی نگه دارید که evalها بهبود کیفیت قابل‌اندازه‌گیری نشان می‌دهند، و none را فقط برای taskهای سبک بدون برنامه‌ریزی یا tool use چندمرحله‌ای به‌کار ببرید.
  • طول پاسخ را جدا کنترل کنید: به‌جای promptهای طولانی که هر درخواست را کندتر می‌کنند، از text.verbosity، بودجه خروجی صریح و max_output_tokens استفاده کنید.
  • prompt را cache-friendly نگه دارید: policyها، schemaها و توضیح ابزارهای ثابت را اول بگذارید؛ context پویای کاربر و snippetهای retrieval را عقب‌تر قرار دهید.

چک‌لیست مهاجرت برای مدل‌های پرچم‌دار جدید

مدل پرچم‌دار جدید را جایگزین drop-in برای prompt stack قبلی فرض نکنید. ابتدا baseline تازه بسازید و مهاجرت را مرحله‌ای انجام دهید:

  1. Baseline قبلی را ثابت کنید: دقت، latency، مصرف توکن، رفتار tool call و مثال‌های failure مدل production فعلی را ثبت کنید.
  2. با کوچک‌ترین prompt امن شروع کنید: policy محصول، قرارداد خروجی و قواعد safety را حفظ کنید، اما scaffolding مرحله‌به‌مرحله قدیمی را که مدل جدید لازم ندارد حذف کنید.
  3. قبل از افزودن prose، کنترل‌های API را تنظیم کنید: reasoning.effort، text.verbosity، max_output_tokens و structured outputs را روی همان eval set مقایسه کنید.
  4. Orchestration ابزار را اعتبارسنجی کنید: برای /v1/responses، tool preambleها، آیتم‌های output برگشتی، مقدارهای phase هنگام replay دستی state و مدیریت previous_response_id را بررسی کنید.
  5. فرض‌های feature میزبانی‌شده را صریح نگه دارید: ابزارهای hosted در OpenAI، tool search، compaction یا رفتار prompt-cache ممکن است بر اساس route، provider، model و account در AvalAI فرق کند. پیش از معرفی آن‌ها به‌عنوان dependency تولیدی، پشتیبانی واقعی را تایید کنید.
  6. پس از اندازه‌گیری route کنید: caseهای ساده را فقط وقتی به مدل‌های ارزان‌تر یا سریع‌تر منتقل کنید که eval suite نشان دهد کدام ردیف‌ها به مدل پرچم‌دار نیاز ندارند.

بررسی provider و مسیر deployment

راهنمای OpenAI درباره external modelها و Amazon Bedrock یک اصل مهم را برای AvalAI هم برجسته می‌کند: خانواده مدل تنها بخشی از تصمیم deployment است. پیش از جابه‌جایی workload بین providerهای AvalAI، مسیرهای smart routing یا variantهای cloud-hosted، سطح عملیاتی را بررسی کنید:

بررسیچرا در AvalAI مهم است
Model ID و routeیک خانواده مدل ممکن است ID، حد context یا پشتیبانی متفاوتی برای /v1/responses و /v1/chat/completions در providerهای مختلف داشته باشد.
برابری featureهاابزارهای hosted، MCP، web/file search، prompt caching، ورودی تصویر/صوت و streaming ممکن است بر اساس route provider متفاوت باشند.
مرز داده و ایمنیproviderهای خارجی ممکن است پس از خروج داده از مسیر اصلی درخواست AvalAI، سیاست retention، residency، logging و تضمین‌های safety متفاوتی داشته باشند.
Billing و quotaمدل ارزان‌تر اگر route انتخابی rate limit پایین‌تر، service tier متفاوت یا هزینه منطقه‌ای متفاوت داشته باشد، ممکن است برای production مناسب نباشد.
پوشش evalهمان eval set محلی را روی هر route candidate اجرا کنید و پیش از rollout، دقت، latency، هزینه، refusalها و رفتار tool-call را مقایسه کنید.

اگر یک مسیر deployment فقط از API بومی provider در دسترس است، آن را در backend خودتان نگه دارید و به‌جای فرض پشتیبانی همه featureهای hosted OpenAI در AvalAI، آن را از طریق یک function tool محدود به مدل expose کنید.

۱. ابتدا بر دقت تمرکز کنید

با تعیین یک هدف دقت مشخص برای مورد استفاده خود شروع کنید:

  • یک هدف دقت مشخص تعیین کنید: مشخص کنید چه سطحی از عملکرد برای تولید "کافی" است.
  • به عنوان مثال، ۹۰٪ از تماس‌های خدمات مشتری باید در اولین تعامل به درستی دسته‌بندی شوند.
  • یک مجموعه داده ارزیابی ایجاد کنید: مجموعه داده‌ای ایجاد کنید که به شما امکان می‌دهد عملکرد مدل را در برابر این اهداف اندازه‌گیری کنید.
  • برای گسترش مثال بالا، ۱۰۰ نمونه تعامل با درخواست‌های کاربر، پاسخ‌های مدل، پاسخ‌های صحیح و معیارهای دقت را ثبت کنید.
  • با قدرتمندترین مدل شروع کنید: با جدیدترین مدل‌های رده‌بالای AvalAI برای دستیابی به اهداف دقت خود شروع کنید:
  • OpenAI: gpt-5.5, gpt-5.4-pro, gpt-5.4, gpt-5.3-codex
  • Anthropic: claude-opus-4-8, claude-opus-4-7, claude-sonnet-4-6, claude-haiku-4-5
  • Google: gemini-3.5-flash, gemini-3.1-pro-preview, gemini-3.1-flash-lite, gemma-4-26b-a4b-it
  • XAI: grok-4.20-reasoning, grok-4.20-non-reasoning
  • DeepSeek: deepseek-v4-pro, deepseek-v4-flash
  • Alibaba: qwen3.7-max, qwen3.7-plus, qwen3.6-plus, qwen3.6-flash
  • Moonshot.ai: kimi-k2.7-code, kimi-k2.7-code-highspeed, kimi-k2.6
  • Z.AI: glm-5.2, glm-5.1, glm-5v-turbo
  • MiniMax: minimax-m3, minimax-m2.7, minimax-m2.7-highspeed
  • Fireworks.ai: nemotron-3-ultra

تعیین یک هدف دقت واقع‌بینانه

با ارزیابی تاثیر مالی تصمیمات مدل، یک هدف دقت واقع‌بینانه محاسبه کنید. به عنوان مثال، در یک سناریوی طبقه‌بندی اخبار جعلی:

  • اخبار طبقه‌بندی شده صحیح: اگر مدل آن را به درستی طبقه‌بندی کند، هزینه بررسی انسانی را صرفه‌جویی می‌کند - فرض کنیم ۵۰ دلار.
  • اخبار طبقه‌بندی شده نادرست: اگر به اشتباه یک مقاله امن را طبقه‌بندی کند یا یک مقاله خبری جعلی را از دست بدهد، ممکن است فرایند بررسی و شکایت احتمالی را فعال کند، که ممکن است ۳۰۰ دلار هزینه داشته باشد.

در این مثال، شما به ۸۵.۸٪ دقت برای سر به سر شدن نیاز دارید، بنابراین هدف‌گذاری ۹۰٪ یا بیشتر، یک بازگشت سرمایه مثبت را تضمین می‌کند. از محاسبات مشابه برای تعیین یک هدف دقت مؤثر بر اساس ساختارهای هزینه خاص خود استفاده کنید.

۲. بهینه‌سازی هزینه و تاخیر

پس از دستیابی به هدف دقت، با استفاده از یکی از این روش‌ها، هزینه و تاخیر را بهینه کنید:

  • با یک مدل کوچکتر یا سریع‌تر مقایسه کنید: آزمایش کنید که آیا یک مدل ارزان‌تر دقت قابل قبولی را حفظ می‌کند:

  • OpenAI: gpt-5.4-mini, gpt-5.4-nano یا o4-mini به جای gpt-5.5 یا gpt-5.4-pro

  • Anthropic: claude-haiku-4-5 به جای claude-opus-4-7

  • Google: gemini-3.1-flash-lite، gemini-3.1-flash-lite-preview یا gemini-2.5-flash به جای gemini-3.5-flash

  • DeepSeek: deepseek-v4-flash به جای deepseek-v4-pro

  • Alibaba: qwen3.6-flash یا qwen3.6-35b-a3b به جای qwen3.7-max یا qwen3.7-plus

  • MiniMax: minimax-m3 برای کارهای چندوجهی با زمینه بلند، minimax-m2.7-highspeed وقتی توان عملیاتی مهم است، یا minimax-m2.5 برای گردش‌کارهای کدنویسی کم‌هزینه‌تر

  • XAI: grok-4.20-non-reasoning به جای grok-4.20-reasoning برای وظایفی که به استدلال گسترده نیاز ندارند

  • تقطیر مدل: یک مدل کوچکتر را با استفاده از داده‌های جمع‌آوری شده در طول بهینه‌سازی دقت، تنظیم دقیق کنید.

استراتژی‌های اصلی که باید در نظر گرفت:

  • کاهش درخواست‌ها: تعداد تماس‌های API لازم را محدود کنید.
  • به حداقل رساندن توکن‌ها: تعداد توکن ورودی را کاهش دهید و برای خروجی‌های کوتاه‌تر بهینه‌سازی کنید.
  • انتخاب یک مدل کوچکتر: از مدل‌هایی استفاده کنید که هزینه‌ها و تاخیر کاهش یافته را با دقت حفظ شده متعادل می‌کنند.

استثنائات قاعده

اگر مورد استفاده شما به شدت به هزینه یا تاخیر حساس است، قبل از شروع آزمایش خود، آستانه‌هایی برای این معیارها تعیین کنید. مدل‌هایی که از این آستانه‌ها فراتر می‌روند را از نظر حذف کنید، سپس دقت را در محدودیت‌های خود بهینه کنید.

مثال عملی

برای نشان دادن این اصول، یک طبقه‌بندی کننده اخبار جعلی با اهداف زیر توسعه خواهیم داد:

  • دقت: دستیابی به طبقه‌بندی صحیح ۹۰٪
  • هزینه: هزینه کمتر از ۵ دلار به ازای ۱۰۰۰ مقاله
  • تاخیر: حفظ زمان پردازش کمتر از ۲ ثانیه برای هر مقاله

آزمایش‌ها

ما سه آزمایش برای رسیدن به هدف خود انجام دادیم:

  1. صفر-شات: از gpt-5.5 با یک پرامپت پایه برای ۱۰۰۰ رکورد استفاده کردیم تا خط پایه با بالاترین دقت مشخص شود.
  2. یادگیری چند-شات: gpt-5.4-mini را با ۵ نمونه چند-شات آزمایش کردیم و با هزینه کمتر از خط پایه پرچمدار به هدف دقت رسیدیم.
  3. مسیریابی مدل: موارد ساده را به gemini-3.1-flash-lite-preview و موارد دشوار را به gpt-5.5 هدایت کردیم و با میانگین هزینه کمتر به همه اهداف رسیدیم.
شناسهروشدقتهدف دقتهزینههدف هزینهمیانگین تاخیرهدف تاخیر
1gpt-5.5 صفر-شات93.0%$6.80~2s
2gpt-5.4-mini چند-شات (n=5)91.2%$2.40< 2s
3مسیریابی gemini-3.1-flash-lite-preview + gpt-5.592.1%$1.10< 2s

راهنمای انتخاب مدل مخصوص AvalAI

AvalAI دسترسی به مدل‌ها از چندین ارائه دهنده را از طریق یک API یکپارچه فراهم می‌کند. این به شما امکان می‌دهد با مدل‌های مختلف آزمایش کنید در حالی که همان ساختار کد را حفظ می‌کنید.

توصیه‌های مخصوص ارائه دهنده

مورد استفادهعملکرد برترعملکرد/هزینه متعادلمقرون به صرفه
چت عمومیgpt-5.5، claude-opus-4-8claude-sonnet-4-6، gemini-3.5-flashgpt-5.4-mini، gemini-3.1-flash-lite
استدلال پیچیدهgpt-5.5، gpt-5.4-pro، claude-opus-4-8deepseek-v4-pro، glm-5.2، qwen3.7-maxdeepseek-v4-flash، qwen3.6-flash، gemini-3.1-flash-lite
تولید کدgpt-5.5، claude-opus-4-8، glm-5.2kimi-k2.7-code، minimax-m3، qwen3.7-plusgpt-5.4-mini، deepseek-v4-flash، qwen3.6-flash
قابلیت‌های بیناییgpt-5.5، claude-opus-4-8، gemini-3.5-flashgemini-3.1-pro-preview، qwen3.7-max، minimax-m3gemini-2.5-flash، glm-5v-turbo
فراخوانی تابعgpt-5.5، claude-opus-4-8، grok-4.3gemini-3.5-flash، deepseek-v4-pro، qwen3.7-maxgpt-5.4-mini، deepseek-v4-flash، gemini-3.1-flash-lite
تعبیه‌سازی‌‌هاgemini-embedding-2، text-embedding-3-largeembed-v4.0، text-embedding-3-smallqwen3-embedding، embed-english-v3.0
تولید تصویرgpt-image-2، qwen-image-2.0-progpt-image-1.5، gemini-3.1-flash-imageqwen-image-2.0، seedream-5-0-260128

مثال پیاده‌سازی

python
from avalai import AvalAI

client = AvalAI(api_key="your_avalai_api_key")

# با یک مدل با عملکرد بالا شروع کنید
completion = client.chat.completions.create(
    model="gpt-5.5",  # مدل رده بالا برای دقت
    messages=[
        {
            "role": "user",
            "content": "این مقاله خبری را به عنوان واقعی یا جعلی طبقه‌بندی کنید: ...",
        }
    ],
)

# پس از دستیابی به اهداف دقت، به یک مدل مقرون به صرفه‌تر تغییر دهید
completion = client.chat.completions.create(
    model="gemini-3.1-flash-lite-preview",  # مدل مقرون به صرفه‌تر
    messages=[
        {
            "role": "user",
            "content": "این مقاله خبری را به عنوان واقعی یا جعلی طبقه‌بندی کنید: ...",
        }
    ],
)
نسخه معادل Responses API

وقتی مدل انتخابی از /v1/responses پشتیبانی می‌کند، این نسخه را کنار مثال Chat Completions استفاده کنید. messages به input منتقل می‌شود و متن نهایی از response.output_text خوانده می‌شود.

python
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["AVALAI_API_KEY"],
    base_url="https://api.avalai.ir/v1",
)

response = client.responses.create(
    model="gpt-5.5",
    instructions="You are a helpful assistant.",
    input="این مقاله خبری را به عنوان واقعی یا جعلی طبقه‌بندی کنید: ...",
)

print(response.output_text)
  • messagesinput
  • پیام سیستمی → instructions یا آیتم developer
  • choices[0].message.contentresponse.output_text
  • برای ابزارها و خروجی‌های چندوجهی، response.output را بر اساس type بررسی کنید.

نتیجه‌گیری

با پیروی از این اصول - بهینه‌سازی دقت در ابتدا، سپس هزینه و تاخیر - می‌توانید تصمیمات آگاهانه‌ای برای انتخاب مدل بگیرید. API یکپارچه AvalAI آزمایش با مدل‌های مختلف از ارائه‌دهندگان مختلف را برای یافتن تعادل بهینه برای مورد استفاده خاص شما آسان می‌کند.

منابع مرتبط