انتخاب مدل
بهترین مدل را برای عملکرد و هزینه در میان ارائههای متنوع ارائهدهندگان AvalAI انتخاب کنید.
اصول اساسی
اصول انتخاب مدل ساده است:
- ابتدا دقت را بهینه کنید: با قدرتمندترین مدلها شروع کنید تا به هدف دقت خود برسید.
- در مرحله دوم هزینه و تاخیر را بهینه کنید: سپس تلاش کنید با ارزانترین و سریعترین مدل ممکن، دقت را حفظ کنید.
پیشفرضهای GPT-5.5 و Responses-first
برای workloadهای خانواده OpenAI، اگر route برای حساب AvalAI شما فعال است، integrationهای پیچیده جدید را با gpt-5.5 روی /v1/responses شروع کنید. OpenAI، GPT-5.5 را مدل فعلی برای workflowهای production پیچیده، agentهای پرابزار، assistantهای grounded، retrieval با context طولانی، coding و تبدیل product spec به plan معرفی میکند. در AvalAI، قبل از rollout نهایی، مدل و endpoint را در نمای کلی مدلها، صفحه provider و tier حساب خود بررسی کنید.
از این الگوی تصمیمگیری استفاده کنید:
- با مدل قوی شروع کنید و سپس route کنید: baseline ارزیابی را با
gpt-5.5،gpt-5.4-proیا یک مدل ردهبالای دیگر بسازید، سپس caseهای ساده را بهgpt-5.4-mini،gpt-5.4-nano، مدلهای flash، haiku یا مدلهای سریع provider-specific بسپارید. - برای reasoning و ابزارها Responses را ترجیح دهید: برای reasoning، tool calling، نوبتهای stateful، structured outputs و workflowهای چندوجهی از
/v1/responsesاستفاده کنید./v1/chat/completionsرا برای integrationهای موجود، سازگاری frameworkها یا مدلهایی نگه دارید که در AvalAI فقط chat-only هستند. - فقط مدل را عوض نکنید؛ reasoning را هم تنظیم کنید:
gpt-5.5بهصورت پیشفرض reasoning متعادلmediumدارد. برای flowهای حساس به latency،reasoning.effortرا رویlowآزمایش کنید،highیاxhighرا فقط وقتی نگه دارید که evalها بهبود کیفیت قابلاندازهگیری نشان میدهند، وnoneرا فقط برای taskهای سبک بدون برنامهریزی یا tool use چندمرحلهای بهکار ببرید. - طول پاسخ را جدا کنترل کنید: بهجای promptهای طولانی که هر درخواست را کندتر میکنند، از
text.verbosity، بودجه خروجی صریح وmax_output_tokensاستفاده کنید. - prompt را cache-friendly نگه دارید: policyها، schemaها و توضیح ابزارهای ثابت را اول بگذارید؛ context پویای کاربر و snippetهای retrieval را عقبتر قرار دهید.
چکلیست مهاجرت برای مدلهای پرچمدار جدید
مدل پرچمدار جدید را جایگزین drop-in برای prompt stack قبلی فرض نکنید. ابتدا baseline تازه بسازید و مهاجرت را مرحلهای انجام دهید:
- Baseline قبلی را ثابت کنید: دقت، latency، مصرف توکن، رفتار tool call و مثالهای failure مدل production فعلی را ثبت کنید.
- با کوچکترین prompt امن شروع کنید: policy محصول، قرارداد خروجی و قواعد safety را حفظ کنید، اما scaffolding مرحلهبهمرحله قدیمی را که مدل جدید لازم ندارد حذف کنید.
- قبل از افزودن prose، کنترلهای API را تنظیم کنید:
reasoning.effort،text.verbosity،max_output_tokensو structured outputs را روی همان eval set مقایسه کنید. - Orchestration ابزار را اعتبارسنجی کنید: برای
/v1/responses، tool preambleها، آیتمهای output برگشتی، مقدارهایphaseهنگام replay دستی state و مدیریتprevious_response_idرا بررسی کنید. - فرضهای feature میزبانیشده را صریح نگه دارید: ابزارهای hosted در OpenAI، tool search، compaction یا رفتار prompt-cache ممکن است بر اساس route، provider، model و account در AvalAI فرق کند. پیش از معرفی آنها بهعنوان dependency تولیدی، پشتیبانی واقعی را تایید کنید.
- پس از اندازهگیری route کنید: caseهای ساده را فقط وقتی به مدلهای ارزانتر یا سریعتر منتقل کنید که eval suite نشان دهد کدام ردیفها به مدل پرچمدار نیاز ندارند.
بررسی provider و مسیر deployment
راهنمای OpenAI درباره external modelها و Amazon Bedrock یک اصل مهم را برای AvalAI هم برجسته میکند: خانواده مدل تنها بخشی از تصمیم deployment است. پیش از جابهجایی workload بین providerهای AvalAI، مسیرهای smart routing یا variantهای cloud-hosted، سطح عملیاتی را بررسی کنید:
| بررسی | چرا در AvalAI مهم است |
|---|---|
| Model ID و route | یک خانواده مدل ممکن است ID، حد context یا پشتیبانی متفاوتی برای /v1/responses و /v1/chat/completions در providerهای مختلف داشته باشد. |
| برابری featureها | ابزارهای hosted، MCP، web/file search، prompt caching، ورودی تصویر/صوت و streaming ممکن است بر اساس route provider متفاوت باشند. |
| مرز داده و ایمنی | providerهای خارجی ممکن است پس از خروج داده از مسیر اصلی درخواست AvalAI، سیاست retention، residency، logging و تضمینهای safety متفاوتی داشته باشند. |
| Billing و quota | مدل ارزانتر اگر route انتخابی rate limit پایینتر، service tier متفاوت یا هزینه منطقهای متفاوت داشته باشد، ممکن است برای production مناسب نباشد. |
| پوشش eval | همان eval set محلی را روی هر route candidate اجرا کنید و پیش از rollout، دقت، latency، هزینه، refusalها و رفتار tool-call را مقایسه کنید. |
اگر یک مسیر deployment فقط از API بومی provider در دسترس است، آن را در backend خودتان نگه دارید و بهجای فرض پشتیبانی همه featureهای hosted OpenAI در AvalAI، آن را از طریق یک function tool محدود به مدل expose کنید.
۱. ابتدا بر دقت تمرکز کنید
با تعیین یک هدف دقت مشخص برای مورد استفاده خود شروع کنید:
- یک هدف دقت مشخص تعیین کنید: مشخص کنید چه سطحی از عملکرد برای تولید "کافی" است.
- به عنوان مثال، ۹۰٪ از تماسهای خدمات مشتری باید در اولین تعامل به درستی دستهبندی شوند.
- یک مجموعه داده ارزیابی ایجاد کنید: مجموعه دادهای ایجاد کنید که به شما امکان میدهد عملکرد مدل را در برابر این اهداف اندازهگیری کنید.
- برای گسترش مثال بالا، ۱۰۰ نمونه تعامل با درخواستهای کاربر، پاسخهای مدل، پاسخهای صحیح و معیارهای دقت را ثبت کنید.
- با قدرتمندترین مدل شروع کنید: با جدیدترین مدلهای ردهبالای AvalAI برای دستیابی به اهداف دقت خود شروع کنید:
- OpenAI:
gpt-5.5,gpt-5.4-pro,gpt-5.4,gpt-5.3-codex - Anthropic:
claude-opus-4-8,claude-opus-4-7,claude-sonnet-4-6,claude-haiku-4-5 - Google:
gemini-3.5-flash,gemini-3.1-pro-preview,gemini-3.1-flash-lite,gemma-4-26b-a4b-it - XAI:
grok-4.20-reasoning,grok-4.20-non-reasoning - DeepSeek:
deepseek-v4-pro,deepseek-v4-flash - Alibaba:
qwen3.7-max,qwen3.7-plus,qwen3.6-plus,qwen3.6-flash - Moonshot.ai:
kimi-k2.7-code,kimi-k2.7-code-highspeed,kimi-k2.6 - Z.AI:
glm-5.2,glm-5.1,glm-5v-turbo - MiniMax:
minimax-m3,minimax-m2.7,minimax-m2.7-highspeed - Fireworks.ai:
nemotron-3-ultra
تعیین یک هدف دقت واقعبینانه
با ارزیابی تاثیر مالی تصمیمات مدل، یک هدف دقت واقعبینانه محاسبه کنید. به عنوان مثال، در یک سناریوی طبقهبندی اخبار جعلی:
- اخبار طبقهبندی شده صحیح: اگر مدل آن را به درستی طبقهبندی کند، هزینه بررسی انسانی را صرفهجویی میکند - فرض کنیم ۵۰ دلار.
- اخبار طبقهبندی شده نادرست: اگر به اشتباه یک مقاله امن را طبقهبندی کند یا یک مقاله خبری جعلی را از دست بدهد، ممکن است فرایند بررسی و شکایت احتمالی را فعال کند، که ممکن است ۳۰۰ دلار هزینه داشته باشد.
در این مثال، شما به ۸۵.۸٪ دقت برای سر به سر شدن نیاز دارید، بنابراین هدفگذاری ۹۰٪ یا بیشتر، یک بازگشت سرمایه مثبت را تضمین میکند. از محاسبات مشابه برای تعیین یک هدف دقت مؤثر بر اساس ساختارهای هزینه خاص خود استفاده کنید.
۲. بهینهسازی هزینه و تاخیر
پس از دستیابی به هدف دقت، با استفاده از یکی از این روشها، هزینه و تاخیر را بهینه کنید:
با یک مدل کوچکتر یا سریعتر مقایسه کنید: آزمایش کنید که آیا یک مدل ارزانتر دقت قابل قبولی را حفظ میکند:
OpenAI:
gpt-5.4-mini,gpt-5.4-nanoیاo4-miniبه جایgpt-5.5یاgpt-5.4-proAnthropic:
claude-haiku-4-5به جایclaude-opus-4-7Google:
gemini-3.1-flash-lite،gemini-3.1-flash-lite-previewیاgemini-2.5-flashبه جایgemini-3.5-flashDeepSeek:
deepseek-v4-flashبه جایdeepseek-v4-proAlibaba:
qwen3.6-flashیاqwen3.6-35b-a3bبه جایqwen3.7-maxیاqwen3.7-plusMiniMax:
minimax-m3برای کارهای چندوجهی با زمینه بلند،minimax-m2.7-highspeedوقتی توان عملیاتی مهم است، یاminimax-m2.5برای گردشکارهای کدنویسی کمهزینهترXAI:
grok-4.20-non-reasoningبه جایgrok-4.20-reasoningبرای وظایفی که به استدلال گسترده نیاز ندارندتقطیر مدل: یک مدل کوچکتر را با استفاده از دادههای جمعآوری شده در طول بهینهسازی دقت، تنظیم دقیق کنید.
استراتژیهای اصلی که باید در نظر گرفت:
- کاهش درخواستها: تعداد تماسهای API لازم را محدود کنید.
- به حداقل رساندن توکنها: تعداد توکن ورودی را کاهش دهید و برای خروجیهای کوتاهتر بهینهسازی کنید.
- انتخاب یک مدل کوچکتر: از مدلهایی استفاده کنید که هزینهها و تاخیر کاهش یافته را با دقت حفظ شده متعادل میکنند.
استثنائات قاعده
اگر مورد استفاده شما به شدت به هزینه یا تاخیر حساس است، قبل از شروع آزمایش خود، آستانههایی برای این معیارها تعیین کنید. مدلهایی که از این آستانهها فراتر میروند را از نظر حذف کنید، سپس دقت را در محدودیتهای خود بهینه کنید.
مثال عملی
برای نشان دادن این اصول، یک طبقهبندی کننده اخبار جعلی با اهداف زیر توسعه خواهیم داد:
- دقت: دستیابی به طبقهبندی صحیح ۹۰٪
- هزینه: هزینه کمتر از ۵ دلار به ازای ۱۰۰۰ مقاله
- تاخیر: حفظ زمان پردازش کمتر از ۲ ثانیه برای هر مقاله
آزمایشها
ما سه آزمایش برای رسیدن به هدف خود انجام دادیم:
- صفر-شات: از
gpt-5.5با یک پرامپت پایه برای ۱۰۰۰ رکورد استفاده کردیم تا خط پایه با بالاترین دقت مشخص شود. - یادگیری چند-شات:
gpt-5.4-miniرا با ۵ نمونه چند-شات آزمایش کردیم و با هزینه کمتر از خط پایه پرچمدار به هدف دقت رسیدیم. - مسیریابی مدل: موارد ساده را به
gemini-3.1-flash-lite-previewو موارد دشوار را بهgpt-5.5هدایت کردیم و با میانگین هزینه کمتر به همه اهداف رسیدیم.
| شناسه | روش | دقت | هدف دقت | هزینه | هدف هزینه | میانگین تاخیر | هدف تاخیر |
|---|---|---|---|---|---|---|---|
| 1 | gpt-5.5 صفر-شات | 93.0% | ✓ | $6.80 | ❌ | ~2s | ✓ |
| 2 | gpt-5.4-mini چند-شات (n=5) | 91.2% | ✓ | $2.40 | ✓ | < 2s | ✓ |
| 3 | مسیریابی gemini-3.1-flash-lite-preview + gpt-5.5 | 92.1% | ✓ | $1.10 | ✓ | < 2s | ✓ |
راهنمای انتخاب مدل مخصوص AvalAI
AvalAI دسترسی به مدلها از چندین ارائه دهنده را از طریق یک API یکپارچه فراهم میکند. این به شما امکان میدهد با مدلهای مختلف آزمایش کنید در حالی که همان ساختار کد را حفظ میکنید.
توصیههای مخصوص ارائه دهنده
| مورد استفاده | عملکرد برتر | عملکرد/هزینه متعادل | مقرون به صرفه |
|---|---|---|---|
| چت عمومی | gpt-5.5، claude-opus-4-8 | claude-sonnet-4-6، gemini-3.5-flash | gpt-5.4-mini، gemini-3.1-flash-lite |
| استدلال پیچیده | gpt-5.5، gpt-5.4-pro، claude-opus-4-8 | deepseek-v4-pro، glm-5.2، qwen3.7-max | deepseek-v4-flash، qwen3.6-flash، gemini-3.1-flash-lite |
| تولید کد | gpt-5.5، claude-opus-4-8، glm-5.2 | kimi-k2.7-code، minimax-m3، qwen3.7-plus | gpt-5.4-mini، deepseek-v4-flash، qwen3.6-flash |
| قابلیتهای بینایی | gpt-5.5، claude-opus-4-8، gemini-3.5-flash | gemini-3.1-pro-preview، qwen3.7-max، minimax-m3 | gemini-2.5-flash، glm-5v-turbo |
| فراخوانی تابع | gpt-5.5، claude-opus-4-8، grok-4.3 | gemini-3.5-flash، deepseek-v4-pro، qwen3.7-max | gpt-5.4-mini، deepseek-v4-flash، gemini-3.1-flash-lite |
| تعبیهسازیها | gemini-embedding-2، text-embedding-3-large | embed-v4.0، text-embedding-3-small | qwen3-embedding، embed-english-v3.0 |
| تولید تصویر | gpt-image-2، qwen-image-2.0-pro | gpt-image-1.5، gemini-3.1-flash-image | qwen-image-2.0، seedream-5-0-260128 |
مثال پیادهسازی
from avalai import AvalAI
client = AvalAI(api_key="your_avalai_api_key")
# با یک مدل با عملکرد بالا شروع کنید
completion = client.chat.completions.create(
model="gpt-5.5", # مدل رده بالا برای دقت
messages=[
{
"role": "user",
"content": "این مقاله خبری را به عنوان واقعی یا جعلی طبقهبندی کنید: ...",
}
],
)
# پس از دستیابی به اهداف دقت، به یک مدل مقرون به صرفهتر تغییر دهید
completion = client.chat.completions.create(
model="gemini-3.1-flash-lite-preview", # مدل مقرون به صرفهتر
messages=[
{
"role": "user",
"content": "این مقاله خبری را به عنوان واقعی یا جعلی طبقهبندی کنید: ...",
}
],
)نسخه معادل Responses API
وقتی مدل انتخابی از /v1/responses پشتیبانی میکند، این نسخه را کنار مثال Chat Completions استفاده کنید. messages به input منتقل میشود و متن نهایی از response.output_text خوانده میشود.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["AVALAI_API_KEY"],
base_url="https://api.avalai.ir/v1",
)
response = client.responses.create(
model="gpt-5.5",
instructions="You are a helpful assistant.",
input="این مقاله خبری را به عنوان واقعی یا جعلی طبقهبندی کنید: ...",
)
print(response.output_text)messages→input- پیام سیستمی →
instructionsیا آیتمdeveloper choices[0].message.content→response.output_text- برای ابزارها و خروجیهای چندوجهی،
response.outputرا بر اساسtypeبررسی کنید.
نتیجهگیری
با پیروی از این اصول - بهینهسازی دقت در ابتدا، سپس هزینه و تاخیر - میتوانید تصمیمات آگاهانهای برای انتخاب مدل بگیرید. API یکپارچه AvalAI آزمایش با مدلهای مختلف از ارائهدهندگان مختلف را برای یافتن تعادل بهینه برای مورد استفاده خاص شما آسان میکند.