داشبورد توسعه‌دهنده
پرسش از هوش مصنوعی
پرسش از هوش مصنوعی

مدل‌های هوش مصنوعی Cloudflare

سرویس Workers AI شرکت Cloudflare، دسترسی به مجموعه‌ای جامع از مدل‌های هوش مصنوعی را فراهم می‌کند که بر روی شبکه جهانی لبه (Edge) این شرکت اجرا می‌شوند. از طریق AvalAI، شما می‌توانید به ۳۳ مدل قدرتمند هوش مصنوعی Cloudflare با تاخیر کم و عملکرد بالا دسترسی داشته باشید و از زیرساخت توزیع‌شده Cloudflare برای استنتاج بهینه هوش مصنوعی بهره‌مند شوید.

مدل‌های موجود

مدل‌های هوش مصنوعی Cloudflare طیف گسترده‌ای از دسته‌بندی‌ها و ارائه‌دهندگان را پوشش می‌دهند؛ از مدل‌های فشرده و کارآمد گرفته تا سیستم‌های استدلال در مقیاس بزرگ. تمامی این مدل‌ها برای استقرار در لبه شبکه بهینه‌سازی شده‌اند و عملکردی پایدار را در سراسر شبکه جهانی Cloudflare تضمین می‌کنند.

مدل‌های Meta Llama

Cloudflare میزبان مجموعه‌ای کامل از مدل‌های Llama شرکت متا است؛ از جدیدترین نسخه یعنی Llama 4 Scout گرفته تا نسخه‌های گوناگون سری Llama 3.x.

مدلپارامترهاتخصصپنجره زمینه (Context)
cf.llama-4-scout-17b-16e-instruct۱۷ میلیارد (۱۶ متخصص)چندوجهی (متن و تصویر)۱۲۸ هزار
cf.llama-3.3-70b-instruct-fp8-fast۷۰ میلیارد (FP8)استنتاج سریع، عمومی۱۲۸ هزار
cf.llama-3.1-8b-instruct-fast۸ میلیاردمکالمه سریع چندزبانه۱۲۸ هزار
cf.llama-3.1-8b-instruct-awq۸ میلیارد (int4)استنتاج بهینه۱۲۸ هزار
cf.llama-3.1-8b-instruct-fp8۸ میلیارد (FP8)عملکرد متعادل۱۲۸ هزار
cf.llama-3.1-8b-instruct۸ میلیاردمکالمه استاندارد۱۲۸ هزار
cf.llama-3.1-70b-instruct۷۰ میلیارداستدلال پیچیده۱۲۸ هزار
cf.llama-3.2-1b-instruct۱ میلیاردمکالمه فشرده۱۲۸ هزار
cf.llama-3.2-3b-instruct۳ میلیاردوظایف مبتنی بر عامل (Agentic)۱۲۸ هزار
cf.meta-llama-3-8b-instruct۸ میلیارداستدلال بهبودیافته۸ هزار
cf.llama-3-8b-instruct-awq۸ میلیارد (int4)استقرار بهینه۸ هزار
cf.llama-3-8b-instruct۸ میلیارددستورالعمل استاندارد۸ هزار
cf.llama-guard-3-8b۸ میلیاردایمنی محتوا۸ هزار

Llama 4 Scout - اوج قابلیت‌های چندوجهی

این جدیدترین عضو خانواده Llama، قابلیت‌های چندوجهی را به صورت بومی ارائه می‌دهد:

python
from openai import OpenAI

client = OpenAI(api_key="your-avalai-api-key", base_url="https://api.avalai.ir/v1")

# درک متن و تصویر
completion = client.chat.completions.create(
    model="cf.llama-4-scout-17b-16e-instruct",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "این تصویر شامل چه چیزهایی است؟"},
                {
                    "type": "image_url",
                    "image_url": {"url": "data:image/jpeg;base64,..."},
                },
            ],
        }
    ],
)
نسخه معادل Responses API مدل این نسخه روی `gpt-5.5` تنظیم شده، چون `cf.llama-4-scout-17b-16e-instruct` ممکن است در داده‌های فعلی AvalAI برای `/v1/responses` فعال نباشد.

وقتی مدل انتخابی از /v1/responses پشتیبانی می‌کند، این نسخه را کنار مثال Chat Completions استفاده کنید. messages به input منتقل می‌شود و متن نهایی از response.output_text خوانده می‌شود.

python
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["AVALAI_API_KEY"],
    base_url="https://api.avalai.ir/v1",
)

response = client.responses.create(
    model="gpt-5.5",
    input=[
        {
            "role": "user",
            "content": [
                {"type": "input_text", "text": "Describe this image."},
                {"type": "input_image", "image_url": "https://example.com/image.png"},
            ],
        }
    ],
)

print(response.output_text)
  • messagesinput
  • پیام سیستمی → instructions یا آیتم developer
  • choices[0].message.contentresponse.output_text
  • برای ابزارها و خروجی‌های چندوجهی، response.output را بر اساس type بررسی کنید.

مدل‌های Google Gemma

مدل‌های Gemma از گوگل، عملکردی فوق‌العاده را با قابلیت‌های چندزبانه و پشتیبانی از LoRA ترکیب می‌کنند.

مدلپارامترهاتخصصپنجره زمینه (Context)
cf.gemma-3-12b-it۱۲ میلیاردچندوجهی، بیش از ۱۴۰ زبان۱۲۸ هزار
cf.gemma-7b-it-lora۷ میلیاردتنظیم دقیق (Fine-tuning) با LoRA۸ هزار
cf.gemma-2b-it-lora۲ میلیاردLoRA فشرده۸ هزار
cf.gemma-7b-it۷ میلیارددستورالعمل عمومی۸ هزار

Gemma 3 - چندوجهی پیشرفته

python
# Gemma 3 با پنجره زمینه گسترده
completion = client.chat.completions.create(
    model="cf.gemma-3-12b-it",
    messages=[
        {
            "role": "user",
            "content": "این سند را تحلیل کرده و خلاصه‌ای جامع از آن ارائه دهید.",
        }
    ],
    max_tokens=2048,
)
نسخه معادل Responses API مدل این نسخه روی `gpt-5.5` تنظیم شده، چون `cf.gemma-3-12b-it` ممکن است در داده‌های فعلی AvalAI برای `/v1/responses` فعال نباشد.

وقتی مدل انتخابی از /v1/responses پشتیبانی می‌کند، این نسخه را کنار مثال Chat Completions استفاده کنید. messages به input منتقل می‌شود و متن نهایی از response.output_text خوانده می‌شود.

python
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["AVALAI_API_KEY"],
    base_url="https://api.avalai.ir/v1",
)

response = client.responses.create(
    model="gpt-5.5",
    instructions="You are a helpful assistant.",
    input="این سند را تحلیل کرده و خلاصه‌ای جامع از آن ارائه دهید.",
)

print(response.output_text)
  • messagesinput
  • پیام سیستمی → instructions یا آیتم developer
  • choices[0].message.contentresponse.output_text
  • برای ابزارها و خروجی‌های چندوجهی، response.output را بر اساس type بررسی کنید.

مدل‌های Mistral AI

جدیدترین مدل‌های Mistral با درک بصری بهبودیافته و پنجره زمینه گسترده‌تر.

مدلپارامترهاتخصصپنجره زمینه (Context)
cf.mistral-small-3.1-24b-instruct۲۴ میلیاردبینایی + متن، فراخوانی توابع۱۲۸ هزار

Mistral Small 3.1 - تقویت‌شده با بینایی

python
# فراخوانی توابع به همراه قابلیت‌های بصری
completion = client.chat.completions.create(
    model="cf.mistral-small-3.1-24b-instruct",
    messages=[
        {
            "role": "user",
            "content": "این نمودار را تحلیل کرده و معیارهای کلیدی آن را استخراج کنید.",
        }
    ],
    tools=[
        {
            "type": "function",
            "function": {
                "name": "extract_metrics",
                "description": "استخراج معیارهای عددی از داده‌ها",
                "parameters": {
                    "type": "object",
                    "properties": {
                        "metrics": {"type": "array", "items": {"type": "number"}}
                    },
                },
            },
        }
    ],
)
نسخه معادل Responses API مدل این نسخه روی `gpt-5.5` تنظیم شده، چون `cf.mistral-small-3.1-24b-instruct` ممکن است در داده‌های فعلی AvalAI برای `/v1/responses` فعال نباشد.

وقتی مدل انتخابی از /v1/responses پشتیبانی می‌کند، این نسخه را کنار مثال Chat Completions استفاده کنید. messages به input منتقل می‌شود و متن نهایی از response.output_text خوانده می‌شود.

python
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["AVALAI_API_KEY"],
    base_url="https://api.avalai.ir/v1",
)

tools = [
    {
        "type": "function",
        "name": "get_current_weather",
        "description": "Get the current weather in a given location.",
        "parameters": {
            "type": "object",
            "properties": {"location": {"type": "string"}},
            "required": ["location"],
            "additionalProperties": False,
        },
    }
]

response = client.responses.create(
    model="gpt-5.5",
    input="این نمودار را تحلیل کرده و معیارهای کلیدی آن را استخراج کنید.",
    tools=tools,
)

for item in response.output:
    if item.type == "function_call":
        print(item.name, item.arguments)
print(response.output_text)
  • messagesinput
  • پیام سیستمی → instructions یا آیتم developer
  • choices[0].message.contentresponse.output_text
  • برای ابزارها و خروجی‌های چندوجهی، response.output را بر اساس type بررسی کنید.

مدل‌های Qwen

مدل‌های Qwen از شرکت Alibaba که برای استدلال، تولید کد و embedding تخصصی شده‌اند.

مدلپارامترهاتخصصپنجره زمینه (Context)
cf.qwq-32b۳۲ میلیارداستدلال پیشرفته۳۲ هزار
cf.qwen2.5-coder-32b-instruct۳۲ میلیاردتولید کد۱۲۸ هزار
cf.qwen3-30b-a3b-fp8۳۰ میلیارد (FP8)چت، عملکرد متعادل۱۲۸ هزار
cf.qwen3-embedding-0.6b۰.۶ میلیاردembedding متن-

QwQ - مدل استدلالگر

python
# وظایف نیازمند استدلال پیشرفته
completion = client.chat.completions.create(
    model="cf.qwq-32b",
    messages=[
        {
            "role": "user",
            "content": "این مسئله پیچیده ریاضی را گام به گام حل کنید: اگر قطاری ۱۲۰ کیلومتر را در ۲ ساعت طی کند و سپس سرعت خود را ۲۰٪ افزایش دهد، چقدر زمان برای طی کردن ۱۸۰ کیلومتر بعدی نیاز دارد؟",
        }
    ],
    temperature=0.1,  # دمای پایین‌تر برای وظایf استدلالی
)
نسخه معادل Responses API مدل این نسخه روی `gpt-5.5` تنظیم شده، چون `cf.qwq-32b` ممکن است در داده‌های فعلی AvalAI برای `/v1/responses` فعال نباشد.

وقتی مدل انتخابی از /v1/responses پشتیبانی می‌کند، این نسخه را کنار مثال Chat Completions استفاده کنید. messages به input منتقل می‌شود و متن نهایی از response.output_text خوانده می‌شود.

python
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["AVALAI_API_KEY"],
    base_url="https://api.avalai.ir/v1",
)

response = client.responses.create(
    model="gpt-5.5",
    instructions="You are a helpful assistant.",
    input="این مسئله پیچیده ریاضی را گام به گام حل کنید: اگر قطاری ۱۲۰ کیلومتر را در ۲ ساعت طی کند و سپس سرعت خود را ۲۰٪ افزایش دهد، چقدر زمان برای طی کردن ۱۸۰ کیلومتر بعدی نیاز دارد؟",
)

print(response.output_text)
  • messagesinput
  • پیام سیستمی → instructions یا آیتم developer
  • choices[0].message.contentresponse.output_text
  • برای ابزارها و خروجی‌های چندوجهی، response.output را بر اساس type بررسی کنید.

Qwen2.5-Coder - متخصص برنامه‌نویسی

python
# تولید و توضیح کد
completion = client.chat.completions.create(
    model="cf.qwen2.5-coder-32b-instruct",
    messages=[
        {
            "role": "user",
            "content": "یک تابع پایتون برای پیاده‌سازی درخت جستجوی دودویی به همراه عملیات درج، جستجو و حذف بنویسید.",
        }
    ],
)
نسخه معادل Responses API مدل این نسخه روی `gpt-5.5` تنظیم شده، چون `cf.qwen2.5-coder-32b-instruct` ممکن است در داده‌های فعلی AvalAI برای `/v1/responses` فعال نباشد.

وقتی مدل انتخابی از /v1/responses پشتیبانی می‌کند، این نسخه را کنار مثال Chat Completions استفاده کنید. messages به input منتقل می‌شود و متن نهایی از response.output_text خوانده می‌شود.

python
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["AVALAI_API_KEY"],
    base_url="https://api.avalai.ir/v1",
)

response = client.responses.create(
    model="gpt-5.5",
    instructions="You are a helpful assistant.",
    input="یک تابع پایتون برای پیاده‌سازی درخت جستجوی دودویی به همراه عملیات درج، جستجو و حذف بنویسید.",
)

print(response.output_text)
  • messagesinput
  • پیام سیستمی → instructions یا آیتم developer
  • choices[0].message.contentresponse.output_text
  • برای ابزارها و خروجی‌های چندوجهی، response.output را بر اساس type بررسی کنید.

مدل‌های DeepSeek

مدل‌های استدلال تقطیر شده از DeepSeek که عملکردی رقابتی ارائه می‌دهند.

مدلپارامترهاتخصصپنجره زمینه (Context)
cf.deepseek-r1-distill-qwen-32b۳۲ میلیارداستدلال، عملکرد بهتر از o1-mini۱۲۸ هزار

مدل‌های متن‌باز OpenAI

مدل‌های متن‌باز OpenAI که روی شبکه لبه Cloudflare در دسترس هستند.

مدلپارامترهاتخصصپنجره زمینه (Context)
cf.gpt-oss-120b۱۲۰ میلیارداستدلال در مقیاس بزرگ۱۲۸ هزار
cf.gpt-oss-20b۲۰ میلیاردعمومی کارآمد۱۲۸ هزار

مدل‌های NVIDIA Nemotron

جدیدترین مدل‌های Nemotron از NVIDIA با معماری ترکیبی LatentMoE.

مدلپارامترهاتخصصپنجره زمینه (Context)
cf.nemotron-3-120b-a12b۱۲۰ میلیارد (۱۲ میلیارد فعال)گردش‌های کاری عاملی، استدلال زمینه بلند۱ میلیون

Nemotron-3-120B-A12B - برتری عاملی

Nemotron-3-Super-120B-A12B از NVIDIA یک مدل زبانی بزرگ است که برای ارائه قابلیت‌های قوی عاملی، استدلال و مکالمه طراحی شده است. این مدل از معماری ترکیبی LatentMoE با لایه‌های متناوب Mamba-2 و MoE با پیش‌بینی چند توکن (MTP) برای تولید متن سریع‌تر استفاده می‌کند.

ویژگیجزئیات
کل پارامترها۱۲۰ میلیارد (۱۲ میلیارد فعال)
معماریLatentMoE - ترکیب Mamba-2 + MoE + Attention
پنجره زمینه۱٬۰۰۰٬۰۰۰ توکن
قیمت ورودی۰.۵۰ دلار / ۱ میلیون توکن
قیمت ورودی کش شده۰.۰۵ دلار / ۱ میلیون توکن (۹۰٪ کاهش هزینه)
قیمت خروجی۱.۵۰ دلار / ۱ میلیون توکن
زبان‌های پشتیبانی‌شدهانگلیسی، فرانسوی، آلمانی، ایتالیایی، ژاپنی، اسپانیایی، چینی
بهترین استفادهگردش‌های کاری عاملی، استدلال زمینه بلند، اتوماسیون تیکت IT

ویژگی‌های کلیدی:

  • پنجره زمینه ۱ میلیون: طول زمینه پیشرو در صنعت برای اسناد گسترده
  • استدلال قابل تنظیم: فعال یا غیرفعال کردن حالت استدلال از طریق الگوی چت
  • پیش‌بینی چند توکن: لایه‌های MTP برای تولید متن سریع‌تر
  • استفاده از ابزار و RAG: عالی برای فراخوانی ابزار و تولید مبتنی بر بازیابی
  • مقرون‌به‌صرفه: فقط ۱۲ میلیارد پارامتر فعال برای کارایی استثنایی

نکات برجسته معیار:

  • SWE-Bench (OpenHands): ۶۰.۴۷٪
  • AIME 2025: ۹۰.۲۱٪
  • HMMT Feb 2025 (با ابزار): ۹۴.۷۳٪
  • LiveCodeBench: ۸۱.۱۹٪
python
from openai import OpenAI

client = OpenAI(api_key="your-avalai-api-key", base_url="https://api.avalai.ir/v1")

# استدلال زمینه بلند با Nemotron
completion = client.chat.completions.create(
    model="cf.nemotron-3-120b-a12b",
    messages=[
        {
            "role": "user",
            "content": "این کدبیس گسترده را تحلیل کن و بهبودهای معماری برای مقیاس‌پذیری بهتر پیشنهاد بده.",
        }
    ],
    temperature=1.0,  # تنظیم پیشنهادی برای Nemotron
    top_p=0.95,
)

print(completion.choices[0].message.content)
نسخه معادل Responses API مدل این نسخه روی `gpt-5.5` تنظیم شده، چون `cf.nemotron-3-120b-a12b` ممکن است در داده‌های فعلی AvalAI برای `/v1/responses` فعال نباشد.

وقتی مدل انتخابی از /v1/responses پشتیبانی می‌کند، این نسخه را کنار مثال Chat Completions استفاده کنید. messages به input منتقل می‌شود و متن نهایی از response.output_text خوانده می‌شود.

python
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["AVALAI_API_KEY"],
    base_url="https://api.avalai.ir/v1",
)

response = client.responses.create(
    model="gpt-5.5",
    instructions="You are a helpful assistant.",
    input="این کدبیس گسترده را تحلیل کن و بهبودهای معماری برای مقیاس‌پذیری بهتر پیشنهاد بده.",
)

print(response.output_text)
  • messagesinput
  • پیام سیستمی → instructions یا آیتم developer
  • choices[0].message.contentresponse.output_text
  • برای ابزارها و خروجی‌های چندوجهی، response.output را بر اساس type بررسی کنید.

مدل‌های IBM Granite

مدل‌های Granite از IBM برای کاربردهای سازمانی.

مدلپارامترهاتخصصپنجره زمینه (Context)
cf.granite-4.0-h-microMicroچت سازمانی کارآمد۱۲۸ هزار

مدل‌های تولید تصویر

Cloudflare AI مدل‌های قدرتمند تولید تصویر را از طریق نقطه پایانی v1/images/generations ارائه می‌دهد.

مدلتوضیحاتقیمت پایه (۱ مگاپیکسل)
cf.flux-2-klein-9bمدل FLUX 2 Klein با ۹ میلیارد پارامتر$۰.۰۱۵/تصویر
cf.flux-2-klein-4bمدل فشرده FLUX 2 Klein با ۴ میلیارد پارامتر$۰.۰۱۰/تصویر
cf.flux-2-devمدل توسعه FLUX 2$۰.۰۱۰/تصویر
cf.lucid-originتولید تصویر Lucid Origin$۰.۰۱۵/تصویر
cf.phoenix-1.0تولید تصویر Phoenix 1.0$۰.۰۱۵/تصویر

مثال تولید تصویر

python
from openai import OpenAI

client = OpenAI(api_key="your-avalai-api-key", base_url="https://api.avalai.ir/v1")

# تولید تصویر با FLUX 2 Klein
response = client.images.generate(
    model="cf.flux-2-klein-9b",
    prompt="یک شهر آینده‌نگر در غروب خورشید با ماشین‌های پرنده",
    n=1,
    size="1024x1024",
)

print(response.data[0].url)

مدل‌های Embedding

Cloudflare AI مدل‌های embedding را برای جستجوی معنایی و تحلیل متن از طریق نقطه پایانی v1/embeddings ارائه می‌دهد.

مدلصاحبتوضیحاتقیمت ورودی (دلار/۱م توکن)
cf.qwen3-embedding-0.6bAlibabaQwen3 Embedding ۰.۶ میلیارد$۰.۰۱۲
cf.plamo-embedding-1bPFNPLaMo Embedding ۱ میلیارد$۰.۰۱۹
cf.embeddinggemma-300mGoogleEmbeddingGemma ۳۰۰ میلیون$۰.۰۱۲

مثال Embedding

python
from openai import OpenAI

client = OpenAI(api_key="your-avalai-api-key", base_url="https://api.avalai.ir/v1")

# تولید embedding
response = client.embeddings.create(
    model="cf.qwen3-embedding-0.6b",
    input="یادگیری ماشین به کامپیوترها امکان یادگیری از داده‌ها را می‌دهد.",
)

embedding = response.data[0].embedding
print(f"ابعاد embedding: {len(embedding)}")

پارامترهای کلیدی

مدل‌های Cloudflare از پارامترهای استاندارد سازگار با OpenAI پشتیبانی می‌کنند:

پارامترتوضیحاتمقدار پیش‌فرضمحدوده
temperatureمیزان خلاقیت پاسخ را کنترل می‌کند0.70.0 تا 2.0
max_tokensحداکثر طول پاسخ تولیدی20481 تا 4096
top_pنمونه‌گیری هسته‌ای (Nucleus sampling)1.00.0 تا 1.0
frequency_penaltyجریمه تکرار کلمات0.0-2.0 تا 2.0
presence_penaltyجریمه تکرار موضوعات0.0-2.0 تا 2.0

نقاط پایانی (Endpoints) API

مدل‌های Cloudflare بسته به نوع مدل از طریق نقاط پایانی مختلف در AvalAI قابل دسترسی هستند:

مثال‌های کاربردی

تولید متن ساده

python
from openai import OpenAI

client = OpenAI(api_key="your-avalai-api-key", base_url="https://api.avalai.ir/v1")

completion = client.chat.completions.create(
    model="cf.llama-3.1-8b-instruct",
    messages=[
        {"role": "system", "content": "شما یک دستیار هوشمند و مفید هستید."},
        {"role": "user", "content": "محاسبات کوانتومی را به زبان ساده شرح دهید."},
    ],
    temperature=0.7,
    max_tokens=1024,
)

print(completion.choices[0].message.content)
نسخه معادل Responses API مدل این نسخه روی `gpt-5.5` تنظیم شده، چون `cf.llama-3.1-8b-instruct` ممکن است در داده‌های فعلی AvalAI برای `/v1/responses` فعال نباشد.

وقتی مدل انتخابی از /v1/responses پشتیبانی می‌کند، این نسخه را کنار مثال Chat Completions استفاده کنید. messages به input منتقل می‌شود و متن نهایی از response.output_text خوانده می‌شود.

python
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["AVALAI_API_KEY"],
    base_url="https://api.avalai.ir/v1",
)

response = client.responses.create(
    model="gpt-5.5",
    instructions="You are a helpful assistant.",
    input="محاسبات کوانتومی را به زبان ساده شرح دهید.",
)

print(response.output_text)
  • messagesinput
  • پیام سیستمی → instructions یا آیتم developer
  • choices[0].message.contentresponse.output_text
  • برای ابزارها و خروجی‌های چندوجهی، response.output را بر اساس type بررسی کنید.

دریافت پاسخ به صورت جریانی (Streaming)

python
# استفاده از Streaming برای دریافت پاسخ‌های آنی
stream = client.chat.completions.create(
    model="cf.llama-3.3-70b-instruct-fp8-fast",
    messages=[
        {
            "role": "user",
            "content": "داستان کوتاهی درباره آینده هوش مصنوعی و بشریت بنویسید.",
        }
    ],
    stream=True,
)

for chunk in stream:
    if chunk.choices[0].delta.content is not None:
        print(chunk.choices[0].delta.content, end="")
نسخه معادل Responses API مدل این نسخه روی `gpt-5.5` تنظیم شده، چون `cf.llama-3.3-70b-instruct-fp8-fast` ممکن است در داده‌های فعلی AvalAI برای `/v1/responses` فعال نباشد.

وقتی مدل انتخابی از /v1/responses پشتیبانی می‌کند، این نسخه را کنار مثال Chat Completions استفاده کنید. messages به input منتقل می‌شود و متن نهایی از response.output_text خوانده می‌شود.

python
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["AVALAI_API_KEY"],
    base_url="https://api.avalai.ir/v1",
)

response = client.responses.create(
    model="gpt-5.5",
    instructions="You are a helpful assistant.",
    input="داستان کوتاهی درباره آینده هوش مصنوعی و بشریت بنویسید.",
)

print(response.output_text)
  • messagesinput
  • پیام سیستمی → instructions یا آیتم developer
  • choices[0].message.contentresponse.output_text
  • برای ابزارها و خروجی‌های چندوجهی، response.output را بر اساس type بررسی کنید.

فراخوانی توابع (Function Calling)

python
# فراخوانی توابع با مدل‌های پشتیبانی‌کننده
completion = client.chat.completions.create(
    model="cf.mistral-small-3.1-24b-instruct",
    messages=[{"role": "user", "content": "آب و هوای تهران الان چطور است؟"}],
    tools=[
        {
            "type": "function",
            "function": {
                "name": "get_weather",
                "description": "دریافت اطلاعات آب و هوای یک شهر",
                "parameters": {
                    "type": "object",
                    "properties": {
                        "city": {"type": "string", "description": "نام شهر"}
                    },
                    "required": ["city"],
                },
            },
        }
    ],
)
نسخه معادل Responses API مدل این نسخه روی `gpt-5.5` تنظیم شده، چون `cf.mistral-small-3.1-24b-instruct` ممکن است در داده‌های فعلی AvalAI برای `/v1/responses` فعال نباشد.

وقتی مدل انتخابی از /v1/responses پشتیبانی می‌کند، این نسخه را کنار مثال Chat Completions استفاده کنید. messages به input منتقل می‌شود و متن نهایی از response.output_text خوانده می‌شود.

python
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["AVALAI_API_KEY"],
    base_url="https://api.avalai.ir/v1",
)

tools = [
    {
        "type": "function",
        "name": "get_current_weather",
        "description": "Get the current weather in a given location.",
        "parameters": {
            "type": "object",
            "properties": {"location": {"type": "string"}},
            "required": ["location"],
            "additionalProperties": False,
        },
    }
]

response = client.responses.create(
    model="gpt-5.5",
    input="آب و هوای تهران الان چطور است؟",
    tools=tools,
)

for item in response.output:
    if item.type == "function_call":
        print(item.name, item.arguments)
print(response.output_text)
  • messagesinput
  • پیام سیستمی → instructions یا آیتم developer
  • choices[0].message.contentresponse.output_text
  • برای ابزارها و خروجی‌های چندوجهی، response.output را بر اساس type بررسی کنید.

بهترین شیوه‌ها (Best Practices)

انتخاب مدل مناسب

  • برای سرعت: از مدل‌های کوانتیزه‌شده FP8 یا AWQ مانند cf.llama-3.3-70b-instruct-fp8-fast استفاده کنید.
  • برای استدلال: مدل‌های cf.qwq-32b یا cf.deepseek-r1-distill-qwen-32b گزینه‌های بهتری هستند.
  • برای کدنویسی: از مدل تخصصی cf.qwen2.5-coder-32b-instruct استفاده کنید.
  • برای کاربردهای چندوجهی: مدل‌های cf.llama-4-scout-17b-16e-instruct یا cf.gemma-3-12b-it را انتخاب کنید.
  • برای بهینه‌سازی مصرف: مدل‌های فشرده مانند cf.llama-3.2-1b-instruct را امتحان کنید.

بهینه‌سازی عملکرد

  1. کوانتیزه‌سازی مناسب: مدل‌های FP8 تعادل خوبی بین سرعت و کیفیت برقرار می‌کنند.
  2. بهره‌گیری از شبکه لبه: این مدل‌ها به دلیل اجرا بر روی شبکه جهانی Cloudflare، تاخیر بسیار کمی دارند.
  3. مدیریت زمینه: از پنجره زمینه گسترده (تا ۱۲۸ هزار توکن) به شکل بهینه استفاده کنید.
  4. پاسخ جریانی: برای بهبود تجربه کاربری در اپلیکیشن‌های تعاملی، قابلیت Streaming را فعال کنید.

ایمنی محتوا

برای کنترل و نظارت بر محتوا، از مدل cf.llama-guard-3-8b استفاده کنید:

python
# بررسی ایمنی محتوا
safety_check = client.chat.completions.create(
    model="cf.llama-guard-3-8b",
    messages=[{"role": "user", "content": "پیام کاربر برای بررسی از نظر ایمنی"}],
)
نسخه معادل Responses API مدل این نسخه روی `gpt-5.5` تنظیم شده، چون `cf.llama-guard-3-8b` ممکن است در داده‌های فعلی AvalAI برای `/v1/responses` فعال نباشد.

وقتی مدل انتخابی از /v1/responses پشتیبانی می‌کند، این نسخه را کنار مثال Chat Completions استفاده کنید. messages به input منتقل می‌شود و متن نهایی از response.output_text خوانده می‌شود.

python
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["AVALAI_API_KEY"],
    base_url="https://api.avalai.ir/v1",
)

response = client.responses.create(
    model="gpt-5.5",
    instructions="You are a helpful assistant.",
    input="پیام کاربر برای بررسی از نظر ایمنی",
)

print(response.output_text)
  • messagesinput
  • پیام سیستمی → instructions یا آیتم developer
  • choices[0].message.contentresponse.output_text
  • برای ابزارها و خروجی‌های چندوجهی، response.output را بر اساس type بررسی کنید.

استفاده از مدل‌های Cloudflare از طریق AvalAI

مدل‌های هوش مصنوعی Cloudflare به صورت یکپارچه با API واحد AvalAI ادغام شده‌اند. تمامی این مدل‌ها از رابط استاندارد سازگار با OpenAI استفاده می‌کنند، که این امر جابجایی بین مدل‌های مختلف Cloudflare یا ترکیب آن‌ها با سایر ارائه‌دهندگان را بسیار ساده می‌سازد.

احراز هویت

python
client = OpenAI(
    api_key="your-avalai-api-key",  # کلید API شما در AvalAI
    base_url="https://api.avalai.ir/v1",  # نقطه پایانی AvalAI
)

محدودیت‌های نرخ استفاده (Rate Limits)

مدل‌های Cloudflare از سیاست‌های استاندارد محدودیت نرخ در AvalAI پیروی می‌کنند. برای اطلاع از محدودیت‌های سطح کاربری خود، به راهنمای محدودیت‌های نرخ مراجعه کنید.

منابع مرتبط