داده‌های چندمنبعی، شفاف و به‌روز

رتبه‌بندی و مقایسه
بهترین مدل‌های هوش مصنوعی

مقایسه GPT، Claude، Gemini، DeepSeek، Qwen، Llama و سایر مدل‌های زبانی بزرگ برای برنامه‌نویسی، استدلال، سرعت، قیمت و طول کانتکست.

مدل بررسی‌شده
مدل دارای رتبه
منبع فعال
خودکاربه‌روزرسانی هر ۶ ساعت
رتبه‌بندی مدل‌های زبانی بزرگ

مقایسه مدل‌های هوش مصنوعی در یک نگاه

Overall درواره v4 از بنچمارک‌های مستقل و دسته‌بندی‌شده محاسبه می‌شود؛ سرعت، قیمت و محبوبیت در Overall دخالت ندارند.

آخرین به‌روزرسانیدر حال بررسی…
نوع رتبه‌بندییک منبع را برای مشاهده رتبه‌بندی مستقیم آن انتخاب کنید.
رتبهمدلامتیاز دروارههوشمندیکدنویسیسرعت (tok/s)قیمت ورودی / 1Mکانتکستدسترسی
راهنمای انتخاب مدل هوش مصنوعی

چگونه بهترین مدل هوش مصنوعی را انتخاب کنیم؟

عبارت «بهترین مدل هوش مصنوعی» یک پاسخ ثابت ندارد. Darvareh v4 توانایی مدل‌ها را در دسته‌های استدلال، کدنویسی، Agentic، ریاضی و علوم، Long Context و Vision رتبه‌بندی می‌کند و شاخص‌های سرعت، قیمت و دسترسی را جداگانه برای تصمیم عملی نشان می‌دهد.

بهترین مدل هوش مصنوعیمقایسه GPT و Claudeبهترین هوش مصنوعی برای برنامه‌نویسیرتبه‌بندی LLMمقایسه Gemini و DeepSeekبنچمارک مدل‌های هوش مصنوعی

بهترین هوش مصنوعی برای برنامه‌نویسی

رتبه Coding از چند بنچمارک مستقل برنامه‌نویسی ساخته می‌شود. برای انتخاب عملی مدل، Context، سرعت و هزینه API را نیز جداگانه بررسی کنید.

مشاهده رتبه‌بندی برنامه‌نویسی

مقایسه مدل‌های GPT، Claude و Gemini

Overall به‌جای یک بنچمارک منفرد، شواهد چند خانواده بنچمارک را با وزن دسته‌ای و درنظرگرفتن عدم قطعیت ترکیب می‌کند.

مقایسه مدل‌های برتر

سریع‌ترین و ارزان‌ترین مدل هوش مصنوعی

سرعت و قیمت عمداً وارد Overall نمی‌شوند تا توانایی مدل با هزینه یا latency مخلوط نشود. این شاخص‌ها در جدول برای انتخاب عملی جداگانه نمایش داده می‌شوند.

مقایسه سرعت و قیمت مدل‌ها
سوالات متداول

سوالات رایج درباره رتبه‌بندی مدل‌های هوش مصنوعی

بهترین مدل هوش مصنوعی کدام است؟

بهترین مدل به نوع استفاده بستگی دارد. دسته مرتبط با کاربرد خود را انتخاب کنید و Confidence را کنار رتبه در نظر بگیرید.

بهترین هوش مصنوعی برای برنامه‌نویسی چیست؟

مدل‌های Coding با شواهد چند بنچمارک مستقل مقایسه می‌شوند. مدل دارای رتبه بالا و Confidence بالاتر، شواهد گسترده‌تری پشت رتبه خود دارد.

رتبه‌بندی OpenRouter با Artificial Analysis چه تفاوتی دارد؟

OpenRouter بیشتر بر مصرف و محبوبیت همان پلتفرم تمرکز دارد. Artificial Analysis شاخص‌های مستقل کیفیت و عملکرد ارائه می‌کند. Darvareh v4 برای Overall از رتبه بنچمارک‌های مستقل استفاده می‌کند و رتبه‌بندی مستقیم هر منبع نیز جداگانه قابل مشاهده است.

امتیاز ترکیبی درواره چگونه محاسبه می‌شود؟

در v4، بنچمارک‌های هم‌خانواده deduplicate می‌شوند، رتبه هر بنچمارک با جهت صحیح higher-is-better یا lower-is-better وارد محاسبه می‌شود و سپس دسته‌ها با وزن ثابت در Conservative TrueSkill-like ترکیب می‌شوند. سرعت، قیمت و محبوبیت وارد Overall نمی‌شوند.

این صفحه و داده‌های رتبه‌بندی به‌صورت خودکار به‌روزرسانی می‌شوند.
شفافیت در رتبه‌بندی

روش مقایسه و رتبه‌بندی مدل‌های هوش مصنوعی

Darvareh v4 نتایج بنچمارک‌ها را براساس خانواده deduplicate می‌کند، جهت صحیح هر metric را رعایت می‌کند و با Conservative TrueSkill-like عدم قطعیت را در رتبه لحاظ می‌کند. Overall از شش دسته توانایی ساخته می‌شود؛ سرعت، قیمت و محبوبیت شاخص‌های جداگانه‌اند و وارد Overall نمی‌شوند.

استدلال
۲۵٪
کدنویسی
۲۵٪
Agentic / Tool Use
۲۰٪
ریاضی و علوم
۱۵٪
Long Context
۱۰٪
Vision / Multimodal
۵٪