دسته

بهترین هوش مصنوعی برای چت

این جدول لایه مدل را ابزارسنجی می کند، نه لایه محصول را. سنجه اصلی لیدربورد متن Arena است: کلود فیبل ۵ با امتیاز ۱۵۰۶ در میان ۳۸۹ مدل رتبه یک را دارد و اپوس ۵ با ۱۴۹۴، دوازده امتیاز پایین تر، با نصف هزینه عملیاتی کار می کند. چون واحد اندازه گیری مدل است نه محصول، چت جی پی تی که یک لایه محصول است در این جدول ردیفی ندارد.

  • نه مدل، هر یک با رتبه مستند
  • وزن هر معیار روی همین صفحه ثبت شده
  • واحد اندازه گیری: مدل، نه محصول

آخرین بررسی: این صفحه یک مرجع است. با هر نسخه تازه، منابع سازنده دوباره خوانده و صفحه بهروز می شود. چه چیزی عوض شد

امتیاز هر ابزار از کجا می آید

حلقه زیر، همان وزن هایی است که در سرستون های جدول پایین نوشته شده.

۱۰۰وزن ها
  • عملکرد در لیدربورد متن عمومی ۴۵
  • بازده امتیاز به ازای دلار ۲۰
  • ظرفیت پنجره متن ۱۵
  • بلوغ زیرساخت ابزار ۱۰
  • وضعیت دسترسی از ایران ۱۰

وزن ها را ما انتخاب کرده ایم و همین تنها جای سلیقه این جدول است. اگر وزن دیگری درست تر می دانید، ترتیب هم عوض می شود.

رتبه بندی امروز، برآمده از لیدربوردی با عدد، تاریخ و شمار رای مستند

هیچ نامزدی زیر این جدول بدون رتبه باقی نمانده است. سلول خالی به معنای عدم انتشار عدد از سوی سازنده است، نه امتیاز صفر.

بهترین هوش مصنوعی برای چت
رتبه ابزار امتیاز عملکرد در لیدربورد متن عمومی ۴۵ بازده امتیاز به ازای دلار ۲۰ ظرفیت پنجره متن ۱۵ بلوغ زیرساخت ابزار ۱۰ وضعیت دسترسی از ایران ۱۰
۱ کلود فیبل ۵ انتخاب فعلی ۷۸.۶ ۱,۵۰۶ منبع: arena.ai ۳۰.۱ منبع: arena.ai ۱ میلیون توکن منبع: platform.claude.com ۴/۴ مسدود / راه کارآمدی ندارد
۲ کلود اپوس ۵ ۷۱.۶ ۱,۴۹۴ منبع: arena.ai ۵۹.۸ منبع: arena.ai ۱ میلیون توکن منبع: platform.claude.com ۴/۴ مسدود / راه کارآمدی ندارد
۳ جی پی تی ۵.۶ سول ۵۴.۵ ۱,۴۸۱ منبع: arena.ai ۴۹.۴ منبع: arena.ai ۱ میلیون توکن منبع: developers.openai.com ۴/۴ تایید نشده
۴ قوان ۳.۸ مکس ۵۲.۶ ۱,۴۹۰ منبع: arena.ai ۲۴۸.۳ منبع: arena.ai ۱ میلیون توکن منبع: www.alibabacloud.com تایید نشده تایید نشده
۵ کیمی کی۳ مکس ۴۹.۲ ۱,۴۸۷ منبع: arena.ai ۹۹.۱ منبع: arena.ai ۱ میلیون توکن منبع: platform.kimi.ai ۱/۴ تایید نشده
۶ جمینای ۳.۱ پرو ۴۴.۱ ۱,۴۸۶ منبع: arena.ai ۱۲۳.۸ منبع: arena.ai تایید نشده تایید نشده مسدود / راه کارآمدی ندارد
۷ جیالام ۵.۲ مکس ۴۱.۶ ۱,۴۷۰ منبع: arena.ai ۳۳۴.۱ منبع: arena.ai ۱ میلیون توکن منبع: docs.z.ai ۱/۴ تایید نشده
۸ دیپ سیک وی۴ فلش ۳۳.۶ ۱,۴۳۵ منبع: arena.ai ۱,۰۸۷.۱ منبع: arena.ai ۱ میلیون توکن منبع: api-docs.deepseek.com ۱/۴ تایید نشده
۹ گراک ۴.۵ ۳۲.۳ ۱,۴۶۹ منبع: arena.ai ۲۴۴.۸ منبع: arena.ai ۵۰۰ هزار توکن منبع: docs.x.ai ۳/۴ تایید نشده

سلول خالی یعنی آن عدد را نتوانسته ایم تایید کنیم، نه اینکه ابزار صفر گرفته است.

پشت هر عدد

هر نمره داوری این جدول یک دلیل نوشته شده دارد و ستون ایران می گوید چطور بررسی شده. آن دو اینجا بازند. رد اندازه گیری هر عدد، یعنی اینکه از کدام ردیف کدام لیدربورد و با چند رای آمده، زیر همان مدل باز می شود.

۱ کلود فیبل ۵

بلوغ زیرساخت ابزار ۴/۴ روی همان زیرساخت استقرار اپوس ۵ ساخته شده و پوشش کامل روی هر پنج مسیر عرضه دارد: API اختصاصی انتروپیک، بدراک، کلود پلتفرم روی AWS، گوگل کلاد و مایکروسافت فاندری.

وضعیت دسترسی از ایران مسدود / راه کارآمدی ندارد ایران در فهرست کشورهای پشتیبانی شده انتروپیک ثبت نشده. این وضعیت از سند خط مشی خود انتروپیک استخراج شده، نه از سنجش شبکه.

رد اندازه گیری (۲ مورد)

عملکرد در لیدربورد متن عمومی ۱,۵۰۶ داده منبع، لیدربورد متن Arena، به روزرسانی ۱۱ اوت ۲۰۲۶، استخراج از ۷۷۶۵۲۲۰ رای

بازده امتیاز به ازای دلار ۳۰.۱ امتیاز Arena (Text) تقسیم بر قیمت هر یک میلیون توکن خروجی

۲ کلود اپوس ۵

بلوغ زیرساخت ابزار ۴/۴ سطح یکپارچه سازی کامل است: API، اپ رسمی، ابزار خط فرمان، SDK عامل، خط لوله اجرای دسته ای، و استقرار روی زیرساخت سه ابر بزرگ

وضعیت دسترسی از ایران مسدود / راه کارآمدی ندارد ایران در هیچ یک از دو فهرست کشورهای پشتیبانی شده انتروپیک (سطح API و سطح claude.ai) ثبت نشده. این وضعیت از سند خط مشی خود انتروپیک استخراج شده، نه از سنجش مستقیم شبکه؛ آزمون مستقل شبکه ای هنوز اجرا نشده و در صورت اجرا، نتیجه همین جا ثبت می شود.

رد اندازه گیری (۲ مورد)

عملکرد در لیدربورد متن عمومی ۱,۴۹۴ داده منبع، ردیف پیکربندی claude-opus-5-high: رتبه هفت، استخراج از ۷۷۶۵۲۲۰ رای

بازده امتیاز به ازای دلار ۵۹.۸ امتیاز Arena (Text) تقسیم بر قیمت هر یک میلیون توکن خروجی

۳ جی پی تی ۵.۶ سول

بلوغ زیرساخت ابزار ۴/۴ سطح چهارم به استناد اسناد فنی خود سازنده تایید می شود: API، SDK ها و یک خط فرمان رسمی، افزونه ویرایشگر کدکس، SDK عامل، یک مسیر اجرای دسته ای، و یک راهنمای رسمی استقرار روی آمازون بدراک که شناسه openai.gpt-5.6-sol را ثبت کرده است. این تنها ستونی است که برای این مدل بدون در دسترس بودن openai.com هم به طور کامل تکمیل شد.

رد اندازه گیری (۲ مورد)

عملکرد در لیدربورد متن عمومی ۱,۴۸۱ رکورد gpt-5.6-sol-xhigh در جدول رتبه بندی متن Arena، جایگاه ۱۸ از میان ۳۸۹ مدل ثبت شده، بر اساس به روزرسانی ۱۱ اوت ۲۰۲۶ و ۱۵۲۲۶ رای سنجش برای همین رکورد

بازده امتیاز به ازای دلار ۴۹.۴ امتیاز Arena (Text) تقسیم بر قیمت هر یک میلیون توکن خروجی

۴ قوان ۳.۸ مکس

رد اندازه گیری (۲ مورد)

عملکرد در لیدربورد متن عمومی ۱,۴۹۰ استخراج‌شده از لیدربورد متن Arena، به‌روزرسانی ثبت‌شده ۱۱ اوت ۲۰۲۶، ۷۷۶۵۲۲۰ رأی

بازده امتیاز به ازای دلار ۲۴۸.۳ امتیاز Arena (Text) تقسیم بر قیمت هر یک میلیون توکن خروجی

۵ کیمی کی۳ مکس

بلوغ زیرساخت ابزار ۱/۴ یکپارچگی شامل یک API سازگار با مشخصه اوپن ای آی به همراه یک کلاینت رسمی است. مستندات پلتفرم هیچ ابزار خط فرمان یا افزونه ویرایشگر رسمی را فهرست نمی کند، پس امتیاز بالاتر تخصیص داده نمی شود.

رد اندازه گیری (۲ مورد)

عملکرد در لیدربورد متن عمومی ۱,۴۸۷ استخراج شده از جدول رتبه بندی متن Arena، بر اساس به روزرسانی ۱۱ اوت ۲۰۲۶ و مجموع ۷۷۶۵۲۲۰ رای سنجش

بازده امتیاز به ازای دلار ۹۹.۱ امتیاز Arena (Text) تقسیم بر قیمت هر یک میلیون توکن خروجی

۶ جمینای ۳.۱ پرو

وضعیت دسترسی از ایران مسدود / راه کارآمدی ندارد مشخصات مناطق در دسترس Gemini API فهرست کشورهایی را تعریف می کند که این واجهه در آنها عملیاتی است و ایران در آن فهرست ثبت نشده. این وضعیت از همان سند استخراج شده و نه از یک اندازه گیری شبکه ای؛ سنجش مستقل هنوز انجام نگرفته است.

رد اندازه گیری (۲ مورد)

عملکرد در لیدربورد متن عمومی ۱,۴۸۶ استخراج شده از لیدربورد متن Arena، مهر زمانی به روزرسانی ۱۱ اوت ۲۰۲۶، مجموع ۷۷۶۵۲۲۰ رای ثبت شده

بازده امتیاز به ازای دلار ۱۲۳.۸ امتیاز Arena (Text) تقسیم بر قیمت هر یک میلیون توکن خروجی

۷ جیالام ۵.۲ مکس

بلوغ زیرساخت ابزار ۱/۴ یکپارچگی شامل یک API مستندسازی شده به همراه یک کلاینت رسمی است. هیچ ابزار خط فرمان یا افزونه ویرایشگر رسمی در مشخصات فنی فهرست نشده.

رد اندازه گیری (۲ مورد)

عملکرد در لیدربورد متن عمومی ۱,۴۷۰ جایگاه ۳۳ از میان ۳۸۹ مدل ثبت شده در جدول رتبه بندی متن Arena، بر اساس به روزرسانی ۱۱ اوت ۲۰۲۶ و ۲۶۷۰۳ رای سنجش برای همین رکورد

بازده امتیاز به ازای دلار ۳۳۴.۱ امتیاز Arena (Text) تقسیم بر قیمت هر یک میلیون توکن خروجی

۸ دیپ سیک وی۴ فلش

بلوغ زیرساخت ابزار ۱/۴ یکپارچه سازی از طریق یک API مستندسازی شده و یک کلاینت رسمی امکان پذیر است. هیچ ابزار عاملی رسمی یا افزونه ویرایشگر رسمی در دسترس فهرست نشده.

رد اندازه گیری (۲ مورد)

عملکرد در لیدربورد متن عمومی ۱,۴۳۵ رتبه ۸۳ از مجموع ۳۸۹ مدل در لیدربورد متن Arena، ساخت به روزرسانی شده در ۱۱ اوت ۲۰۲۶، با ۴۹۱۱۱ رای ثبت شده برای این ردیف

بازده امتیاز به ازای دلار ۱,۰۸۷.۱ امتیاز Arena (Text) تقسیم بر قیمت هر یک میلیون توکن خروجی

۹ گراک ۴.۵

بلوغ زیرساخت ابزار ۳/۴ یکپارچگی شامل یک API سازگار با مشخصه اوپن ای آی، دو SDK رسمی برای پایتون و جاوااسکریپت، و یک عامل خط فرمان رسمی به نام گراک بیلد است. سطح چهارم در دسترس نیست چون افزونه رسمی ویرایشگر در معماری تعبیه نشده و مسیر اجرای دسته ای هم این مدل خاص را نمی پذیرد.

رد اندازه گیری (۲ مورد)

عملکرد در لیدربورد متن عمومی ۱,۴۶۹ جایگاه ۳۴ از میان ۳۸۹ مدل ثبت شده در جدول رتبه بندی متن Arena، بر اساس به روزرسانی ۱۱ اوت ۲۰۲۶ و مجموع ۷۷۶۵۲۲۰ رای سنجش

بازده امتیاز به ازای دلار ۲۴۴.۸ امتیاز Arena (Text) تقسیم بر قیمت هر یک میلیون توکن خروجی

این رتبه بندی چطور حساب می شود

هر معیار زیر یک وزن دارد و یک منبع. وزن را عوض کنید، کل جدول از نو حساب می شود. هیچ جای این مرجع، جایگاهی دستی گذاشته نشده است.

معیار وزن شاهد
عملکرد در لیدربورد متن عمومی ۴۵ Arena (Text)ترجیح انسانی در گفت وگوی باز؛ برای این کاربرد نزدیک ترین سنجه موجود به معیار درست است، به همین دلیل بیشترین وزن را می گیرد
بازده امتیاز به ازای دلار ۲۰ محاسبه شده از دو عدد بالابرای پیاده سازی چت روی API، پرداخت دو برابر هزینه برای یک درصد امتیاز بیشتر تصمیم اقتصادی نادرستی است؛ برای خرید اشتراک محصول، این ستون اثر عملیاتی ندارد
ظرفیت پنجره متن ۱۵ مشخصات اعلامی سازندهگفت وگوی طولانی با پر شدن پنجره ابتدا حافظه خود را از دست می دهد و سپس هزینه اش بالا می رود
بلوغ زیرساخت ابزار ۱۰ مقیاس تعریف شده، با دلیل نوشته برای هر انتسابمدلی بدون کلاینت رسمی، SDK و مسیر استقرار ابری، در کار روزمره از مدلی کمی ضعیف تر عقب می افتد
وضعیت دسترسی از ایران ۱۰ ستون دسترسی ما، با روش اعلام شدهده وزن از صد، چون این محور صفحه اختصاصی خودش را دارد؛ امروز سه ردیف از نه ردیف در این ستون شاهد دارند

معماری لایه ای که این جدول ابزارسنجی می کند

واحد اندازه گیری در این جدول مدل است، نه محصول. مدل مولفه ای است که سازنده برایش عدد منتشر می کند: امتیاز لیدربورد، هزینه هر میلیون توکن، ظرفیت پنجره متن. محصول لایه بالاتر معماری است: یک کلاینت که مدل زیرین خود را بدون اعلام تعویض می کند. اپوس ۵ همزمان زیرساخت اپ کلود، API و کلود کد را تغذیه می کند؛ اگر «کلود» یک ردیف در نظر گرفته شود، همان عدد در جدول کدنویسی دوباره شمارش می شود. به همین دلیل دسته ویدیو هم نسخه مدل را رتبه بندی می کند، نه ابزار را.

هزینه عملیاتی این تصمیم صریح است: چت جی پی تی، اپ کلود و اپ جمینای در این جدول ردیفی ندارند و به صفحه محصول خودشان ارجاع داده شده اند. در دسته مطالعه تصمیم معکوس گرفته شده، چون گوگل محدودیت های عملیاتی نوتبوک را با عدد مستند می کند: پنجاه منبع، پانصد هزار کلمه. برای یک اپ چت هیچ سازنده ای مشخصات هم تراز منتشر نمی کند.

ورودی معماری جدول: پنج معیار و وزن هرکدام

وزن ها ثابت اند و روی همین صفحه مستند شده اند: لیدربورد متن ۴۵، امتیاز به ازای دلار ۲۰، پنجره متن ۱۵، بلوغ ابزار ۱۰، دسترسی از ایران ۱۰. تنها ده واحد از صد روی مقیاسی ترتیبی سنجیده می شود. هر تغییر در این وزن ها یک ردیف در گزارش تغییرات ثبت می کند.

دو ستون این معماری به انتشار داده از سوی سازنده وابسته اند و همین وابستگی خانه های خالی تولید می کند. قوان ۳.۸ مکس و جمینای ۳.۱ پرو هر کدام دو ستون خالی دارند؛ این یک شکاف در انتشار داده است، نه ضعف در مدل، اما امتیاز نهایی را به طور واقعی پایین می کشد.

خروجی امروز معماری رتبه بندی

فیبل ۵ در لیدربورد متن Arena با امتیاز ۱۵۰۶ در میان ۳۸۹ مدل رتبه یک را دارد و کل ستون چهل و پنج وزنی را تصاحب می کند. همان مدل ستون امتیاز به ازای دلار را به طور کامل از دست می دهد: هزینه خروجی ۵۰ دلار برای هر میلیون توکن، گران ترین ردیف این جدول، با نسبت امتیاز به قیمت ۳۰.۱ که کف معماری قیمت گذاری است.

اپوس ۵ دوازده امتیاز پایین تر می ایستد و نصف قیمت عملیاتی دارد. روی لیدربوردی که کل رده بالایش در محدوده حدود پنجاه امتیاز جا می شود، فاصله دوازده امتیازی ناچیز است. بنابراین نقطه کار بهینه برای پیاده سازی روی API اپوس ۵ است؛ برای خرید اشتراک محصول، ستون قیمت اثری ندارد و صدر جدول تنها ملاک باقی می ماند.

یک محدودیت عملیاتی که ستونی در این معماری برایش تعریف نشده: فیبل ۵ تنها مدلی است که خود انتروپیک در جدول رسمی اش «کندتر» علامت گذاری کرده، چون تفکر تطبیقی آن همواره فعال است و اهرمی برای خاموش کردنش وجود ندارد. این تاخیر در گفت وگوی واقعی حس می شود، اما جدول آن را اندازه نمی گیرد.

مرز این معماری: چت جی پی تی

چت جی پی تی یک محصول است، پس در هر پیکربندی از ردیف های این جدول کنار گذاشته می شد. محدودیت سخت تر این است که حتی مستندسازی آن هم ممکن نیست: هر مسیر روی openai.com از سمت این سرور کد وضعیت ۴۰۳ برمی گرداند، بازآزمایی شده در ۱۲ اوت ۲۰۲۶، در حالی که robots.txt همان دامنه خزیدن را منع نکرده است.

یک مسیر یکپارچه سازی باز باقی می ماند: developers.openai.com به طور کامل پاسخ می دهد. جی پی تی ۵.۶ سول در آنجا با ۵ دلار ورودی و ۳۰ دلار خروجی، پنجره متن ۱٫۰۵ میلیون توکن، سقف خروجی ۱۲۸ هزار توکن و تاریخ قطع دانش ۱۶ فوریه ۲۰۲۶ فهرست شده و ردیف Arena مشخصی دارد. بر همین اساس، امروز سومین ردیف همین جدول را اشغال می کند.

ردیف توسعه وب این مدل دقیقا با عنوان gpt-5.6-sol-xhigh (codex-harness) ثبت شده: امتیاز متعلق به مدل درون عامل کدنویسی اختصاصی اوپن ای آی است، نه مدل خام. هزینه و پنجره متن به مدل پایه گره خورده اند و امتیاز به همان پیکربندی که آزمایش شده تعلق دارد. آنچه همچنان مجهول می ماند این است که امروز کدام مدل زیرساخت چت جی پی تی را تغذیه می کند، هزینه پلن هایش چقدر است، و آیا از ایران در دسترس قرار می گیرد یا نه؛ هر سه روی همان دامنه ای قرار دارند که پاسخ نمی دهد. صفحه اوپن ای آی این مرز عملیاتی را با جزئیات بیشتری مستند کرده است.

تلورانس روش سنجش

نه ردیف این جدول در بازه ای ۷۱ امتیازی الو جا می گیرند، از ۱۵۰۶ تا ۱۴۳۵. نرمال سازی کمینه-بیشینه همین ۷۱ امتیاز را به بازه ای از ۷۸٫۶ تا ۲۹٫۱ گسترش می دهد. در نتیجه ستون امتیاز فاصله واقعی را بزرگ تر از آنچه هست نشان می دهد؛ ردیف آخر «ضعیف» نیست، بلکه آخرین جایگاه در معماری ای از مدل های رده بالاست.

نمونه ای دقیق تر: ستون پنجره متن را جی پی تی ۵.۶ سول با ۱٬۰۵۰٬۰۰۰ توکن تصاحب می کند و کیمی کی۳ مکس با ۱٬۰۴۸٬۵۷۶ توکن پشت سر آن قرار دارد. اختلاف ۱۴۲۴ توکنی، حدود یک دهم درصد، در عمل بی اثر است. هر دو تقریبا تمام وزن این ستون را جذب می کنند؛ اما افزودن یک مدل با پنجره دو میلیونی هر دو را همزمان از این ستون خارج می کند، بی آنکه هیچ چیز در مشخصات خودشان تغییر کرده باشد.

دو ردیفی که پیش تر با وضعیت «تایید نشده» ثبت شده بودند، از ابتدا روی همین لیدربورد حضور داشتند: جیالام ۵٫۲ مکس در جایگاه سی وسوم با ۱۴۷۰ و دیپ سیک وی۴ فلش در جایگاه هشتادوسوم با ۱۴۳۵. این یک نقص در فرآیند سنجش ما بود، نه نقصی در انتشار سازنده. ردیف deepseek-v4-pro با ۱۴۵۸ روی همان لیدربورد به مدل دیگری از همان خانواده تعلق دارد، نه یک تنظیم متفاوت از همین مدل، بنابراین عددش وام گرفته نشد.

چه زمانی انتخاب اول ما مناسب نیست

  • اگر واحد نیاز عملیاتی شما محصول است و نه مدل، این جدول پاسخگو نیست؛ صفحه های محصول کلود و جمینای همین پرسش را در لایه درست پاسخ می دهند.
  • اگر بار کاری شما کدنویسی است، ترتیب این جدول با جدول کدنویسی یکسان نیست، چون معیارهای آن معماری کاملا متفاوت است.
  • اگر بار کاری شما حجم بالا و پاسخ های کوتاه است، ستون اول را نادیده بگیرید و ستون امتیاز به ازای دلار را ملاک قرار دهید؛ دیپ سیک در آن ستون با فاصله ای زیاد رتبه یک را دارد.
  • اگر از ایران و بدون مسیر دسترسی رسمی به این سرویس ها می رسید، ترتیب مدل ها کم اثرترین متغیر در مسئله شماست.

نقاط ضعف و محدودیت‌های شناخته‌شده

  • معیار اصلی این معماری یک لیدربورد ترجیح انسانی است: اندازه می گیرد پاسخ کدام مدل مورد پسند بیشتر کاربران است، نه اینکه کدام مدل از نظر فنی درست تر است.
  • کل جدول درون بازه ای ۷۱ امتیازی الو جای می گیرد و فرآیند نرمال سازی همین بازه را به ۷۸٫۶ تا ۲۹٫۱ گسترش می دهد، در نتیجه ستون امتیاز فاصله واقعی میان ردیف ها را بزرگ تر از واقعیت نشان می دهد.
  • شش ردیف از نه ردیف این جدول در ستون ایران فاقد شاهد مستند اند، چون سازنده آن ها فهرست کشوری منتشر نمی کند؛ تنها انتروپیک و گوگل چنین فهرستی را در دسترس می گذارند.
  • چت جی پی تی، اپ کلود و اپ جمینای در این جدول ردیفی ندارند، چون واحد اندازه گیری این معماری مدل است، نه محصول.
  • قوان ۳.۸ مکس و جمینای ۳.۱ پرو هر کدام دو ستون خالی در پروفایل داده خود دارند. این یک شکاف در انتشار داده از سوی سازنده است، نه ضعفی در مدل، اما امتیاز نهایی آن ها را به طور واقعی پایین می کشد.
  • دیپ سیک با هزینه خروجی ۰٫۲۸ دلار ستون امتیاز به ازای دلار را چنان کشیده است که فاصله چهار برابری میان اپوس ۵ و قوان در همان ستون به کمتر از یک امتیاز فشرده می شود.

جمع‌بندی فنی

برای پیاده سازی چت روی API و در صورت الزام به یک انتخاب واحد: اپوس ۵، با دوازده امتیاز فاصله از فیبل ۵ و نصف هزینه عملیاتی. برای خرید اشتراک محصول، ستون قیمت این جدول اثری ندارد و صدر جدول تنها معیار است. و اگر پرسش این است که کدام مدل به مشتری شما پاسخ می دهد، پاسخ صادقانه هیچ کدام است؛ آن یک وظیفه عملیاتی متفاوت است.

پرسش هایی که واقعا پرسیده می شود

بهترین هوش مصنوعی برای چت و مکالمه کدام است

در لیدربورد متن Arena، کلود فیبل ۵ امروز با امتیاز ۱۵۰۶ رتبه یک را دارد. اپوس ۵ با ۱۴۹۴ نصف هزینه عملیاتی را می طلبد، و روی لیدربوردی که کل رده بالایش در محدوده پنجاه امتیاز جا می شود، این فاصله دوازده امتیازی در عمل به سختی حس می شود.

چرا چت جی پی تی در این معماری رتبه بندی ردیفی ندارد

چون واحد اندازه گیری این جدول مدل است و چت جی پی تی یک محصول است. مدل زیرین آن حضور دارد: جی پی تی ۵.۶ سول ردیف سوم را اشغال کرده. خود اپ مستندسازی نشده، چون هر مسیر روی openai.com به این سرور کد وضعیت ۴۰۳ برمی گرداند.

چرا ترتیب اینجا با جدول کدنویسی فرق دارد

چون معماری معیارها متفاوت است. در آنجا لیدربورد توسعه وب وزن چهل را دارد و در اینجا لیدربورد متن عمومی وزن چهل وپنج را. مدلی که در کدنویسی قوی تر است لزوما پاسخ خوشایندتری در گفت وگو تولید نمی کند، و اپوس ۵ و فیبل ۵ دقیقا جایگاه خود را میان همین دو جدول جابه جا می کنند.

کدام یک از اینها از ایران کار می کند

هیچ کدام مسیر دسترسی رسمی ندارند. انتروپیک و گوگل فهرست کشورهای خود را منتشر می کنند و ایران در هیچ کدام نیست؛ سایر سازنده ها فهرستی منتشر نمی کنند و ستون آن ها خالی مانده است. ما نه اکانت می فروشیم و نه روشی برای دور زدن محدودیت پیشنهاد می کنیم.

صدر این جدول برای شما پاسخگو است، نه برای مشتری شما. برای آن وظیفه دوم، نیروی انسانی به کار می گیریم نه ربات، و این دقیقا همان خدمت

دستیار مجازی و منشی آنلاین
نام این صفحه در خانواده Seemerce

خوانده می شود: سی‌چت

مقایسه دستیارهای گفت وگویی و کاری که هرکدام واقعا خوب انجام می دهند.

قاعده یکی است: See به یک کلمه می چسبد و یک واژه تازه می سازد، نه دو کلمه کنار هم. همان طور که See و commerce شدند Seemerce.