بهترین هوش مصنوعی برای کدنویسی
در پیکربندی امروز، کلود اپوس ۵ بالاترین امتیاز را می گیرد: در لیدربورد WebDev Arena با ۱۶۹۲ امتیاز رتبه یک را دارد و هم زمان قیمتش نصف گران ترین مدل بازار است. جدول زیر معماری معیارها و وزن هر کدام را نشان می دهد و هر عدد به منبع مستقیم خودش وصل است.
- هشت مدل با شاهد قابل رهگیری
- وزن معیارها روی صفحه
- بدون جایگاه دستی
آخرین بررسی: این صفحه یک مرجع است. با هر نسخه تازه، منابع سازنده دوباره خوانده و صفحه بهروز می شود. چه چیزی عوض شد
امتیاز هر ابزار از کجا می آید
حلقه زیر، همان وزن هایی است که در سرستون های جدول پایین نوشته شده.
- لیدربورد توسعه وب ۴۰
- امتیاز به ازای هر دلار ۲۰
- بلوغ زیرساخت ابزار ۱۵
- لیدربورد متن عمومی ۱۰
- ظرفیت پنجره متن ۱۰
- دسترسی از ایران ۵
وزن ها را ما انتخاب کرده ایم و همین تنها جای سلیقه این جدول است. اگر وزن دیگری درست تر می دانید، ترتیب هم عوض می شود.
رتبه بندی امروز، بر پایه شاهد تاییدشده
مدلی که در لیدربورد رتبه بالاتری از خط تولید ما دارد، حتی اگر صفحه اختصاصی اش نوشته نشده باشد، در جدول ثبت می شود؛ در غیر این صورت رتبه اول فقط یعنی اول در میان نامزدهایی که فرصت مستندسازی شان بوده.
سلول خالی یعنی آن عدد را نتوانسته ایم تایید کنیم، نه اینکه ابزار صفر گرفته است.
پشت هر عدد
هر نمره داوری این جدول یک دلیل نوشته شده دارد و ستون ایران می گوید چطور بررسی شده. آن دو اینجا بازند. رد اندازه گیری هر عدد، یعنی اینکه از کدام ردیف کدام لیدربورد و با چند رای آمده، زیر همان مدل باز می شود.
۱ کلود اپوس ۵
بلوغ زیرساخت ابزار ۴/۴ سطح یکپارچه سازی کامل است: API، اپ رسمی، ابزار خط فرمان، SDK عامل، خط لوله اجرای دسته ای، و استقرار روی زیرساخت سه ابر بزرگ
دسترسی از ایران مسدود / راه کارآمدی ندارد ایران در هیچ یک از دو فهرست کشورهای پشتیبانی شده انتروپیک (سطح API و سطح claude.ai) ثبت نشده. این وضعیت از سند خط مشی خود انتروپیک استخراج شده، نه از سنجش مستقیم شبکه؛ آزمون مستقل شبکه ای هنوز اجرا نشده و در صورت اجرا، نتیجه همین جا ثبت می شود.
رد اندازه گیری (۳ مورد)
لیدربورد توسعه وب ۱,۶۹۲ داده منبع، ردیف پیکربندی claude-opus-5-max: رتبه یک، استخراج از ۵۶۷۴۴۶ رای، به روزرسانی ۱۱ اوت ۲۰۲۶
امتیاز به ازای هر دلار ۶۷.۷ امتیاز WebDev Arena تقسیم بر قیمت هر یک میلیون توکن خروجی
لیدربورد متن عمومی ۱,۴۹۴ داده منبع، ردیف پیکربندی claude-opus-5-high: رتبه هفت، استخراج از ۷۷۶۵۲۲۰ رای
۲ کلود فیبل ۵
بلوغ زیرساخت ابزار ۴/۴ روی همان زیرساخت استقرار اپوس ۵ ساخته شده و پوشش کامل روی هر پنج مسیر عرضه دارد: API اختصاصی انتروپیک، بدراک، کلود پلتفرم روی AWS، گوگل کلاد و مایکروسافت فاندری.
دسترسی از ایران مسدود / راه کارآمدی ندارد ایران در فهرست کشورهای پشتیبانی شده انتروپیک ثبت نشده. این وضعیت از سند خط مشی خود انتروپیک استخراج شده، نه از سنجش شبکه.
رد اندازه گیری (۳ مورد)
لیدربورد توسعه وب ۱,۶۲۸ داده منبع، لیدربورد WebDev Arena، به روزرسانی ۱۱ اوت ۲۰۲۶، استخراج از ۵۶۷۴۴۶ رای
امتیاز به ازای هر دلار ۳۲.۶ امتیاز WebDev Arena تقسیم بر قیمت هر یک میلیون توکن خروجی
لیدربورد متن عمومی ۱,۵۰۶ داده منبع، لیدربورد متن Arena، به روزرسانی ۱۱ اوت ۲۰۲۶، استخراج از ۷۷۶۵۲۲۰ رای
۳ قوان ۳.۸ مکس
رد اندازه گیری (۳ مورد)
لیدربورد توسعه وب ۱,۶۷۰ استخراجشده از لیدربورد WebDev Arena، بهروزرسانی ثبتشده ۱۱ اوت ۲۰۲۶، ۵۶۷۴۴۶ رأی
امتیاز به ازای هر دلار ۲۷۸.۳ امتیاز WebDev Arena تقسیم بر قیمت هر یک میلیون توکن خروجی
لیدربورد متن عمومی ۱,۴۹۰ استخراجشده از لیدربورد متن Arena، بهروزرسانی ثبتشده ۱۱ اوت ۲۰۲۶، ۷۷۶۵۲۲۰ رأی
۴ کیمی کی۳ مکس
بلوغ زیرساخت ابزار ۱/۴ یکپارچگی شامل یک API سازگار با مشخصه اوپن ای آی به همراه یک کلاینت رسمی است. مستندات پلتفرم هیچ ابزار خط فرمان یا افزونه ویرایشگر رسمی را فهرست نمی کند، پس امتیاز بالاتر تخصیص داده نمی شود.
رد اندازه گیری (۳ مورد)
لیدربورد توسعه وب ۱,۶۷۴ استخراج شده از جدول رتبه بندی WebDev Arena، بر اساس به روزرسانی ۱۱ اوت ۲۰۲۶ و مجموع ۵۶۷۴۴۶ رای سنجش
امتیاز به ازای هر دلار ۱۱۱.۶ امتیاز WebDev Arena تقسیم بر قیمت هر یک میلیون توکن خروجی
لیدربورد متن عمومی ۱,۴۸۷ استخراج شده از جدول رتبه بندی متن Arena، بر اساس به روزرسانی ۱۱ اوت ۲۰۲۶ و مجموع ۷۷۶۵۲۲۰ رای سنجش
۵ جی پی تی ۵.۶ سول
بلوغ زیرساخت ابزار ۴/۴ سطح چهارم به استناد اسناد فنی خود سازنده تایید می شود: API، SDK ها و یک خط فرمان رسمی، افزونه ویرایشگر کدکس، SDK عامل، یک مسیر اجرای دسته ای، و یک راهنمای رسمی استقرار روی آمازون بدراک که شناسه openai.gpt-5.6-sol را ثبت کرده است. این تنها ستونی است که برای این مدل بدون در دسترس بودن openai.com هم به طور کامل تکمیل شد.
رد اندازه گیری (۳ مورد)
لیدربورد توسعه وب ۱,۶۲۳ رکورد gpt-5.6-sol-xhigh (codex-harness) در جدول رتبه بندی WebDev Arena، جایگاه ۶ از میان ۱۱۳ مدل ثبت شده، بر اساس به روزرسانی ۱۱ اوت ۲۰۲۶ و ۸۲۵۴ رای سنجش برای همین رکورد
امتیاز به ازای هر دلار ۵۴.۱ امتیاز WebDev Arena تقسیم بر قیمت هر یک میلیون توکن خروجی
لیدربورد متن عمومی ۱,۴۸۱ رکورد gpt-5.6-sol-xhigh در جدول رتبه بندی متن Arena، جایگاه ۱۸ از میان ۳۸۹ مدل ثبت شده، بر اساس به روزرسانی ۱۱ اوت ۲۰۲۶ و ۱۵۲۲۶ رای سنجش برای همین رکورد
۶ دیپ سیک وی۴ فلش
بلوغ زیرساخت ابزار ۱/۴ یکپارچه سازی از طریق یک API مستندسازی شده و یک کلاینت رسمی امکان پذیر است. هیچ ابزار عاملی رسمی یا افزونه ویرایشگر رسمی در دسترس فهرست نشده.
رد اندازه گیری (۳ مورد)
لیدربورد توسعه وب ۱,۵۸۵ استخراج شده از لیدربورد WebDev Arena، ساخت به روزرسانی شده در ۱۱ اوت ۲۰۲۶، بر پایه ۵۶۷۴۴۶ رای ثبت شده
امتیاز به ازای هر دلار ۱,۲۰۰.۸ امتیاز WebDev Arena تقسیم بر قیمت هر یک میلیون توکن خروجی
لیدربورد متن عمومی ۱,۴۳۵ رتبه ۸۳ از مجموع ۳۸۹ مدل در لیدربورد متن Arena، ساخت به روزرسانی شده در ۱۱ اوت ۲۰۲۶، با ۴۹۱۱۱ رای ثبت شده برای این ردیف
۷ جیالام ۵.۲ مکس
بلوغ زیرساخت ابزار ۱/۴ یکپارچگی شامل یک API مستندسازی شده به همراه یک کلاینت رسمی است. هیچ ابزار خط فرمان یا افزونه ویرایشگر رسمی در مشخصات فنی فهرست نشده.
رد اندازه گیری (۳ مورد)
لیدربورد توسعه وب ۱,۵۸۸ استخراج شده از جدول رتبه بندی WebDev Arena، بر اساس به روزرسانی ۱۱ اوت ۲۰۲۶ و مجموع ۵۶۷۴۴۶ رای سنجش
امتیاز به ازای هر دلار ۳۶۰.۹ امتیاز WebDev Arena تقسیم بر قیمت هر یک میلیون توکن خروجی
لیدربورد متن عمومی ۱,۴۷۰ جایگاه ۳۳ از میان ۳۸۹ مدل ثبت شده در جدول رتبه بندی متن Arena، بر اساس به روزرسانی ۱۱ اوت ۲۰۲۶ و ۲۶۷۰۳ رای سنجش برای همین رکورد
۸ گراک ۴.۵
بلوغ زیرساخت ابزار ۳/۴ یکپارچگی شامل یک API سازگار با مشخصه اوپن ای آی، دو SDK رسمی برای پایتون و جاوااسکریپت، و یک عامل خط فرمان رسمی به نام گراک بیلد است. سطح چهارم در دسترس نیست چون افزونه رسمی ویرایشگر در معماری تعبیه نشده و مسیر اجرای دسته ای هم این مدل خاص را نمی پذیرد.
رد اندازه گیری (۳ مورد)
لیدربورد توسعه وب ۱,۵۵۴ جایگاه ۱۲ از میان ۱۱۳ مدل ثبت شده در جدول رتبه بندی WebDev Arena، بر اساس به روزرسانی ۱۱ اوت ۲۰۲۶ و مجموع ۵۶۷۴۴۶ رای سنجش
امتیاز به ازای هر دلار ۲۵۹.۰ امتیاز WebDev Arena تقسیم بر قیمت هر یک میلیون توکن خروجی
لیدربورد متن عمومی ۱,۴۶۹ جایگاه ۳۴ از میان ۳۸۹ مدل ثبت شده در جدول رتبه بندی متن Arena، بر اساس به روزرسانی ۱۱ اوت ۲۰۲۶ و مجموع ۷۷۶۵۲۲۰ رای سنجش
برای رتبه دادن، داده تاییدشده کافی نداریم
اینها ابزارهای واقعی اند و پیگیری شان می کنیم، ولی بیش از نیم وزن معیارها برایشان عدد تاییدشده ندارد، پس رتبه دادنشان حدس زدن بود.
- جمینای ۳.۱ پرو
این رتبه بندی چطور حساب می شود
هر معیار زیر یک وزن دارد و یک منبع. وزن را عوض کنید، کل جدول از نو حساب می شود. هیچ جای این مرجع، جایگاهی دستی گذاشته نشده است.
| معیار | وزن | شاهد |
|---|---|---|
| لیدربورد توسعه وب | ۴۰ | WebDev Arenaسنجش روی کارهای واقعی توسعه وب با ابزار و چند مرحله اجرا، که به بار کاری روزانه نزدیک تر است تا یک آزمون تک مرحله ای |
| امتیاز به ازای هر دلار | ۲۰ | محاسبه شده از دو عدد بالابرای تیمی با صورت حساب ماهانه، انتخاب مدلی گران تر برای یک درصد امتیاز اضافه، تصمیم اقتصادی نادرستی است |
| بلوغ زیرساخت ابزار | ۱۵ | مقیاس تعریف شده، با دلیل نوشته برای هر انتسابمدلی بدون ابزار خط فرمان و SDK عامل، در استقرار روزمره کند عمل می کند، صرف نظر از قدرت خام مدل |
| لیدربورد متن عمومی | ۱۰ | Arena (Text)وزن پایین دارد چون گفتگوی عمومی سنجه کدنویسی نیست، هرچند کاملا بی ربط هم نیست |
| ظرفیت پنجره متن | ۱۰ | مشخصات اعلامی سازندهروی مخزن بزرگ، پنجره کوچک یعنی تکه تکه کردن ورودی و از دست رفتن زمینه اجرا |
| دسترسی از ایران | ۵ | ستون دسترسی ما، با روش اعلام شدهوزن پایین دارد چون این محور مستقل، صفحه اختصاصی خودش را در «هوش مصنوعی در ایران» دارد |
چرا اپوس ۵ در صدر است
دو عامل هم زمان کار می کنند. اول، در WebDev Arena که کارهای واقعی توسعه وب را با ابزار و چند مرحله اجرا می سنجد، ردیف claude-opus-5-max با ۱۶۹۲ امتیاز رتبه یک را دارد؛ بعد از آن کیمی کی۳ مکس با ۱۶۷۴ و قوان ۳.۸ مکس با ۱۶۷۰ قرار می گیرند. دوم، هزینه خروجی آن ۲۵ دلار است، یعنی نصف فیبل ۵ که خودش با ۱۶۲۸ رتبه پایین تری دارد. مدلی که هم توان بالاتر و هم هزینه پایین تر دارد، زیر هر پیکربندی وزنی معقولی در صدر می نشیند.
جایی که این جدول کوتاه می آید
معیار اصلی این جدول یک لیدربورد ترجیح انسانی است، نه یک آزمون خودکار. WebDev Arena عدد مطلق، تاریخ و تعداد رای منتشر می کند که برای انتشار روی این صفحه لازم است، اما ترجیح انسانی به خوانایی و شکل خروجی هم حساس است، نه فقط به درستی کد. SWE-bench Verified معیار دقیق تری خواهد بود، اما لیدربوردش با جاوااسکریپت رندر می شود و ما عدد آن را مستقیم نخوانده ایم. عددی که نخوانده باشیم روی این صفحه منتشر نمی شود، حتی اگر منبع دیگری آن را نقل کرده باشد.
یک نامزد در همین صفحه هنوز بدون رتبه است: جمینای ۳.۱ پرو. امتیاز واقعی در لیدربورد متن عمومی دارد، اما ردیف آن در لیدربورد توسعه وب خوانده نشده و گوگل پنجره متن آن را اصلا منتشر نکرده، پس بیش از نیمی از وزن معیارها برایش خالی می ماند. نام آن زیر جدول ثبت شده، رتبه اش نه. جیالام ۵.۲ مکس و دیپ سیک وی۴ فلش هم تا مدتی در همین وضعیت بودند و اکنون که قیمت و پنجره متنشان از مستندات رسمی خودشان تایید شده، در جدول رتبه دارند.
یک نکته دیگر برای خواندن درست عددها: امتیازها نسبی اند. هر ستون بین کمینه و بیشینه خودش نرمال سازی می شود، پس ورود یک نامزد تازه امتیاز همه ردیف ها را جابه جا می کند بدون آنکه هیچ مدلی تغییر کرده باشد. افزودن گراک ۴.۵ در ۱۲ اوت ۲۰۲۶ دقیقا همین اثر را داشت: ترتیب ثابت ماند و عددها بالا رفتند. اگر عدد امروز با اسکرین شات هفته گذشته هم خوانی ندارد، همین مکانیزم دلیل آن است، نه دخالت دستی.
در همان روز دو تغییر داده ای دیگر هم در امتیازها اثر گذاشتند. اول اینکه لیدربورد متن این بار به طور کامل بازخوانی شد و مشخص شد ردیف جیالام ۵.۲ مکس و دیپ سیک وی۴ فلش از ابتدا آنجا بوده اند؛ اجرای پیشین فقط بالای صفحه را خوانده بود. ستون لیدربورد متن عمومی برای هر دو تکمیل شد. دوم اینکه جی پی تی ۵.۶ سول به عنوان نامزد هشتم وارد شد: openai.com همچنان به درخواست های زیرساخت ما پاسخ نمی دهد، اما مستندات توسعه دهندگان آن قیمت و پنجره متن را منتشر می کند و ردیف لیدربوردش هم موجود است. یک نکته درباره همین ردیف، چون این صفحه اختصاصی کدنویسی است: نام آن gpt-5.6-sol-xhigh (codex-harness) است، یعنی عدد متعلق به مدل درون عامل کدنویسی اختصاصی اوپن ای آی است، نه مدل خام. جی پی تی بین کیمی و قوان قرار گرفت و ترتیب سایر ردیف ها نسبت به هم تغییر نکرد.
۲۸ اوت: قیمت دیپ سیک بالا رفت و سه ردیف جابه جا شدند
این تنها عددی است که تا امروز در این مرجع افزایش یافته. تا ۱۲ اوت، قیمت دیپ سیک وی۴ فلش ۰.۱۴ دلار برای ورودی و ۰.۲۸ دلار برای خروجی بود. صفحه قیمت گذاری رسمی آن اکنون دو ستون دارد، ساعت اوج و غیر اوج، و حتی ارزان ترین ستون هم از قیمت قبلی بالاتر است: ۰.۲۲ و ۰.۶۶ در ساعت غیر اوج، و ۰.۴۴ و ۱.۳۲ در ساعت اوج. ستون ساعت اوج را ثبت کرده ایم، چون بازه اوج دیپ سیک با میانه ساعت کاری ایران هم پوشانی دارد.
دیپ سیک از این تغییر رتبه ای از دست نداد، چون همچنان ارزان ترین ردیف جدول است و ستون صرفه اقتصادی را در اختیار دارد. اما فاصله آن با بقیه کم شد و چون هر ستون بین کمینه و بیشینه خودش نرمال می شود، همین کاهش فاصله سه ردیف دیگر را بالا برد: قوان ۳.۸ مکس از پنجم به سوم، کیمی کی۳ مکس از سوم به چهارم و جی پی تی ۵.۶ سول از چهارم به پنجم. هیچ یک از این سه مدل چیزی در ساختار خود تغییر نداده اند. این دقیقا تعریف عملیاتی «رتبه بندی نسبی» است، و دلیلی که محاسبات آن روی همین صفحه منتشر می شود.
نکته ای که فقط در استقرار روزمره دیده می شود
سه امتیاز بالای این جدول در بازه ای ۲۲ واحدی جا می شوند، ۱۶۹۲ و ۱۶۷۴ و ۱۶۷۰، فاصله ای که در عمل کمتر از آن چیزی حس می شود که عدد نشان می دهد. آنچه واقعا یک روز کاری را متفاوت می کند بلوغ زیرساخت ابزار است: اینکه مدل ابزار خط فرمان دارد، اجرای دسته ای پشتیبانی می کند، و روی زیرساخت ابری ای مستقر است که سازمان شما از قبل با آن قرارداد دارد. برای همین این معیار پانزده واحد وزن گرفته، نه پنج.
چه زمانی انتخاب اول ما مناسب نیست
- اگر زیرساخت تیم شما روی ابری است که اپوس ۵ رویش مستقر نیست، مدل دوم جدول با ابزار موجود از مدل اول بدون ابزار کاربردی تر است.
- اگر بار کاری شما کدنویسی نیست و گفتگوی عمومی است، این جدول را معیار نگیرید؛ لیدربورد متن ترتیب دیگری دارد.
- اگر بودجه واقعا محدود است، مدل های متن باز پایین جدول با فاصله امتیاز کمتری نسبت به فاصله قیمتشان عمل می کنند.
نقاط ضعف و محدودیتهای شناختهشده
- معیار اصلی این رتبه بندی یک لیدربورد ترجیح انسانی است، نه یک آزمون خودکار روی مخزن واقعی.
- عدد SWE-bench Verified در جدول ثبت نشده، چون لیدربوردش را نتوانسته ایم مستقیم بخوانیم.
- ادعاهای خود انتروپیک درباره Frontier-Bench نسبی اند و عدد مطلق ندارند، پس آن ستون خالی مانده.
- قوان ۳.۸ مکس اکنون قیمت و پنجره متن تاییدشده دارد، اما ستون بلوغ ابزار و ستون ایران برای آن هنوز بدون شاهد است، یعنی ۲۰ واحد از صد برایش سنجیده نشده. این کمبود در داده ماست، نه ضعفی در مدل.
جمعبندی فنی
اگر باید یک مدل انتخاب کنید و دسترسی از ایران محدودیت نیست، اپوس ۵. اگر محدودیت هزینه است، پیش از تعویض مدل، اول مصرف توکن خودتان را بررسی کنید: در نمونه کارهایی که دیده ایم، کوتاه کردن زمینه اجرا صرفه جویی بیشتری از تعویض مدل ایجاد می کند.
پرسش هایی که واقعا پرسیده می شود
بهترین هوش مصنوعی برای کدنویسی کدام است
در پیکربندی امروز، کلود اپوس ۵، بر پایه رتبه یک آن در لیدربورد WebDev Arena و قیمتی که نصف گران ترین مدل بازار است. این پاسخ مهر تاریخ دارد و با هر انتشار تازه می تواند تغییر کند.
مدل متن باز برای کدنویسی قابل استقرار است
بله. در همین لیدربورد، کیمی کی۳ مکس با ۱۶۷۴ و قوان ۳.۸ مکس با ۱۶۷۰ فاصله کمی با مدل اول دارند. هر دو اکنون قیمت تاییدشده دارند. قوان امروز پنجم است نه چهارم، بدون آنکه چیزی در خود آن تغییر کرده باشد: جی پی تی ۵.۶ سول بالای آن وارد جدول شد. امتیاز خود قوان هم در همان روز افزایش یافت.
چرا این رتبه بندی با فهرست های دیگر فرق دارد
چون معیار و وزن هر بخش را مستند کرده ایم و قابل بازبینی است. بیشتر فهرست ها ترتیب خود را توضیح نمی دهند، و جایی که توضیحی نیست، هر ترتیبی ممکن است.
اگر زمان راه اندازی این ابزارها روی پروژه خودتان را ندارید، این کار بخشی از خدمت
طراحی اپلیکیشن و نرم افزار سفارشی