بررسی Claude Opus 5: چه چیزی عوض شد و کجا هنوز کم میآورد؟
نتایج بنچمارکها، قیمت، پنجره یک میلیون توکنی، تفاوت با Opus 4.8 و محدودیتهایی که پیش از مهاجرت باید بدانید.

آنتروپیک مدل تازهاش، Claude Opus 5، را منتشر کرده و جالب اینکه قیمتش دستنخورده مانده: هر میلیون توکن ورودی ۵ دلار و هر میلیون توکن خروجی ۲۵ دلار، دقیقاً مثل نسل قبلی یعنی Opus 4.8. (توکن واحد شمارش متن است و هر توکن تقریباً معادل چند حرف؛ شرکتهای هوش مصنوعی بر همین اساس صورتحساب میدهند.) پس آنچه عوض شده قیمت نیست، حجم کاری است که با همان پول از مدل میگیرید.
مشخصات پایه opus 5
- شناسه مدل در API: claude-opus-5
- پنجره زمینه: ۱ میلیون توکن، یعنی حجم متنی که مدل میتواند یکجا جلوی چشمش داشته باشد. این عدد هم پیشفرض است و هم سقف.
- حداکثر خروجی: ۱۲۸ هزار توکن در یک پاسخ
- تفکر (thinking): پیشفرض روشن است، یعنی مدل قبل از جواب دادن برای خودش فکر میکند و بابت آن فکر کردن هم توکن مصرف میشود
- سطح تلاش (effort): پنج پله از low تا max، با پیشفرض high. هرچه بالاتر بروید مدل عمیقتر فکر میکند و طبیعتاً گرانتر و کندتر میشود.
- در دسترس روی: Claude API، Amazon Bedrock، Google Cloud و Microsoft Foundry
برای OPUS 5 در آزمونها چه اتفاقی افتاد؟
در آزمون Frontier-Bench v0.1، که کارهای واقعی مهندسی نرمافزار را به مدل میسپارد، Opus 5 نمرهای بیش از دو برابر Opus 4.8 گرفته، آن هم با هزینه کمتر برای هر تسک. در CursorBench 3.2 و با بالاترین سطح تلاش، فاصلهاش با بهترین نمره Fable 5 (گرانترین و قدرتمندترین مدل عمومی آنتروپیک) به کمتر از نیم درصد رسیده؛ با نصف هزینه.

در ARC-AGI 3، که عمداً مسئلههایی میدهد که مدل شبیهشان را قبلاً ندیده، نمره Opus 5 سه برابر نزدیکترین رقیبش است. در AutomationBench شرکت Zapier، که میسنجد مدل یک کار اداری را از ابتدا تا انتها تمام میکند یا نه، نرخ موفقیتش حدود ۱.۵ برابر بهترین رقیب با همان هزینه است. در OSWorld 2.0 هم که مدل باید مستقیم با کامپیوتر کار کند، بهترین نتیجه Fable 5 را با کمی بیش از یکسوم هزینه پشت سر گذاشته.

در علوم زیستی هم آنتروپیک میگوید Opus 5 در تمام ارزیابیهای داخلی این حوزه از Opus 4.8 جلوتر بوده. بیشترین اختلاف در شیمی آلی دیده شده (یعنی حدس زدن ساختار یک مولکول از روی دادههای آزمایشگاهی) با ۱۰.۲ واحد درصد نمره بالاتر. بعد از آن کارهای مربوط به پروتئین قرار دارد (پیشبینی اینکه تغییر در ساختار یک پروتئین چطور رفتارش را عوض میکند) با ۷.۷ واحد درصد اختلاف.
همسویی و ایمنی
آنتروپیک پیش از انتشار، مدل را از یک ممیزی رفتاری خودکار رد میکند تا ببیند چقدر از قواعد خودش تخلف میکند. Opus 5 در این ممیزی نمره ۲.۳ گرفته که پایینترین عدد بین مدلهای اخیر این شرکت است و اینجا عدد کمتر یعنی بهتر. طبق همین گزارش، کمترین نرخ رفتار فریبکارانه را دارد و سختتر از بقیه با ترفند به سوءاستفاده کشیده میشود. فقط یادتان باشد این ارزیابی داخلی خود آنتروپیک است، نه ممیزی یک نهاد مستقل.

رفتار مدل عوض شده، نه فقط نمرهاش
اگر از Opus 4.8 مهاجرت میکنید، این سه تغییر بیشتر از اعداد بنچمارک به کارتان میآید، چون بدون اینکه یک خط کد عوض کنید خودشان را نشان میدهند.
تفکر پیشفرض روشن است:
نکته مهم اینجاست که max_tokens سقف کل خروجی است، یعنی هم فکر کردن مدل را حساب میکند و هم متن نهایی پاسخ را. پس اگر قبلاً درخواستی داشتید که بدون فکر کردن اجرا میشد و حالا این قابلیت پیشفرض روشن است، ممکن است همان درخواست به سقف بخورد و پاسخ ناقص برگردد. بهتر است این عدد را یک بار دوباره تنظیم کنید.
دستورهای راستیآزمایی قدیمی را حذف کنید:
Opus 5 بدون اینکه از او بخواهید کار خودش را بازبینی میکند. پس جملههایی مثل «یک مرحله بررسی نهایی اضافه کن» که از پرامپتهای نسل قبل باقی مانده، حالا باعث بازبینی بیش از حد میشود و نتیجهاش فقط توکن و زمان اضافه است.
پاسخها طولانیتر شدهاند:
مدل بهصورت پیشفرض متن بلندتری مینویسد، در کارهای چندمرحلهای بیشتر گزارش پیشرفت میدهد و راحتتر بخشی از کار را به زیرایجنتها میسپارد (یعنی نسخههای کمکی خودش که هرکدام تکهای از کار را جدا انجام میدهند). برای پروژههای بزرگ این خبر خوبی است، ولی اگر کار شما کوتاه و ساده است، بابت خروجیای پول میدهید که لازمش نداشتید.
چیزهای تازهای که کنار هوش مصنوعی اوپوس 5 آمد
- تغییر ابزارها وسط مکالمه (نسخه آزمایشی): میتوانید بین نوبتها ابزاری را اضافه یا حذف کنید بدون اینکه کش پرامپت از بین برود. کش پرامپت یعنی بخشهای ثابت درخواست یک بار ذخیره میشود تا دفعه بعد ارزانتر و سریعتر پردازش شود.
- حداقل طول کش از ۱۰۲۴ به ۵۱۲ توکن رسیده: پرامپتهای کوتاهی که قبلاً برای کش شدن خیلی کوچک بودند حالا کش میشوند، بدون تغییر در کد شما.
- برگشت خودکار به مدل دیگر: اگر سیستمهای ایمنی درخواستی را علامت بزنند، درخواست بلاک نمیشود و به مدل دیگری میرود، یعنی کاربر شما دستخالی نمیماند.
- حالت Fast: حدود ۲.۵ برابر سریعتر، با دو برابر قیمت پایه یعنی ۱۰ و ۵۰ دلار. فعلاً هم فقط روی Claude API فعال است، نه روی Bedrock و Google Cloud و Microsoft Foundry.
کجاها باید حواستان باشد
اینها را خود آنتروپیک هم در اعلامیه و مستنداتش نوشته و دقیقاً همان بخشهایی است که در مرور اولیه از قلم میافتد.
سایبرسکیوریتی - محدودیتهای امنیت سایبری
Opus 5 در پیدا کردن آسیبپذیری تقریباً به Mythos 5 (قویترین رده مدلهای آنتروپیک که در دسترس عموم نیست) رسیده، ولی در نوشتن اکسپلویت، یعنی کدی که از آن آسیبپذیری واقعاً سوءاستفاده میکند، هنوز خیلی عقبتر است. جدا از این، سیستمهای تشخیص خود مدل اسکن باینری، تست نفوذ و تولید اکسپلویت را میبندند. اثر عملیاش این است که در Claude.ai و Claude Code و Cowork، درخواست علامتخورده (فلگ شده) به Opus 4.8 برمیگردد و برای آن یک درخواست عملاً مدل ضعیفتری جوابتان را میدهد. آنتروپیک تخمین زده این تشخیصدهندهها حدود ۸۵ درصد کمتر از Fable 5 فعال میشوند.

محدودیت در کارهای زیستی طولانی
Opus 5 توانمندترین مدل عمومی آنتروپیک برای پژوهش علمی است، ولی خود شرکت میگوید روی پژوهشهای طولانی و خودگردان هنوز محدودیت جدی دارد. پس اگر پروژهتان یک زنجیره چندروزه از آزمایش و تحلیل است، انتظار نداشته باشید مدل بدون نظارت شما تا انتها برود.
یک تغییر شکننده در API
روی Opus 5 خاموش کردن تفکر فقط تا سطح تلاش high پذیرفته میشود. اگر همان کار را با xhigh یا max انجام دهید، بهجای پاسخ، خطای ۴۰۰ میگیرید و این یعنی کدی که روی نسل قبل بیمشکل کار میکرد ممکن است از کار بیفتد. ضمناً وقتی تفکر خاموش باشد، مدل گاهی بهجای فراخوانی درست ابزار، متن آن فراخوانی را وسط پاسخ مینویسد یا تگهای داخلیاش را بیرون میریزد، که برای هر سیستمی که خروجی را خودکار پردازش میکند دردسر است.
محدودیت حالت Fast
حالت Fast فعلاً فقط روی Claude API فعال است، نه روی Bedrock، Google Cloud و Microsoft Foundry.
منبع اعداد
تقریباً تمام ارقام این مقاله را خود آنتروپیک یا مشتریان دسترسی زودهنگامش منتشر کردهاند و در زمان انتشار، آزمون مستقل شخص ثالث کم بود. پس این اعداد را نقطه شروع بگیرید نه نتیجه قطعی، و پیش از مهاجرت کامل، مدل را روی داده و کار واقعی خودتان امتحان کنید.
مدل OPUS 5 برای چه کاری ارزش دارد
اگر کارتان کدنویسی چندفایلی، بازنویسی بخشهای بزرگ یک پروژه، مرور کد و پیدا کردن باگ، تحلیل روی متنهای حجیم یا ایجنتهای چندمرحلهای طولانی است، اختلاف با Opus 4.8 را در همان روزهای اول حس میکنید و قیمت هم بالا نرفته. اما اگر کارتان دستهبندی متن، خلاصهنویسی کوتاه یا پاسخهای ساده است، Opus 5 هم گران است و هم پرحرف؛ در این حالت Sonnet 5 انتخاب عاقلانهتری است.
مهاجرت از Opus 4.8
در کد فقط کافی است شناسه مدل را عوض کنید:
model = "claude-opus-4-8" # قبل
model = "claude-opus-5" # بعداما همین یک خط، دو رفتار پنهان را هم با خودش میآورد که ارزش بررسی دارد. اول اینکه چون تفکر حالا پیشفرض روشن است، ممکن است به سقف max_tokens بخورید و پاسخ نصفه بماند، پس این عدد را بالاتر ببرید. دوم اینکه اگر عادت دارید تفکر را خاموش کنید، این کار فقط تا سطح تلاش high جواب میدهد و در سطوح بالاتر با خطا روبهرو میشوید؛ یا سطح تلاش را پایین بیاورید یا تفکر را روشن بگذارید و هزینه را با همان سطح تلاش کنترل کنید.




گفتگو و سوالات شما
۰در این قسمت میتوانید سوال یا نظر خود در مورد مقاله را مطرح کنید.
برای ثبت دیدگاه ابتدا وارد شوید
ورود به حسابهنوز دیدگاهی ثبت نشده. اولین نفر باشید!