اخبار

کلود فیبل ۵.۱ منتشر شد: هرچه عوض شده، در یک نگاه

آنتروپیک نسخه‌ی تازه‌ی قوی‌ترین مدلش را عرضه کرد. مهم‌ترین تغییرها فقط نمره‌ی بنچمارک نیست؛ قیمت پایین‌تر و محافظ‌های دقیق‌تر هم بخشی از خبر است.

ارسطو اعتمادی ملکی
۱۱ شهریور ۱۴۰۵ · 10 دقیقه مطالعه
کلود فیبل ۵.۱ منتشر شد: هرچه عوض شده، در یک نگاه

آنتروپیک در سپتامبر ۲۰۲۶ دو مدل کلود فیبل ۵.۱ و کلود میتوس ۵.۱ را منتشر کرد. این دو در واقع یک مدل واحدند و تنها تفاوتشان سطح محافظ‌های ایمنی است: فیبل ۵.۱ برای همه در دسترس است، اما میتوس ۵.۱ فقط از راه برنامه‌های دسترسی تأییدشده به افراد و سازمان‌هایی داده می‌شود که در امنیت سایبری و علوم زیستی کار می‌کنند.


قیمت

دسترسی

بزرگ‌ترین جهش

برای کارهای معمول حدود ۲۵٪ ارزان‌تر از فیبل ۵، و در کارهای سنگین تا حدود ۴۵٪

از همین امروز روی همه‌ی پلتفرم‌ها؛ شناسه‌ی مدل در API: claude-fable-5-1

تحقیق علمی خودگردان: ۵۲.۶٪ در برابر ۲۴.۷٪ فیبل ۵

سه چیزی که واقعاً عوض شده

قیمت. آنتروپیک هزینه‌ی «کش رید» را ۷۵ درصد کم کرده و به ۰.۲۵ دلار برای هر میلیون توکن رسانده. کش رید یعنی وقتی مدل بخشی از ورودی را می‌خواند که قبلاً پردازش و ذخیره شده و لازم نیست دوباره از صفر خوانده شود. در کارهای طولانی و ابزارمحور، همین بخش بیشترِ صورت‌حساب را می‌سازد؛ پس اگر شما هم روی پروژه‌های چندساعته یا ایجنت‌های خودکار کار می‌کنید، کاهش هزینه‌ی واقعی‌تان به همان عدد ۴۵ درصد نزدیک‌تر خواهد بود تا ۲۵ درصد. بقیه‌ی قیمت‌ها دست‌نخورده مانده: ۱۰ دلار برای هر میلیون توکن ورودی و ۵۰ دلار برای هر میلیون توکن خروجی.

محافظ‌ها دقیق‌تر شدند. محافظ (safeguard) همان لایه‌ای است که جلوی کاربردهای خطرناک را می‌گیرد، اما گاهی درخواست‌های بی‌خطر را هم اشتباهی مسدود می‌کند. آنتروپیک می‌گوید کاربران کلود کد حالا به‌طور میانگین حدود ۶۰ درصد کمتر با دخالت محافظ‌های سایبری روبه‌رو می‌شوند، و محافظ‌های زیستی برای پرسش‌های ساده‌ی پزشکی و زیست‌شناسی ۸۵ درصد کمتر فعال می‌شوند. یک تغییر مهم هم این است که فیبل ۵.۱ حالا اجازه دارد آسیب‌پذیری نرم‌افزاری را پیدا کند، ولی همچنان اجازه ندارد برای آن اکسپلویت بنویسد.

نگهداری داده. سامانه‌ی تازه‌ای به نام Enterprise Frontier Safeguards داده‌های مشتری سازمانی را روی زیرساخت ابری خودِ مشتری نگه می‌دارد، نه روی سرورهای آنتروپیک. نتیجه از نظر حریم خصوصی برابر با «عدم نگهداری داده» است. این سامانه مرحله‌به‌مرحله از پاییز امسال عرضه می‌شود و تا آن زمان، مشتریان واجد شرایط می‌توانند فیبل ۵.۱ را با سیاست عدم نگهداری داده استفاده کنند.

نمره‌ها در برابر رقبا

بنچمارک یعنی مجموعه‌ای از تسک‌های استاندارد که همه‌ی مدل‌ها با آن سنجیده می‌شوند تا مقایسه معنا پیدا کند. جدول زیر نمره‌های اعلام‌شده‌ی آنتروپیک است. عدد بالاتر بهتر است، جز در GDPval که امتیاز است نه درصد.

«خودگردان» یا ایجنتیک یعنی مدل خودش پشت سر هم ابزار اجرا می‌کند، خروجی را می‌بیند و قدم بعدی را انتخاب می‌کند، بدون اینکه هر مرحله را از کاربر بپرسد. در Terminal-Bench-Science خطای معیار هر مدل ۳.۵ تا ۴.۵ واحد درصد است، پس اختلاف‌های کوچک را جدی نگیرید.

بزرگ‌ترین اختلاف در تحقیق علمی خودگردان است: نمره‌ی فیبل ۵.۱ بیش از دو برابر نسخه‌ی قبلی شده. در بقیه‌ی آزمون‌ها فاصله کمتر است و در CursorBench تفاوت با اوپوس ۵ حدود سه واحد درصد است. نکته‌ی مهم برای صرفه‌جویی هم این است که فیبل ۵.۱ در سطح effort پایین یا متوسط، نمره‌ای نزدیک یا بهتر از فیبل ۵ در بالاترین سطح می‌گیرد، با هزینه‌ی به‌مراتب کمتر. effort همان مقدار «فکر کردن» مدل پیش از پاسخ است و پیش‌فرضش در کلود کد روی High و در Claude Cowork و claude.ai روی Medium تنظیم شده.

سریع‌تر کردن مدل‌های زیست‌شناسی
در زیست‌شناسی محاسباتی، مدل‌های یادگیری ماشین روی کارت گرافیک اجرا می‌شوند و سرعتشان عملاً سرعت پیشرفت تحقیق را تعیین می‌کند. میتوس ۵.۱ با نوشتن کرنل اختصاصی GPU و ذخیره‌ی نتایج میانی، هفت مدل متن‌باز را تا ۲.۵ برابر سریع‌تر کرد، بدون اینکه خروجی‌ها تغییر کنند. چون در یک آزمایش معمولی این مدل‌ها هزاران بار اجرا می‌شوند، همین شتاب هزینه‌ی تخمینی GPU را ۳۰ تا ۶۰ درصد پایین آورده. آنتروپیک می‌گوید چنین بهینه‌سازی‌ای معمولاً هفته‌ها کار یک تیم مهندس عملکرد می‌برد و برای آزمایشگاه‌های دانشگاهی اغلب از توان مالی خارج است؛ مدل آن را در چند روز و فقط با کد عمومی انجام داد.

افزایش سرعت استنتاج برای هفت مدل پروتئین و ژنومیک متن‌باز روی یک NVIDIA H100

کاری که Fable 5.1 در علم انجام داد

جالب‌ترین بخش اعلامیه، آزمایش‌های علمی است، نه نمره‌ها.

طراحی پروتئین
آنتروپیک به میتوس ۵.۱ ابزارهای متن‌باز طراحی و تاشدن پروتئین را داد و خروجی‌ها را برای آزمایش واقعی به دو سازمان بیرونی فرستاد. مدل باید «بایندر» طراحی می‌کرد، یعنی پروتئین کوچکی که به یک هدف مشخص در بدن می‌چسبد و پایه‌ی ساخت بسیاری از داروهاست. نرخ موفقیت طراحی‌ها روی ۱۲ هدف به حدود ۵۰ درصد رسید، در حالی که در این حوزه معمولاً ۱۰ تا ۱۵ درصد رقم متعارفی است. روی سه هدف هم قدرت اتصال طراحی‌ها ده برابر بهترین طرح‌های ارسالی به مسابقه‌های Adaptyv Bio بود.

بایندرهای طراحی‌شده توسط کلود (نارنجی) روی ۱۲ هدف (خاکستری). اتصال همه‌ی طرح‌های این ویدیو در آزمایشگاه تأیید شده. ساختارها پیش‌بینی ESMFold2 هستند. منبع: آنتروپیک

نقشه‌ی تازه‌ی سیاره‌ی زهره
فیبل ۵.۱ یک شبکه‌ی عصبی آموزش داد و با آن نقشه‌ی ارتفاعی تازه‌ای برای یک‌سوم سطح زهره ساخت. ورودی کار، تصویرهای راداری مأموریت Magellan ناسا بود که بیش از ۳۰ سال پیش گرفته شده‌اند. نقشه‌ی تازه جزئیات را تا اندازه‌ی دو تا سه کیلومتر نشان می‌دهد، در حالی که نقشه‌ی قبلی تا ۱۰ تا ۲۰ کیلومتر بیشتر نمی‌رفت، و ارتفاع‌ها تا ۲۵ درصد دقیق‌تر شده‌اند. آنتروپیک این نقشه را با مجوز کریتیو کامنز منتشر کرده تا پیش از مأموریت‌های آینده‌ی VERITAS ناسا و EnVision آژانس فضایی اروپا در دسترس باشد.

مقایسه‌ی همان ناحیه در سه حالت. تفاوت تصویر سوم با دومی نشان می‌دهد چه چیزی از داده‌ی ۳۰ ساله بیرون کشیده شده. منبع تصاویر: آنتروپیک

ارزان‌ترین حالت فیبل ۵.۱ از گران‌ترین حالت فیبل ۵ جلوتر است

فیبل ۵.۱ در پایین‌ترین سطح effort، نمره‌ی بالاتری از فیبل ۵ در بالاترین سطحش می‌گیرد، با حدود یک‌چهارم هزینه. effort همان اندازه‌ی «فکر کردن» مدل پیش از پاسخ‌دادن است و پنج پله دارد: low، med، high، xhigh و max. هرچه بالاتر بروید، مدل توکن بیشتری برای استدلال خرج می‌کند و صورت‌حساب بالاتر می‌رود.

منحنی فیبل ۵ بعد از سطح med تخت می‌شود و حتی در xhigh کمی پایین می‌آید؛ از آنجا به بعد پول بیشتر عملاً نمره‌ی بیشتری نمی‌خرد. منحنی فیبل ۵.۱ تا آخرین نقطه بالا می‌رود و از ۲۶ به ۵۲.۶ درصد می‌رسد. پس اگر روی کارهای سخت قبلاً یاد گرفته بودید که بالا بردن effort فایده‌ای ندارد، این عادت را کنار بگذارید؛ روی فیبل ۵.۱ هر پله‌ی اضافه هنوز نمره برمی‌گرداند.

در عمل یعنی دو انتخاب روشن دارید. برای کارهای پرتکرار و حجیم، low یا med بگذارید؛ همان‌جا از سقف نسل قبل جلوترید و هزینه‌تان چند برابر پایین‌تر است. برای مسئله‌های سختی که جواب درست مهم‌تر از صورت‌حساب است، xhigh و max حالا واقعاً ارزش دارند. یک نکته را هم در نظر داشته باشید: پیش‌فرض effort در کلود کد روی High و در Claude Cowork و claude.ai روی Medium است، در حالی که نمره‌ی ۵۲.۶ درصدی که در جدول‌ها می‌بینید در حالت max گرفته شده. پس چیزی که در چت روزمره تجربه می‌کنید، طبیعتاً پایین‌تر از سقف اعلام‌شده‌ی مدل است.

۶۲ آتیش۰ دیدگاه26 بازدید
ارسطو اعتمادی ملکی
۶۹۸ مقاله۳۷ دنبال‌کننده

کارشناس ارشد مهندسی مواد از دانشگاه تبریز. از ۱۳۹۰ در حوزه عکاسی و گرافیک‌ام؛ آنچه دلبستگی بود، حرفه شد. بیت گرف را ساختم، از دستش دادم و دوباره ( این‌بار استوارتر) از نو بنا کردم. مقصد روشن است: مرجعی جامع برای آموزش گرافیک، هوش مصنوعی و کد.

گفتگو و سوالات شما

۰

در این قسمت می‌توانید سوال یا نظر خود در مورد مقاله را مطرح کنید.

برای ثبت دیدگاه ابتدا وارد شوید

ورود به حساب

هنوز دیدگاهی ثبت نشده. اولین نفر باشید!

مقالات مرتبط

اگر این را دوست داشتید، ترتیب خواندن بعدی این است

این مقاله‌ها روی «Claude» و «هوش مصنوعی» هم‌پوشانی دارند، مجموع زمان مطالعه ۱۷ دقیقه

مشاهده همه
  1. Claude و ۱ برچسب دیگر

    پایان مشکل هوش مصنوعی: SubQ با ۱۰۰۰ برابر صرفه‌جویی، Claude و GPT را به چالش می کشد؟

    SubQ به‌عنوان اولین مدل sub-quadratic با توان پردازش ۱۲ میلیون توکن و هزینه بسیار پایین معرفی شده و ادعا می‌کند می‌تواند محدودیت‌های معماری ترنسفورمر را برطرف کند.

    مهدی فریدونی۱۹ اردیبهشت۵ دقیقه
  2. Claude و ۱ برچسب دیگر

    پایان جنگ AI؟! Colossus 1 به خدمت Anthropic درآمد؛ شوک بزرگ ۲۰۲۶

    SpaceXAI با امضای قراردادی تاریخی، دسترسی کامل Anthropic به ابررایانه Colossus 1 را فراهم کرد تا ظرفیت پردازشی Claude و سرویس‌های مرتبط به شکل چشمگیری افزایش یابد. این همکاری غیرمنتظره میان رقبای حوز…

    مهدی فریدونی۱۹ اردیبهشت۴ دقیقه
  3. برچسب مشترک: هوش مصنوعی

    فریپیک به اسم جدید Magnific ریبرند کرد!

    پلتفرم فری پیک با ری‌برندینگ رسمی خود، حالا با نام Magnific فعالیت می‌کند. این تغییر نشان‌دهنده ورود جدی این شرکت به بازار ابزارهای خلاقیت مبتنی بر هوش مصنوعی و تولید محتوای حرفه‌ای است.

    بیت هاب۱۹ اردیبهشت۳ دقیقه
  4. برچسب مشترک: هوش مصنوعی

    حذف محدودیت پیام‌های متنی ChatGPT برای کاربران رایگان؛ GPT-5.6 Luna در راه است

    کاربران رایگان ChatGPT به‌زودی بدون سقف با این سرویس چت می‌کنند. OpenAI محدودیت پیام‌های متنی را حذف و قابلیت Think و مدل GPT-5.6 Luna را برای کاربران Free فعال می‌کند.

    بیت هاب۱۷ مرداد۵ دقیقه
۰

دوره به سبد ثبت‌نام اضافه شد

رفتن به سبد