هووورا

اکران رسمی نسخه جدید بیت گرف

۲ روز و ۰۸:۴۰
اخبار

FLUX3 رونمایی شد: ویدیوی ۲۰ ثانیه‌ای با صدای همزمان

FLUX 3 مدل چندوجهی است که ویدیو، صدا و تصویر را با یک معماری می‌سازد. هدفش چیست و نسخه اوپن‌سورس FLUX 3 Dev کی می‌آید؟

ارسطو اعتمادی
۱۵ مرداد ۱۴۰۵ · 11 دقیقه مطالعه
 FLUX3 رونمایی شد: ویدیوی ۲۰ ثانیه‌ای با صدای همزمان

FLUX 3 چیست، چه هدفی دارد و نسخه اوپن‌سورسش کی می‌آید؟

بلک‌فارست لبز (BFL) روز ۲۳ جولای 2026 از FLUX 3 رونمایی کرد. این مدل برخلاف نسل‌های قبلی خانواده فلاکس، فقط مدل تصویر نیست و یک مدل پایه چندوجهی (multimodal) است که تصویر، ویدیو، صدا و پیش‌بینی حرکت را با یک معماری واحد تولید می‌کند. فعلاً هم در دسترس عموم نیست و از طریق یک برنامه دسترسی زودهنگام (Early Access) با تأیید شرکت ارائه می‌شود.

FLUX 3 دقیقاً چه فرقی با نسل قبل دارد

بیشتر سرویس‌هایی که امروز هم ویدیو می‌سازند و هم تصویر، در واقع چند مدل جداگانه‌اند که پشت یک رابط کاربری مشترک کنار هم چیده شده‌اند. ادعای بلک‌فارست لبز درباره FLUX 3 این است که چنین چیزی نیست و مدل به‌صورت همزمان روی تصویر، ویدیو و صدا آموزش دیده است.

استدلال شرکت هم قابل فهم است. هر کدام از این سه، تصویری ناقص از یک واقعیت واحد می‌دهند. عکس، ساختار مکانی صحنه را در یک لحظه ثبت می‌کند. ویدیو بعد زمان را برمی‌گرداند و نشان می‌دهد اشیا چطور حرکت می‌کنند. صدا رابطه علت و معلولی بین برخورد فیزیکی و آنچه شنیده می‌شود را آشکار می‌کند، چیزی که از روی تصویر تنها قابل تشخیص نیست. وقتی مدل هر سه را با هم یاد بگیرد، این‌ها همدیگر را محدود می‌کنند، یعنی صدا باید با ضربه بخواند و حرکت باید با جرم جسم جور دربیاید. نتیجه عملی‌اش برای کاربر این است که ویدیو و صدا در یک مرحله و هماهنگ با هم ساخته می‌شوند، نه اینکه صدا بعداً روی تصویر سوار شود.

پایه فنی این کار روشی است که خود شرکت اسمش را Self-Flow گذاشته و پیش‌تر درباره‌اش مقاله منتشر کرده بود. بلک‌فارست لبز می‌گوید همان روش را با حجم بسیار بیشتری از داده و محاسبات مقیاس داده و FLUX 3 را با آن آموزش داده است.

هدفش فقط ساخت ویدیو نیست

شرکت هدف بلندمدت خود را هوش بصری (visual intelligence) توصیف می‌کند، یعنی مدل‌هایی که در محیط فیزیکی و دیجیتال ادراک می‌کنند، آینده را پیش‌بینی می‌کنند و عمل انجام می‌دهند. FLUX 3 را هم نه محصول نهایی، بلکه یک ایستگاه میانی در همین مسیر معرفی می‌کند.

بخش سوم مدل، یعنی پیش‌بینی حرکت (action prediction)، همین‌جا معنا پیدا می‌کند. مدلی که یاد گرفته باشد اجسام در ویدیو چطور حرکت می‌کنند، عملاً چیزی درباره فیزیک جهان می‌داند و می‌شود از همان دانش برای فرمان‌دادن به یک ربات استفاده کرد. بلک‌فارست لبز این کار را با شرکت رباتیک mimic انجام داده و مدلی به نام FLUX-mimic ساخته است. به گفته شرکت، این مدل هم‌اکنون در خطوط تولید آئودی روی کارهایی مثل جابه‌جایی اجسام نرم و شکل‌پذیر آزمایش می‌شود؛ کاری که رباتیک متعارف به‌سختی و با هزینه بالا از پسش برمی‌آید.

هدف نسل بعدی را هم صریح اعلام کرده‌اند و آن یکی‌کردن ادراک، عمل و زبان در یک مدل واحد است.

چه کارهایی از FLUX 3 برمی‌آید

بخش ویدیو، که تنها بخش در دسترس فعلی است، می‌تواند در یک بار تولید تا ۲۰ ثانیه ویدیوی همراه با صدا بسازد. این عدد از سقف حدوداً ۱۰ ثانیه‌ای بیشتر مدل‌های رقیب بالاتر است. ورودی‌اش می‌تواند متن، تصویر یا ویدیو باشد و این قابلیت‌ها را پوشش می‌دهد:

  • ساخت ویدیو از متن، و ساخت ویدیو از یک تصویر شروع یا تصویرهای مرجع
  • ادامه‌دادن یک ویدیو و صدای موجود
  • ساخت ویدیو بین دو کی‌فریم مشخص برای کنترل نقطه شروع و پایان حرکت
  • دیالوگ چندزبانه با صدای تولیدشده توسط خود مدل
  • زنجیره‌کردن چند کلیپ پشت سر هم برای ساخت سکانس‌های چندنمایی و چنددقیقه‌ای

بخش تصویر هنوز منتشر نشده و شرکت گفته چند هفته بعد وارد دسترسی زودهنگام می‌شود. ادعای اصلی درباره‌اش، بهبود محسوس در اجرای پرامپت‌های پیچیده و نوشتن متن دقیق و چندزبانه داخل تصویر است.

یک محدودیت را هم باید بدانید. رزولوشن در شروع دسترسی زودهنگام روی 720p بسته شده و 1080p قرار است بعداً بیاید. قیمت هیچ‌کدام از سطوح هم هنوز اعلام نشده است.

اعدادی که منتشر شده را با احتیاط بخوانید

بلک‌فارست لبز نتایج یک ارزیابی ترجیحی را منتشر کرده است. در این نوع ارزیابی، خروجی دو مدل کنار هم گذاشته می‌شود و از داور انسانی می‌پرسند کدام را ترجیح می‌دهد، پس عدد نهایی درصد دفعاتی است که خروجی این مدل انتخاب شده، نه نمره کیفیت مطلق.

بر اساس این ارزیابی، FLUX 3 در ۹۳ درصد مقایسه‌ها بر Luma Ray 3.2 و در ۷۷ درصد بر Runway Gen-4.5 ترجیح داده شده است. فاصله‌اش با بقیه کمتر است و در برابر Kling v3 Pro به ۶۰ درصد و در برابر Seedance 2.0 و Gemini Omni Flash به ۵۲ درصد می‌رسد، که عملاً یعنی تفاوت معناداری وجود ندارد.

دو نکته را در نظر بگیرید. اول اینکه این آزمون را خود سازنده اجرا کرده و روی کلیپ‌های ۱۰ ثانیه‌ای 720p انجام شده، پس نتیجه‌اش برای ویدیوی ۲۰ ثانیه‌ای لزوماً همان نیست. دوم اینکه خود شرکت هم نوشته این نتایج مقدماتی است و مربوط به نسخه‌ای در حال توسعه. ارزیابی مستقل هنوز منتشر نشده است.

آیا FLUX 3 اوپن‌سورس می‌شود؟

پاسخ کوتاه این است که نسخه‌ای با وزن‌های باز قطعاً در برنامه هست، اما هنوز منتشر نشده و «وزن باز» با «اوپن‌سورس» یکی نیست.

بلک‌فارست لبز در برنامه انتشار خود چهار مورد را فهرست کرده است و مورد چهارم صراحتاً «دسترسی open-weight به بک‌بون چندوجهی» با نام FLUX 3 Dev است. بک‌بون یعنی همان مدل پایه‌ای که هر چهار قابلیت روی آن سوارند. سه مورد دیگر عبارت‌اند از ویدیو و صدا، پیش‌بینی حرکت، و تصویر که همگی از راه API یا وزن‌های خصوصی ارائه می‌شوند.

مسئله اینجاست که درباره نسخه اوپن‌سورس FLUX 3 Dev هیچ جزئیاتی اعلام نشده است. تاریخ انتشار مشخصی وجود ندارد و تنها زمان‌بندی اعلام‌شده «اواخر امسال میلادی» است. لایسنس، تعداد پارامترها، نیازمندی سخت‌افزاری و مخزن هاگینگ‌فیس هم هنوز اعلام نشده‌اند.

تفاوت وزن باز و اوپن‌سورس هم اینجا اهمیت دارد. وزن باز یعنی فایل مدل را دانلود می‌کنید و روی سخت‌افزار خودتان اجرا می‌کنید، اما شرایط استفاده را لایسنس تعیین می‌کند. سابقه خود شرکت دو الگوی متفاوت دارد. FLUX.1 [schnell] با لایسنس Apache 2.0 منتشر شد که واقعاً اوپن‌سورس محسوب می‌شود و استفاده تجاری‌اش آزاد است، اما نسخه‌های [dev] با لایسنس غیرتجاری آمدند که استفاده تجاری مستقیم را نمی‌دهد. بلک‌فارست لبز نگفته FLUX 3 Dev کدام مسیر را می‌رود.

یک نکته دیگر هم هست که ارزش توجه دارد. در خانواده FLUX.1، انتشار وزن‌ها تقریباً همزمان با معرفی مدل بود و همان چیزی بود که اکوسیستم فاین‌تیون و LoRA و ComfyUI را دور فلاکس ساخت. این بار ترتیب برعکس شده و دسترسی API و شرکای منتخب اول آمده‌اند و وزن باز آخر می‌آید. برای کسی که می‌خواهد مدل را محلی اجرا کند، این یعنی انتظار طولانی‌تر.

اگر می‌خواهید همین حالا امتحانش کنید

  1. از صفحه مدل در سایت بلک‌فارست لبز درخواست دسترسی بدهید. [صفحه FLUX 3] فرم درخواست دارد و پذیرش با تأیید شرکت است، نه فوری. شرکت زمان انتظار مشخصی اعلام نکرده است.

۲. یا سراغ پلتفرم‌های شریک بروید. بخشی از سرویس‌های شریک مثل Krea از ابتدای اوت 2026 نسخه ویدیویی FLUX 3 را در دسترس کاربران خود گذاشته‌اند، که مسیر سریع‌تری از انتظار برای دسترسی مستقیم است.

۳. انتظار اجرای محلی نداشته باشید.تا زمانی که FLUX 3 Dev منتشر نشود، هیچ نسخه‌ای برای اجرا روی سیستم خودتان وجود ندارد و پشتیبانی رسمی ComfyUI هم در دسترس نیست.

اگر دارید برای یک محصول یا گردش کار تولیدی برنامه‌ریزی می‌کنید، مهم‌ترین چیزی که باید از این خبر بردارید همین است: قابلیت‌های اعلام‌شده واقعی‌اند و بخشی از آن‌ها همین حالا در کارخانه آئودی در حال آزمایش است، اما آنچه امروز عملاً به دست شما می‌رسد یک دسترسی محدود و بدون قیمت اعلام‌شده است. برنامه‌تان را روی فرض انتشار زودهنگام وزن‌های باز نبندید.

۰ آتیش۰ دیدگاه17 بازدید
ارسطو اعتمادی
۶۹۳ مقاله۱۲ دنبال‌کننده

کارشناس ارشد مهندسی مواد از دانشگاه تبریز. از ۱۳۹۰ در حوزه عکاسی و گرافیک‌ام؛ آنچه دلبستگی بود، حرفه شد. بیت گرف را ساختم، از دستش دادم و دوباره ( این‌بار استوارتر) از نو بنا کردم. مقصد روشن است: مرجعی جامع برای آموزش گرافیک، هوش مصنوعی و کد.

گفتگو و سوالات شما

۰

در این قسمت می‌توانید سوال یا نظر خود در مورد مقاله را مطرح کنید.

برای ثبت دیدگاه ابتدا وارد شوید

ورود به حساب

هنوز دیدگاهی ثبت نشده. اولین نفر باشید!

مقالات مرتبط

اگر این را دوست داشتید، ترتیب خواندن بعدی این است

این مقاله‌ها روی «Flux» و «ابزارهای هوش مصنوعی» هم‌پوشانی دارند، مجموع زمان مطالعه ۲۶ دقیقه

مشاهده همه
  1. ابزارهای هوش مصنوعی و ۱ برچسب دیگر

    پایان مشکل هوش مصنوعی: SubQ با ۱۰۰۰ برابر صرفه‌جویی، Claude و GPT را به چالش می کشد؟

    SubQ به‌عنوان اولین مدل sub-quadratic با توان پردازش ۱۲ میلیون توکن و هزینه بسیار پایین معرفی شده و ادعا می‌کند می‌تواند محدودیت‌های معماری ترنسفورمر را برطرف کند.

    مهدی فریدونی۱۹ اردیبهشت۵ دقیقه
  2. ابزارهای هوش مصنوعی و ۱ برچسب دیگر

    پایان جنگ AI؟! Colossus 1 به خدمت Anthropic درآمد؛ شوک بزرگ ۲۰۲۶

    SpaceXAI با امضای قراردادی تاریخی، دسترسی کامل Anthropic به ابررایانه Colossus 1 را فراهم کرد تا ظرفیت پردازشی Claude و سرویس‌های مرتبط به شکل چشمگیری افزایش یابد. این همکاری غیرمنتظره میان رقبای حوز…

    مهدی فریدونی۱۹ اردیبهشت۴ دقیقه
  3. ابزارهای هوش مصنوعی و ۱ برچسب دیگر

    حذف محدودیت پیام‌های متنی ChatGPT برای کاربران رایگان؛ GPT-5.6 Luna در راه است

    کاربران رایگان ChatGPT به‌زودی بدون سقف با این سرویس چت می‌کنند. OpenAI محدودیت پیام‌های متنی را حذف و قابلیت Think و مدل GPT-5.6 Luna را برای کاربران Free فعال می‌کند.

    بیت هاب۱۷ مرداد۵ دقیقه
  4. Flux و ۲ برچسب دیگر

    هوش مصنوعی فلاکس (FLUX) + آموزش نصب و استفاده به زبان ساده

    در این مقاله هوش مصنوعی فلاکس (FLUX) را معرفی می کنیم و با نحوه نصب و استفاده از این هوش مصنوعی قدرتمند آشنا می شویم. همچنین سخت افزار لازم برای کار با آن را هم مورد بررسی قرار می دهیم.

    ارسطو اعتمادی۲۲ مرداد۱۲ دقیقه
۰

دوره به سبد ثبت‌نام اضافه شد

رفتن به سبد