مسترال امروز پیشنمایش عمومی Mistral Large 4 را عرضه کرد؛ غیررسمی ML4 و با نام رسمی «Le Chonk». به گفته این شرکت، ML4 مرزهای عملکرد مدلهای با وزن باز را جابهجا میکند. API پیشنمایش از همین امروز روی Mistral Studio قابل آزمایش است و وزنهای مدل پایان همین ماه منتشر میشود.
عملکرد در مرز فناوری
ML4 یک مدل بومی چندوجهی با یک تریلیون پارامتر و ۴۹ میلیارد پارامتر فعال است. این بزرگترین و توانمندترین مدل مسترال تا امروز است و به گفته شرکت با پالایش مداوم بهسرعت بهتر میشود. مدل در برنامهنویسی، جریانهای کاری عاملی و درک چندوجهی عملکرد استثنایی نشان میدهد. مسترال میگوید ML4 در حال حاضر با قویترین مدلهای متنباز جهان رقابتپذیر است و در عین حال بهشکل معناداری از هر مدل وزنباز ساختهشده در آمریکا یا اروپا بهتر عمل میکند. در حجمهای کاری حساس سازمانی — از جمله امنیت سایبری، مالی و حقوقی — به گفته مسترال این مدل در میان مدلهای باز پیشرو است و در برخی حوزهها مثل «زمینگیر کردن بصری» حتی از مدلهای بسته پیشرو هم جلو میزند.
وزنهای مدل تا پایان ماه منتشر میشود. تا آن زمان، مسترال مدل را در محیطهای واقعی با رهبران امنیت سایبری، شرکای بررسیشده و نهادهای دولتی تست تهاجمی میکند؛ این گروهها به همان مدل با تعدیل کمتر و قابلیتهای سایبری گستردهتر دسترسی خواهند داشت.
ساختهشده در اروپا؛ برای حاکمیت هوش مصنوعی
ML4 از صفر روی ۳٬۸۰۰ پردازنده گرافیکی NVIDIA Grace Blackwell در مراکز داده خودِ مسترال در اروپا آموزش دیده و پیشنمایش عمومی هم روی همان زیرساخت سرو میشود. مسترال این را نقطه عطفی در سرمایهگذاری بلندمدتش در زیرساخت، پژوهش و توسعه محصول میداند: عملکرد پیشرو در حوزههای کلیدی، همراه با وزنهای باز و طراحیشده برای دادن کنترل هوش مصنوعی به مشتری.
این موضوع در امنیت سایبری اهمیت ویژهای دارد؛ جایی که ردکردن درخواست از سوی ارائهدهنده میتواند پژوهش مشروع در حوزه آسیبپذیری و واکنش به حادثه را مسدود کند و از دست دادن یک قابلیت در میانه یک حادثه، خود به ریسک امنیتی حیاتی بدل شود. ML4 عملکرد سایبری سطح بالا را با وزنهای باز و استقرار روی زیرساخت خود مشتری ترکیب میکند تا سازمانها هم قابلیت داشته باشند و هم اختیار اجرای کارهای امنیتی پیشرفته تحت سیاستهای خودشان.
مدل در چند منطقه جهان در دسترس خواهد بود، از جمله استقراری در اروپا که مسترال آن را کاملاً و مستقل از دیگر ارائهدهندگان خدمات دیجیتال و تحت قوانین اروپا اداره میکند. نکته جالب اینکه بخش قابل توجهی از دادههای آموزشی ML4 چندزبانه بود و بیش از ۱۶۰ زبان — از جمله همه زبانهای رسمی اتحادیه اروپا — را پوشش میداد.
مسترال میگوید برای آموزش ML4 با شرکتهای پیشرو جهان در مالی، مهندسی، تولید، لجستیک، داروسازی، علم، حملونقل دریایی و بخش عمومی همکاری نزدیک داشته و مدل از همان محیط آموزش، سفارشیسازی و یادگیری تقویتیای استفاده میکند که این شرکت از طریق Mistral Forge به مشتریان ارائه میدهد. به گفته مسترال، در مسیر انتشار وزنها جزئیات بیشتر درباره معماری مدل، بنچمارکهای تکمیلی و روش پسآموزش منتشر خواهد شد و این مدل پایه نسل تازهای از مدلهای تخصصی و بهینهشده مسترال نیز خواهد بود.
امنیت سایبری
ML4 به گفته سازنده یکی از قویترین مدلهای هوش مصنوعی جهان در امنیت سایبری است. در شاخص سایبری Artificial Analysis — ارزیابی مستقلی از توانایی مدلها در یافتن و رفع نقصهای امنیتی نرمافزار واقعی — این مدل در میان پنج مدل برتر جهان قرار میگیرد و در میان مدلهای وزنباز ساختهشده بیرون چین با فاصله زیادی پیشتاز است. در یکی از آزمونهای این شاخص که از مدل میخواهد آسیبپذیری واقعی در نرمافزار متنباز را بازتولید و سپس وصلهگذاری کند، ML4 امتیاز ۸۲ درصد میگیرد؛ بالاترین میان همه مدلها. همچنین ۹۳ درصد چالشهای Cybench — مجموعهای از ۴۰ تمرین برگرفته از مسابقات امنیتی — را حل میکند که یکی از بالاترین امتیازهای ثبتشده برای یک مدل وزنباز است.
مسترال میگوید این امتیاز برتر مزیت عملی دارد: چند مدل بسته پیشرو، از جمله Claude Opus 5.5 و GPT-6 Astra، در همان آزمون نزدیک به صفر امتیاز میگیرند چون از انجام کار امتناع میکنند. در حالی که دفاع از نرمافزار اغلب با اثبات واقعی بودن یک نقص آغاز میشود؛ دقیقاً همان کاری که فیلترهای ایمنی مدلهای بسته میتوانند مسدود کنند. این مسئله وقتی مهمتر میشود که مهاجمان بهطور فزاینده همان مدلها را جِیلبریک میکنند تا فعالیت سایبری تهاجمی را پشتیبانی کنند؛ مدافعان به سیستمهایی نیاز دارند که بتوانند با آن تواناییها همراه شوند و در همان امتناعها گیر نکنند. به گفته مسترال ML4 میتواند این کار را انجام دهد و قابلیتهایش از آنچه صریحاً برای آن آموزش دیده فراتر میرود: در آزمونهای داخلی برای تحلیل بدافزار، اولویتبندی آسیبپذیریها و نوشتن قواعد تشخیص مفید بوده است. برای سازمانهایی که به هوش مصنوعی مستقل و قابل حسابرسی برای عملیات امنیتی نیاز دارند، ML4 روی ابر خصوصی یا در محل قابل اجرا خواهد بود.
کدنویسی عاملی
ML4 در مهندسی نرمافزار، درک مخزن کد و جریانهای کاری پیچیده ترمینال برجسته است؛ با امتیاز ۶۱٫۷ درصد در DeepSWE v1.1، امتیاز ۵۹٫۴ درصد در SWE-Atlas-QnA و ۲۸٫۳ درصد در Terminal-Bench 4. امتیاز ترکیبی شاخص عامل کدنویسی آن ۴۹٫۸ درصد است که آن را جلوتر از DeepSeek V4 Pro 0813 و Qwen3.8 Max قرار میدهد. مسترال همچنین ارزیابی انسانی کور با Surge AI روی کیفیت کدنویسی اجرا کرد: ارزیابان حرفهای خروجی مدلها را با هویت پنهان در مقیاس ۱ تا ۵ نمره دادند. پیشنمایش ML4 در میان پنج مدل دوم شد (۳٫۷۴)؛ جلوتر از Kimi K3 (۳٫۵۹)، GLM-5.3 (۳٫۶۰) و GLM-5.2 (۳٫۴۰) و تنها پایینتر از Claude Opus 5 (۴٫۲۲).
جریانهای کاری عاملی و کار دانشی
ML4 عاملهای همهکارهای را اجرا میکند که اطلاعات جمع میکنند، از ابزارها استفاده میکنند و در جریانهای کاری پیچیده خروجی نهایی تولید میکنند. در AutomationBench — ۶۵۷ جریان کاری کسبوکار در اپهایی مثل Gmail، Google Sheets، Slack و Salesforce — امتیاز ۵۹٫۹ درصد میگیرد؛ جلوتر از Kimi K3، MiMo-V2.6-Pro و DeepSeek V4 Pro. در ارائههای حرفهای کار دانشی مثل صفحهگسترده، اسلاید و پیدیاف هم به همان اندازه قوی است: در AA-Briefcase که کار دانشی افقبلند را میسنجد به ۱٬۳۹۳ الو رسیده و از DeepSeek V4 Pro جلوتر است.
مدل همچنین از طریق ارزیابان ثالث (vals.ai) روی وظایف نمونه حقوقی و مالی سنجیده شده و به گفته مسترال در هر دو مورد از GPT-6-Astra پیشی میگیرد. در بنچمارک عامل حقوقی HarveyAI، ML4 از همه مدلهای متنباز بهتر عمل میکند و در Finch (FinWorkBench) که توانایی ساخت و ویرایش صفحهگسترده در موارد واقعی مالی و حسابداری را میسنجد نیز عملکرد برجسته دارد. مسترال میگوید تحلیل مالی به دقت و توانایی ترکیب اطلاعات از منابع متعدد نیاز دارد؛ فرآیندی که در بسیاری از مؤسسات مالی هنوز زمانبر است. در دموی ارائهشده، ML4 در برابر دیگر مدلهای برتر متنباز همان چالش چندمرحلهای مالی سازمانی را برمیدارد و با جستوجو در پروندههای شرکتهای بورسی و گزارشهای مالی — مثل آنچه در EDGAR و پایگاههای اروپایی معادل آن موجود است — پیش میرود.
چندوجهی، علم و ریاضی
ML4 جهشی در توانایی مدلهای مسترال برای درک تصویر است. این مدل روی اسناد پیچیده، نمودارها و تصاویر طبیعی استدلال قدرتمندی دارد و بینایی رایانشی را به صنایعی میآورد که ادراک در آنها حیاتی است؛ مثل مهندسی، تولید و رصد زمین. مدل میتواند زمینگیر کردن بصری را با قابلیتهای عاملی ترکیب کند: از بررسی تصاویر ماهوارهای گیگاپیکسلی — برای کمک به تیمهای واکنش به بحران وقتی زمان حیاتی است — تا تحلیل نقشههای مهندسی با بزرگنمایی، بازرسی و تأیید تا رسیدن به پاسخ دقیق. به گفته مسترال در زمینگیر کردن بصری، ML4 یکی از توانمندترین مدلهای آزمونشده است و مثلاً در Dense 200 از GPT-6-Astra جلو میزند (۴۲ در برابر ۴۱ درصد).
ML4 قابلیتهای علمی قوی دارد که از ترکیب روشهای مبتنی بر هوش مصنوعی با تخصص پژوهشگران مسترال در ریاضی، فیزیک و شیمی ساخته شده است. این مدل در کدنویسی عاملی برای کارهای علمی مثل تحلیل داده، مدلسازی و شبیهسازی واقعیت فیزیکی بسیار تواناست؛ یعنی پژوهشگران میتوانند روی پرسشها تمرکز کنند نه لولهکشی فنی. در بنچمارکها، ML4 در SciCode-Verified میان مدلهای وزنباز پیشرو است و در عمل میتواند یک شبیهسازی کامل هارتری-فوک را در یک مرحله تولید کند؛ کاری پیچیده و چندمرحلهای در شیمی که از زنجیرهای از روالهای پیشرفته ساخته میشود. ریاضیات ML4 هم در استدلال رسمی و هم ریاضیات کاربردی قویتر شده و به گفته مسترال در ارزیابیهای انسانی با ساختار و دقت بیشتری از GLM-5.3 استدلال میکند.
ایمنی مدل
به گفته مسترال، ML4 بنچمارکهای داخلی مقاومت در برابر تزریق پرامپت غیرمستقیم را اشباع کرده و در مرز مدلهای متنباز قرار دارد. در بنچمارک عمومی B3 شرکت Lakera، این مدل در برابر ۹۳٫۳ درصد حملات مقاومت میکند و مسترال امتیاز بالاتری میان رقبا ندیده است. ML4 همچنین مسئولانهتر از همه مدلهای پیشین مسترال با کاربران تعامل میکند؛ در بنچمارک KORA، این مدل با امتیاز ۱٫۶۹۱ (از حداکثر ۲ که «نمونهای» نامیده میشود) در بالاترین سطح اندازهگیریشده مسترال میان مدلهای باز قرار میگیرد. نکته مهم دیگر، تمایل مدل به رد درخواستهای مخرب مرتبط با امنیت سایبری است: با وجود عملکرد قوی در بنچمارکهای سایبری، میانگین نرخ امتناع آن در پرامپتهای سایبری از مجموعههای JailbreakBench، StrongREJECT و AgentHarm از همه مدلهای متنباز بالاتر است.