انویدیا با سیستم Vera Rubin NVL72 در آزمون MLPerf Inference v6.1 رکورد زد؛ تا ۳.۷ برابر نسل قبل
هوش مصنوعی جهان ترجمه‌شده مدل‌ها و چیپ‌هاپژوهش

انویدیا با سیستم Vera Rubin NVL72 در آزمون MLPerf Inference v6.1 رکورد زد؛ تا ۳.۷ برابر نسل قبل

۲۶ شهریور ۱۴۰۵ ⏱ ۴ دقیقه مطالعه 👁 ۰ بازدید ✍️ تحریریه رشدینو
✈️ اشتراک در تلگرام 💬 واتساپ 𝕏 توییتر
خلاصه خبر پاسخ سریع در یک نگاه

انویدیا نتایج MLPerf Inference v6.1 را منتشر کرد: Vera Rubin NVL72 در نخستین حضور تا ۳.۷ برابر GB300 NVL72 توان تولید توکن دارد، مقیاس‌پذیری ۹۹ درصدی ثبت شده و بهینه‌سازی نرم‌افزاری تا ۱.۶ برابر بهبود داده است.

کارایی سیستم، مقیاس‌پذیری کارآمد زیرساخت و بهینه‌سازی پیوسته نرم‌افزار، سه اهرم کلیدی تعیین‌کننده اقتصاد استنتاج (inference) هوش مصنوعی هستند. کارایی بالاتر سیستم یعنی تولید توکن بیشتر و درآمد بیشتر. مقیاس‌پذیری کارآمد یعنی با افزودن سخت‌افزار، توان عملیاتی به‌تناسب رشد می‌کند و برای خدمت به کاربران در مقیاس بزرگ منابع کمتری لازم است. بهینه‌سازی پیوسته یعنی استخراج ارزش بیشتر از سرمایه‌گذاری در زیرساخت.

زیربنای هر سه این‌ها «تعویض‌پذیری پلتفرم» است: همان زیرساخت هر مدلی و هر بار کاری را اجرا می‌کند، از آموزش تا استنتاج، از سیستم توصیه‌گر تا استدلال، از زبان تا ویدئو؛ و همین نرخ استفاده را بالا نگه می‌دارد. پلتفرم انویدیا بر اساس این نتایج MLPerf Inference v6.1 که امروز منتشر شد، برای بهینه‌سازی در همه این ابعاد ساخته شده است.

سه نکته اصلی این نتایج: اول، سیستم NVIDIA Vera Rubin NVL72 با کارایی پیشرو debut کرد؛ در نخستین ارسال پیش‌نمایشی خود به MLPerf Inference، تا ۳.۷ برابر توان عملیاتی بهتر از GB300 NVL72 ارائه می‌دهد. دوم، انویدیا GB300 NVL72 با کارایی پیشرو مقیاس می‌شود؛ ارسالی با ۲۸۸ GPU روی چهار رک GB300 NVL72 به کارایی مقیاس‌پذیری ۹۹ درصد رسید و توان عملیاتی تقریباً خطی از یک رک پایه رشد کرد. سوم، بهینه‌سازی‌های پیوسته نرم‌افزاری، جهش عملکرد را هدایت می‌کنند؛ بهینه‌سازی‌های نرم‌افزاری در ارسال‌های v6.1 انویدیا تا ۱.۶ برابر عملکرد بهتر از v6.0 رقم زدند و این بهینه‌سازی‌ها پس از ثبت نتایج هم ادامه یافته و بهبود بیشتری ایجاد کرده است.

برای سازمان‌هایی که درباره زیرساخت هوش مصنوعی تصمیم می‌گیرند، عملکرد، کارایی مقیاس‌پذیری و سرعت نرم‌افزار، فاکتورهای مهمی هستند که اقتصاد بلندمدت استنتاج را تعیین می‌کنند.

انویدیا نتایج پیش‌نمایش Vera Rubin NVL72 را روی دو مورد از سخت‌ترین بنچمارک‌های مجموعه MLPerf Inference v6.1 ثبت کرده است: DeepSeek-R1 و Qwen3-VL. Vera Rubin NVL72 در Qwen3-VL و در سناریوهای آفلاین، سروری و تعاملی، با استفاده از vLLM همراه با چارچوب استنتاج متن‌باز NVIDIA Dynamo، تا ۳.۷ برابر توان عملیاتی بیشتر از GB300 NVL72 دارد. در DeepSeek-R1 و با کتابخانه NVIDIA TensorRT-LLM، توان عملیاتی تا ۲.۵ برابر بیشتر از GB300 NVL72 است. این نتایج اولیه، سرعت نوآوری انویدیا و مسیر بهبود عملکرد با بهینه‌سازی نرم‌افزاری مستمر را نشان می‌دهد.

این عملکرد یعنی هر رک Vera Rubin NVL72 به‌طور معناداری توکن بیشتر تولید می‌کند، به کاربران بیشتری سرویس می‌دهد و درآمد بیشتری نسبت به یک رک GB300 NVL72 می‌سازد، در حالی که هزینه هر توکن را پایین می‌آورد.

نتایج، حاصل هم‌طراحی کامل سخت‌افزار و نرم‌افزار است. هسته‌های Tensor و موتور Transformer تقویت‌شده در Vera Rubin، هر دو مرحله پیش‌پرکردن (prefill) و رمزگشایی (decode) استنتاج را تسریع می‌کنند، در حالی که دقت NVFP4 ردپای حافظه را در وزن‌های مدل، توجه و کش KV کاهش می‌دهد و توان عملیاتی را با کمترین افت کیفیت خروجی بالا می‌برد.

ارسال‌های Vera Rubin به‌شدت از «سرویس‌دهی تفکیک‌شده» استفاده کرده‌اند؛ یعنی جدا کردن پیش‌پرکردن از رمزگشایی همراه با موازی‌سازی خبرگان در مقیاس بزرگ برای رسیدن به حداکثر کارایی در لایه‌های mixture-of-experts که مدل‌هایی مثل DeepSeek-R1 و Qwen3-VL را می‌سازند. دامنه مقیاس‌دهی NVL72 که با نسل ششم NVLink و NVLink Switch نرخ بسته ۱۰ برابر بالاتر و تأخیر ۳ برابر کمتر از اترنت معمول ارائه می‌دهد، زیربنای اتصالی است که این تکنیک‌ها را در مقیاس رک کارآمد می‌کند.

این هم‌طراحی به اکوسیستم شرکای انویدیا هم گسترش می‌یابد: Nebius نیز نتایج پیش‌نمایش Vera Rubin NVL72 را ثبت کرد و عملکرد چشمگیری نشان داد.

ایجنت‌های هوش مصنوعی که استدلال، برنامه‌ریزی و عمل‌کردن چندمرحله‌ای دارند، در حال تغییر شیوه سنجش عملکرد استنتاج هستند. در بنچمارک‌هایی که برای ثبت این تغییر طراحی شده‌اند، مثل SemiAnalysis AgentX، سیستم Vera Rubin NVL72 در تست پیش‌نمایش ۳۰ برابر عملکرد بهتر از GB300 NVL72 داشته است. علاوه بر این، بنچمارک پیش‌روی MLPerf Endpoints اندازه‌گیری استاندارد را به بارهای کاری استنتاج ایجنتی می‌آورد؛ چیزی فراتر از آنچه بنچمارک‌های توان عملیاتی سنتی ثبت می‌کنند.

کارایی مقیاس‌پذیری — یعنی اینکه افزودن GPU چقدر مؤثر به رشد توان عملیاتی ترجمه می‌شود — معیار کلیدی بهره‌وری زیرساخت هوش مصنوعی است. انویدیا این را با اتصالات مقیاس‌دهی پهن‌باند و کم‌تأخیر درون هر رک، شبکه پرسرعت میان رک‌ها و هماهنگ‌سازی کارآمد درخواست‌ها میان نودها محقق می‌کند. ارسال DeepSeek-R1 انویدیا از یک رک GB300 NVL72 (۷۲ GPU) به چهار رک (۲۸۸ GPU) مقیاس شد و در سناریوی آفلاین به ۹۹ درصد کارایی مقیاس‌پذیری رسید؛ توان عملیاتی تقریباً متناسب با سخت‌افزار اضافه‌شده رشد کرد.

اهمیت این معیار در این است که GPU بیشتر به‌طور خودکار به توان عملیاتی متناسب ترجمه نمی‌شود. اگر دو برابر کردن تعداد GPU فقط بهبود تک‌رقمی در توان عملیاتی بدهد، هزینه زیرساخت بسیار جلوتر از بازده عملکرد می‌دود. معماری، اتصالات و نرم‌افزار باید با هم مقیاس شوند. GB300 NVL72 همچنین کارایی در مقیاس رک را در بنچمارک تبدیل متن به ویدئو WAN 2.2 نشان داد و به ۰.۶۵ ویدئوی ۷۲۰p در هر ثانیه با ۵.۷ ثانیه برای هر ویدئو رسید؛ یعنی ۹ برابر توان عملیاتی بالاتر و ۷.۵ برابر تأخیر کمتر از یک نود واحد.

در بخش نرم‌افزار، عملکرد GB300 NVL72 روی Qwen3-VL در v6.1 تا ۱.۶ برابر نتایج v6.0 بهبود یافت. این جهش از طریق دقت پایین‌تر کش KV، ترکیب بیشتر کرنل‌ها، کرنل‌های بهتر و سرویس‌دهی تفکیک‌شده با vLLM و NVIDIA Dynamo به دست آمد. بهینه‌سازی نرم‌افزاری پس از مهلت ارسال v6.1 هم ادامه یافت؛ نتایج پس از مهلت — که هنوز توسط MLCommons تأیید نشده‌اند — روی GPT-OSS-120B و DLRMv3 بهبود بیشتری نشان می‌دهند.

فراتر از نتایج پلتفرم Grace Blackwell و Vera Rubin NVL72، انویدیا نتایج Jetson AGX Thor را با TensorRT Edge-LLM روی بنچمارک تازه معرفی‌شده Edge-Agentic و با Qwen3.6-27B ثبت کرد. اکوسیستم شرکای انویدیا هم به‌طور گسترده شرکت کرد؛ ۱۹ شریک — که هشت موردشان روی سیستم‌های چندنودی Blackwell NVL72 بودند — عملکرد چشمگیری نشان دادند. این فهرست شامل ایسوس، آژور، سیسکو، CoreWeave، Crusoe، دل، فوجیتسو، Giga Computing، اچ‌پی‌ای، Inventec، Lambda، MiTAC، Nebius، Oracle Cloud Infrastructure، Quanta، Red Hat، ScitiX، سوپرمایکرو و Wiwynn است. از دستگاه‌های کوچک لبه تا بزرگ‌ترین کارخانه‌های هوش مصنوعی، انویدیا با آهنگ سالانه معماری‌های پلتفرم، نرم‌افزاری که پیوسته بهتر می‌شود و اکوسیستمی که آن را در مقیاس عرضه می‌کند، عملکرد را در کل پشته فناوری پیش می‌برد.

# مدل‌ها و چیپ‌ها# پژوهش
🔗 اخبار مرتبط

بخوانید