کارایی سیستم، مقیاسپذیری کارآمد زیرساخت و بهینهسازی پیوسته نرمافزار، سه اهرم کلیدی تعیینکننده اقتصاد استنتاج (inference) هوش مصنوعی هستند. کارایی بالاتر سیستم یعنی تولید توکن بیشتر و درآمد بیشتر. مقیاسپذیری کارآمد یعنی با افزودن سختافزار، توان عملیاتی بهتناسب رشد میکند و برای خدمت به کاربران در مقیاس بزرگ منابع کمتری لازم است. بهینهسازی پیوسته یعنی استخراج ارزش بیشتر از سرمایهگذاری در زیرساخت.
زیربنای هر سه اینها «تعویضپذیری پلتفرم» است: همان زیرساخت هر مدلی و هر بار کاری را اجرا میکند، از آموزش تا استنتاج، از سیستم توصیهگر تا استدلال، از زبان تا ویدئو؛ و همین نرخ استفاده را بالا نگه میدارد. پلتفرم انویدیا بر اساس این نتایج MLPerf Inference v6.1 که امروز منتشر شد، برای بهینهسازی در همه این ابعاد ساخته شده است.
سه نکته اصلی این نتایج: اول، سیستم NVIDIA Vera Rubin NVL72 با کارایی پیشرو debut کرد؛ در نخستین ارسال پیشنمایشی خود به MLPerf Inference، تا ۳.۷ برابر توان عملیاتی بهتر از GB300 NVL72 ارائه میدهد. دوم، انویدیا GB300 NVL72 با کارایی پیشرو مقیاس میشود؛ ارسالی با ۲۸۸ GPU روی چهار رک GB300 NVL72 به کارایی مقیاسپذیری ۹۹ درصد رسید و توان عملیاتی تقریباً خطی از یک رک پایه رشد کرد. سوم، بهینهسازیهای پیوسته نرمافزاری، جهش عملکرد را هدایت میکنند؛ بهینهسازیهای نرمافزاری در ارسالهای v6.1 انویدیا تا ۱.۶ برابر عملکرد بهتر از v6.0 رقم زدند و این بهینهسازیها پس از ثبت نتایج هم ادامه یافته و بهبود بیشتری ایجاد کرده است.
برای سازمانهایی که درباره زیرساخت هوش مصنوعی تصمیم میگیرند، عملکرد، کارایی مقیاسپذیری و سرعت نرمافزار، فاکتورهای مهمی هستند که اقتصاد بلندمدت استنتاج را تعیین میکنند.
انویدیا نتایج پیشنمایش Vera Rubin NVL72 را روی دو مورد از سختترین بنچمارکهای مجموعه MLPerf Inference v6.1 ثبت کرده است: DeepSeek-R1 و Qwen3-VL. Vera Rubin NVL72 در Qwen3-VL و در سناریوهای آفلاین، سروری و تعاملی، با استفاده از vLLM همراه با چارچوب استنتاج متنباز NVIDIA Dynamo، تا ۳.۷ برابر توان عملیاتی بیشتر از GB300 NVL72 دارد. در DeepSeek-R1 و با کتابخانه NVIDIA TensorRT-LLM، توان عملیاتی تا ۲.۵ برابر بیشتر از GB300 NVL72 است. این نتایج اولیه، سرعت نوآوری انویدیا و مسیر بهبود عملکرد با بهینهسازی نرمافزاری مستمر را نشان میدهد.
این عملکرد یعنی هر رک Vera Rubin NVL72 بهطور معناداری توکن بیشتر تولید میکند، به کاربران بیشتری سرویس میدهد و درآمد بیشتری نسبت به یک رک GB300 NVL72 میسازد، در حالی که هزینه هر توکن را پایین میآورد.
نتایج، حاصل همطراحی کامل سختافزار و نرمافزار است. هستههای Tensor و موتور Transformer تقویتشده در Vera Rubin، هر دو مرحله پیشپرکردن (prefill) و رمزگشایی (decode) استنتاج را تسریع میکنند، در حالی که دقت NVFP4 ردپای حافظه را در وزنهای مدل، توجه و کش KV کاهش میدهد و توان عملیاتی را با کمترین افت کیفیت خروجی بالا میبرد.
ارسالهای Vera Rubin بهشدت از «سرویسدهی تفکیکشده» استفاده کردهاند؛ یعنی جدا کردن پیشپرکردن از رمزگشایی همراه با موازیسازی خبرگان در مقیاس بزرگ برای رسیدن به حداکثر کارایی در لایههای mixture-of-experts که مدلهایی مثل DeepSeek-R1 و Qwen3-VL را میسازند. دامنه مقیاسدهی NVL72 که با نسل ششم NVLink و NVLink Switch نرخ بسته ۱۰ برابر بالاتر و تأخیر ۳ برابر کمتر از اترنت معمول ارائه میدهد، زیربنای اتصالی است که این تکنیکها را در مقیاس رک کارآمد میکند.
این همطراحی به اکوسیستم شرکای انویدیا هم گسترش مییابد: Nebius نیز نتایج پیشنمایش Vera Rubin NVL72 را ثبت کرد و عملکرد چشمگیری نشان داد.
ایجنتهای هوش مصنوعی که استدلال، برنامهریزی و عملکردن چندمرحلهای دارند، در حال تغییر شیوه سنجش عملکرد استنتاج هستند. در بنچمارکهایی که برای ثبت این تغییر طراحی شدهاند، مثل SemiAnalysis AgentX، سیستم Vera Rubin NVL72 در تست پیشنمایش ۳۰ برابر عملکرد بهتر از GB300 NVL72 داشته است. علاوه بر این، بنچمارک پیشروی MLPerf Endpoints اندازهگیری استاندارد را به بارهای کاری استنتاج ایجنتی میآورد؛ چیزی فراتر از آنچه بنچمارکهای توان عملیاتی سنتی ثبت میکنند.
کارایی مقیاسپذیری — یعنی اینکه افزودن GPU چقدر مؤثر به رشد توان عملیاتی ترجمه میشود — معیار کلیدی بهرهوری زیرساخت هوش مصنوعی است. انویدیا این را با اتصالات مقیاسدهی پهنباند و کمتأخیر درون هر رک، شبکه پرسرعت میان رکها و هماهنگسازی کارآمد درخواستها میان نودها محقق میکند. ارسال DeepSeek-R1 انویدیا از یک رک GB300 NVL72 (۷۲ GPU) به چهار رک (۲۸۸ GPU) مقیاس شد و در سناریوی آفلاین به ۹۹ درصد کارایی مقیاسپذیری رسید؛ توان عملیاتی تقریباً متناسب با سختافزار اضافهشده رشد کرد.
اهمیت این معیار در این است که GPU بیشتر بهطور خودکار به توان عملیاتی متناسب ترجمه نمیشود. اگر دو برابر کردن تعداد GPU فقط بهبود تکرقمی در توان عملیاتی بدهد، هزینه زیرساخت بسیار جلوتر از بازده عملکرد میدود. معماری، اتصالات و نرمافزار باید با هم مقیاس شوند. GB300 NVL72 همچنین کارایی در مقیاس رک را در بنچمارک تبدیل متن به ویدئو WAN 2.2 نشان داد و به ۰.۶۵ ویدئوی ۷۲۰p در هر ثانیه با ۵.۷ ثانیه برای هر ویدئو رسید؛ یعنی ۹ برابر توان عملیاتی بالاتر و ۷.۵ برابر تأخیر کمتر از یک نود واحد.
در بخش نرمافزار، عملکرد GB300 NVL72 روی Qwen3-VL در v6.1 تا ۱.۶ برابر نتایج v6.0 بهبود یافت. این جهش از طریق دقت پایینتر کش KV، ترکیب بیشتر کرنلها، کرنلهای بهتر و سرویسدهی تفکیکشده با vLLM و NVIDIA Dynamo به دست آمد. بهینهسازی نرمافزاری پس از مهلت ارسال v6.1 هم ادامه یافت؛ نتایج پس از مهلت — که هنوز توسط MLCommons تأیید نشدهاند — روی GPT-OSS-120B و DLRMv3 بهبود بیشتری نشان میدهند.
فراتر از نتایج پلتفرم Grace Blackwell و Vera Rubin NVL72، انویدیا نتایج Jetson AGX Thor را با TensorRT Edge-LLM روی بنچمارک تازه معرفیشده Edge-Agentic و با Qwen3.6-27B ثبت کرد. اکوسیستم شرکای انویدیا هم بهطور گسترده شرکت کرد؛ ۱۹ شریک — که هشت موردشان روی سیستمهای چندنودی Blackwell NVL72 بودند — عملکرد چشمگیری نشان دادند. این فهرست شامل ایسوس، آژور، سیسکو، CoreWeave، Crusoe، دل، فوجیتسو، Giga Computing، اچپیای، Inventec، Lambda، MiTAC، Nebius، Oracle Cloud Infrastructure، Quanta، Red Hat، ScitiX، سوپرمایکرو و Wiwynn است. از دستگاههای کوچک لبه تا بزرگترین کارخانههای هوش مصنوعی، انویدیا با آهنگ سالانه معماریهای پلتفرم، نرمافزاری که پیوسته بهتر میشود و اکوسیستمی که آن را در مقیاس عرضه میکند، عملکرد را در کل پشته فناوری پیش میبرد.