آرِنا (Arena)، پلتفرمی که در سال ۲۰۲۳ بهعنوان یک پروژه پژوهشی در دانشگاه برکلی برای رتبهبندی جمعسپاریشده مدلهای هوش مصنوعی آغاز به کار کرد، پنجشنبه اعلام کرد ۲۰۰ میلیون دلار در دور سرمایهگذاری سری B با ارزشگذاری ۳.۱ میلیارد دلار جذب کرده است.
این دور پس از آن رقم خورد که شرکت اعلام کرد در ژوئن به ۱۰۰ میلیون دلار درآمد سالانه رسیده است. دور جدید به رهبری «لایتاسپید ونچر پارتنرز» و «خسلا ونچرز» انجام شد و «سیلزفورس ونچرز»، «۰۱ ادوایزرز»، «دل تکنولوجیز کپیتال»، «اندِوِر کاتالیست»، a16z، «فلیسیس» و چند سرمایهگذار دیگر در آن مشارکت داشتند.
آرِنا پیشتر در ژانویه اعلام کرده بود دور سری A به ارزش ۱۵۰ میلیون دلار را با ارزشگذاری پس از تأمین مالی ۱.۷ میلیارد دلار جذب کرده است. در آن زمان به گفته شرکت، درآمد سالانهاش ۳۰ میلیون دلار بود. این یعنی ارزشگذاری شرکت در حدود ۱۰ ماه تقریباً دو برابر شده است.
آرِنا یک پلتفرم جمعسپاریشده ارائه میدهد که برای مصرفکنندگان رایگان است. کاربران پرامپت وارد میکنند یا پروژههای «وایبکد» درخواست میکنند و سپس رتبه میدهند که کدام مدل آن را بهتر انجام داده است. آرِنا مدعی است دهها میلیون بازدیدکننده ماهانه دارد.
در سپتامبر سال گذشته، آرِنا محصول تجاری خود با نام «ارزیابیهای هوش مصنوعی» را معرفی کرد؛ خدمتی که به آزمایشگاههای مدل و شرکتها تحلیلهای عملکردی دقیق بر پایه بازخورد جامعه کاربری ارائه میدهد. زمانبندی این محصول عالی از آب درآمد. امسال آزمایشگاههای هوش مصنوعی متوجه شدند مدلهایشان آزمونهای بنچمارک را دور میزنند و راههایی برای کسب نمرات خوب بدون شایستگی واقعی پیدا میکنند. همزمان، شرکتها میخواستند بهجای تکیه صرف بر بنچمارکهای استاندارد، کمک بگیرند تا بفهمند کدام مدل برای نیازهای داخلی خودشان بهترین است.
شرکت در اطلاعیه جذب سرمایه گفت: «هوش مصنوعی سریعتر از توان ما برای ارزیابی آن پیش میرود، و بنچمارکهای ایستا وقتی مدلها میفهمند در حال آزمایشاند از کار میافتند.» و افزود: «جهان به یک طرف سوم بیطرف نیاز دارد تا اندازهگیری کند هوش مصنوعی وقتی در دست مردم واقعی قرار میگیرد عملاً چقدر ایمن و همراستا است. آرِنا امروز این نقش را برعهده میگیرد.»
بر همین اساس، آرِنا دسته جدیدی به جدول رتبهبندی خود اضافه کرده است: «همراستایی». در این جدول مدلها بر پایه مسائلی مانند اقدام غیرمجاز (انجام کاری که از آنها خواسته نشده)؛ انتساب نادرست (نسبت دادن اشتباه نقلقولها یا واقعیتها به منبع نادرست) و آنچه «تکمیل فریبکارانه» مینامد (دروغ گفتن درباره انجام کارهایی که انجام نشدهاند) رتبهبندی میشوند.
در حال حاضر مجموعهای از مدلهای اوپنآیآی در صدر جدول مقدماتی همراستایی قرار دارند و کلود اوپوس ۵.۵ و کلود «فِیبل» بهترتیب در جایگاه ششم و نهم ایستادهاند. دستهبندی همراستایی گامی تازه در تلاش آرِنا برای تبدیل شدن به مرجعی مستقل در سنجش رفتار واقعی مدلها در دست کاربران است.