جمینای ۳.۸ لایو و نسخه «تفکر گسترده» معرفی شد؛ گفت‌وگو با هوش مصنوعی دیگر منتظر نمی‌ماند
هوش مصنوعی جهان ترجمه‌شده مدل‌ها و چیپ‌ها

جمینای ۳.۸ لایو و نسخه «تفکر گسترده» معرفی شد؛ گفت‌وگو با هوش مصنوعی دیگر منتظر نمی‌ماند

۲۵ شهریور ۱۴۰۵ ⏱ ۳ دقیقه مطالعه 👁 ۰ بازدید ✍️ تحریریه رشدینو
✈️ اشتراک در تلگرام 💬 واتساپ 𝕏 توییتر
خلاصه خبر پاسخ سریع در یک نگاه

گوگل دو مدل تازه گفت‌وگوی زنده معرفی کرد: جمینای ۳.۸ لایو برای مکالمه روان و ارزان در مقیاس بزرگ و نسخه «تفکر گسترده» برای کارهای پیچیده چندمرحله‌ای که همزمان استدلال می‌کند و حرف می‌زند.

گوگل از دو مدل تازه رونمایی کرده که پیشرفت‌هایی در استدلال نزدیک به زمان واقعی به ارمغان می‌آورد، عامل‌های صوتی را عملی‌تر می‌کند و گفت‌وگو با هوش مصنوعی را طبیعی‌تر و هوشمندانه‌تر می‌سازد.

مدل نخست «جمینای ۳.۸ لایو» است که برای مقیاس‌پذیری و بهره‌وری هزینه ساخته شده و هوشمندی مکالمه‌ای را با گفت‌وگوی روان و درک زمینه بصری ترکیب می‌کند. مدل دوم «جمینای ۳.۸ لایو با تفکر گسترده» برای کارهای بسیار پیچیده طراحی شده و از هوشمندی و استدلال چندمرحله‌ای بیشتری برخوردار است. برای توسعه‌دهندگان و سازمان‌ها، این مدل‌ها بلوک‌های سازنده عامل‌های صوتی قابل اتکا و آماده تولید را فراهم می‌کنند و همزمان حرف‌زدن با جمینای در اپ جمینای، گوگل ورک‌اسپیس و جست‌وجوی گوگل را روان‌تر و مشارکتی‌تر می‌کنند؛ تا جایی که می‌توان کارهای پیچیده را تنها با صدا انجام داد.

جمینای ۳.۸ لایو با تفکر گسترده کیفیت و هوشمندی در سطح سازمانی را ارائه می‌دهد و در شاخص کیفیت گفتار به گفتار مؤسسه Artificial Analysis جایگاه نخست کلی را با امتیاز ۸۲.۶ گرفته است. در تکمیل وظایف عامل‌محور هم با امتیاز ۶۸.۶ درصد در بنچمارک τ-Voice و ۳۵.۱ درصد در بنچمارک τ-Voice-banking شرکت سیرا پیشتاز است. این مدل در استدلال هم قدرتمند است و ۹۷.۷ درصد در بنچمارک Big Bench Audio امتیاز گرفته، آن هم با قیمتی که در مقایسه با دیگر مدل‌های مرزی رقابتی است.

جمینای ۳.۸ لایو هم ترجیح بالای کاربران را به دست آورده و در Speech Agent Arena رتبه دوم را گرفته است. در کنار این عملکرد، بهره‌وری هزینه‌اش بالاست و مدلی توانمند و کارآمد برای مقیاس بزرگ در اختیار توسعه‌دهندگان و سازمان‌ها می‌گذارد. در بنچمارک EVA-Bench شرکت ServiceNow که برای ارزیابی عامل‌های صوتی طراحی شده، مدل‌های گوگل با موفقیت در توازن میان دقت و کیفیت مکالمه، مرز پارتو برای گردش‌کارهای پیچیده را جابه‌جا می‌کنند.

جمینای ۳.۸ لایو ورودی‌های بصری را تقریباً در زمان واقعی پردازش می‌کند و گفت‌وگو را با زمینه‌ای غنی‌تر برای پاسخ‌های مفیدتر پر می‌کند. این مدل خودکار ۹۷ زبان پشتیبانی‌شده را تشخیص می‌دهد و وسط گفت‌وگو میان آن‌ها جابه‌جا می‌شود. ابزارها و فراخوانی‌های API را در پس‌زمینه اجرا می‌کند و همزمان گفت‌وگو را ادامه می‌دهد؛ یعنی مدل می‌تواند درخواست را تأیید کند و به صحبت ادامه بدهد تا کارها در پس‌زمینه تمام شوند. گوگل نمونه‌هایی از این قابلیت را نشان داده است: راهنمایی زنده برای آموزش کارکنان تازه‌وارد با استفاده از زمینه بصری، و بازی شطرنج در نزدیک به زمان واقعی با تکیه بر زمینه بصری، استدلال و جریان طبیعی گفت‌وگو.

مدل تفکر گسترده برای کارهایی است که استدلال عمیق‌تری می‌خواهند. این نسخه همزمان استدلال می‌کند و صحبت می‌کند؛ هوشمندی بیشتری برای گردش‌کارهای پیچیده می‌دهد و در همان حال جریان گفت‌وگو را بی‌وقفه نگه می‌دارد. از نشانه‌های کلامی زودهنگام مثل «بگذارید این را بررسی کنم...» برای تأیید طبیعی درخواست کاربر استفاده می‌کند و با روایت زنده پیشرفت، کاربر را در جریان کارهای چندمرحله‌ای پس‌زمینه قرار می‌دهد. گوگل نمونه‌هایی از این مدل را نمایش داده است: تبدیل طرح‌های خام و بازخورد صوتی تقریباً زمان‌واقعی به کامپوننت‌های کاربردی React، هماهنگی رزروهای چندمرحله‌ای و فراخوانی‌های نامتقارن توابع بدون قطع گفت‌وگوی زنده، و ساخت برنامه‌های کسب‌وکار کامل و جعبه‌ابزارهای بازاریابی اختصاصی صرفاً با حرف زدن.

در گوگل ورک‌اسپیس و جست‌وجو، این مدل‌های زنده تجربه‌های مشارکتی‌تر و شهودی‌تری می‌سازند؛ نسخه تفکر گسترده در ورک‌اسپیس از طریق Docs Live، Gmail Live و Keep Live در دسترس است و کاربران می‌توانند کمک گام‌به‌گام و زمان‌واقعی عیب‌یابی را با جمینای ۳.۸ لایو دقیقاً داخل Search Live بگیرند.

گوگل برای تقویت اکوسیستم توسعه‌دهندگان صوتی هم روی Gemini Live API حساب می‌کند. پلتفرم‌هایی مثل Agora، Fishjam، LangChain، LiveKit، Pipecat، Vercel و Vision Agents به توسعه‌دهندگان امکان ساخت و استقرار رابط‌های صوتی پرکارایی می‌دهند؛ این پلتفرم‌ها زیرساخت پیچیده پخش رسانه‌ای زمان‌واقعی را پشت صحنه مدیریت می‌کنند تا توسعه‌دهنده تمام تمرکزش را روی تجربه کاربر بگذارد. گوگل همچنین از همکاری با شرکت‌هایی مثل سلزفورس، گنسپارک و لومریس خبر داده که به تأخیر کم، روانی و توانایی فراخوانی ابزار این مدل‌ها اشاره کرده‌اند.

در بخش شفافیت، تمام صدای تولیدشده توسط محصولات هوش مصنوعی گوگل با واترمارک نامرئی SynthID علامت‌گذاری می‌شود تا محتوای تولیدشده با هوش مصنوعی قابل تشخیص بماند و به جلوگیری از اطلاعات نادرست کمک کند.

برنامه عرضه هم از امروز شروع شده است. برای توسعه‌دهندگان، هر دو مدل در Gemini API و Google AI Studio در دسترس‌اند. برای سازمان‌ها، در پیش‌نمایش خصوصی Gemini Enterprise و به‌زودی برای تجربه مشتری Gemini Enterprise. برای عموم، جمینای ۳.۸ لایو در Search Live آغاز شده و نسخه تفکر گسترده در Gemini Live و برای مشترکان Google AI Pro و Ultra در ورک‌اسپیس روی Docs و برای همه مشترکان گوگل ای‌آی در Gmail و Keep ارائه می‌شود.

# مدل‌ها و چیپ‌ها
🔗 اخبار مرتبط

بخوانید