گوگل از دو مدل تازه رونمایی کرده که پیشرفتهایی در استدلال نزدیک به زمان واقعی به ارمغان میآورد، عاملهای صوتی را عملیتر میکند و گفتوگو با هوش مصنوعی را طبیعیتر و هوشمندانهتر میسازد.
مدل نخست «جمینای ۳.۸ لایو» است که برای مقیاسپذیری و بهرهوری هزینه ساخته شده و هوشمندی مکالمهای را با گفتوگوی روان و درک زمینه بصری ترکیب میکند. مدل دوم «جمینای ۳.۸ لایو با تفکر گسترده» برای کارهای بسیار پیچیده طراحی شده و از هوشمندی و استدلال چندمرحلهای بیشتری برخوردار است. برای توسعهدهندگان و سازمانها، این مدلها بلوکهای سازنده عاملهای صوتی قابل اتکا و آماده تولید را فراهم میکنند و همزمان حرفزدن با جمینای در اپ جمینای، گوگل ورکاسپیس و جستوجوی گوگل را روانتر و مشارکتیتر میکنند؛ تا جایی که میتوان کارهای پیچیده را تنها با صدا انجام داد.
جمینای ۳.۸ لایو با تفکر گسترده کیفیت و هوشمندی در سطح سازمانی را ارائه میدهد و در شاخص کیفیت گفتار به گفتار مؤسسه Artificial Analysis جایگاه نخست کلی را با امتیاز ۸۲.۶ گرفته است. در تکمیل وظایف عاملمحور هم با امتیاز ۶۸.۶ درصد در بنچمارک τ-Voice و ۳۵.۱ درصد در بنچمارک τ-Voice-banking شرکت سیرا پیشتاز است. این مدل در استدلال هم قدرتمند است و ۹۷.۷ درصد در بنچمارک Big Bench Audio امتیاز گرفته، آن هم با قیمتی که در مقایسه با دیگر مدلهای مرزی رقابتی است.
جمینای ۳.۸ لایو هم ترجیح بالای کاربران را به دست آورده و در Speech Agent Arena رتبه دوم را گرفته است. در کنار این عملکرد، بهرهوری هزینهاش بالاست و مدلی توانمند و کارآمد برای مقیاس بزرگ در اختیار توسعهدهندگان و سازمانها میگذارد. در بنچمارک EVA-Bench شرکت ServiceNow که برای ارزیابی عاملهای صوتی طراحی شده، مدلهای گوگل با موفقیت در توازن میان دقت و کیفیت مکالمه، مرز پارتو برای گردشکارهای پیچیده را جابهجا میکنند.
جمینای ۳.۸ لایو ورودیهای بصری را تقریباً در زمان واقعی پردازش میکند و گفتوگو را با زمینهای غنیتر برای پاسخهای مفیدتر پر میکند. این مدل خودکار ۹۷ زبان پشتیبانیشده را تشخیص میدهد و وسط گفتوگو میان آنها جابهجا میشود. ابزارها و فراخوانیهای API را در پسزمینه اجرا میکند و همزمان گفتوگو را ادامه میدهد؛ یعنی مدل میتواند درخواست را تأیید کند و به صحبت ادامه بدهد تا کارها در پسزمینه تمام شوند. گوگل نمونههایی از این قابلیت را نشان داده است: راهنمایی زنده برای آموزش کارکنان تازهوارد با استفاده از زمینه بصری، و بازی شطرنج در نزدیک به زمان واقعی با تکیه بر زمینه بصری، استدلال و جریان طبیعی گفتوگو.
مدل تفکر گسترده برای کارهایی است که استدلال عمیقتری میخواهند. این نسخه همزمان استدلال میکند و صحبت میکند؛ هوشمندی بیشتری برای گردشکارهای پیچیده میدهد و در همان حال جریان گفتوگو را بیوقفه نگه میدارد. از نشانههای کلامی زودهنگام مثل «بگذارید این را بررسی کنم...» برای تأیید طبیعی درخواست کاربر استفاده میکند و با روایت زنده پیشرفت، کاربر را در جریان کارهای چندمرحلهای پسزمینه قرار میدهد. گوگل نمونههایی از این مدل را نمایش داده است: تبدیل طرحهای خام و بازخورد صوتی تقریباً زمانواقعی به کامپوننتهای کاربردی React، هماهنگی رزروهای چندمرحلهای و فراخوانیهای نامتقارن توابع بدون قطع گفتوگوی زنده، و ساخت برنامههای کسبوکار کامل و جعبهابزارهای بازاریابی اختصاصی صرفاً با حرف زدن.
در گوگل ورکاسپیس و جستوجو، این مدلهای زنده تجربههای مشارکتیتر و شهودیتری میسازند؛ نسخه تفکر گسترده در ورکاسپیس از طریق Docs Live، Gmail Live و Keep Live در دسترس است و کاربران میتوانند کمک گامبهگام و زمانواقعی عیبیابی را با جمینای ۳.۸ لایو دقیقاً داخل Search Live بگیرند.
گوگل برای تقویت اکوسیستم توسعهدهندگان صوتی هم روی Gemini Live API حساب میکند. پلتفرمهایی مثل Agora، Fishjam، LangChain، LiveKit، Pipecat، Vercel و Vision Agents به توسعهدهندگان امکان ساخت و استقرار رابطهای صوتی پرکارایی میدهند؛ این پلتفرمها زیرساخت پیچیده پخش رسانهای زمانواقعی را پشت صحنه مدیریت میکنند تا توسعهدهنده تمام تمرکزش را روی تجربه کاربر بگذارد. گوگل همچنین از همکاری با شرکتهایی مثل سلزفورس، گنسپارک و لومریس خبر داده که به تأخیر کم، روانی و توانایی فراخوانی ابزار این مدلها اشاره کردهاند.
در بخش شفافیت، تمام صدای تولیدشده توسط محصولات هوش مصنوعی گوگل با واترمارک نامرئی SynthID علامتگذاری میشود تا محتوای تولیدشده با هوش مصنوعی قابل تشخیص بماند و به جلوگیری از اطلاعات نادرست کمک کند.
برنامه عرضه هم از امروز شروع شده است. برای توسعهدهندگان، هر دو مدل در Gemini API و Google AI Studio در دسترساند. برای سازمانها، در پیشنمایش خصوصی Gemini Enterprise و بهزودی برای تجربه مشتری Gemini Enterprise. برای عموم، جمینای ۳.۸ لایو در Search Live آغاز شده و نسخه تفکر گسترده در Gemini Live و برای مشترکان Google AI Pro و Ultra در ورکاسپیس روی Docs و برای همه مشترکان گوگل ایآی در Gmail و Keep ارائه میشود.