خانواده جمینای 3.8 لایو بهعنوان پیشرفتهترین مدلهای مکالمهای گوگل معرفی شدند [تماشا کنید]
گوگل دو مدل هوش مصنوعی جدید با نامهای جمینای 3.8 لایو و Gemini 3.8 Live Extended Thinking را معرفی کرده است. این سیستمها پیشرفتهترین مدلهای مکالمه زنده این غول فناوری محسوب میشوند و با ارتقای قابلیتهای پردازشی و استدلال موازی، امکان همکاری صوتی و اجرای وظایف پیچیده از طریق مکالمه را برای کاربران فراهم میکنند.
مدل اول یعنی Gemini 3.8 Live با تمرکز بر مقیاسپذیری بالا و مدیریت هزینهها توسعه پیدا کرده و هوش مکالمهای را با ادراک بصری و مکالمه روان ترکیب کرده است. در سوی دیگر، نسخه جیمنای 3.8 لایو Extended Thinking برای حل مسائل پیچیدهتر طراحی شده و سطح بالاتری از توان پردازشی و استدلال چندمرحلهای را به نمایش میگذارد. توسعهدهندگان و مشتریان سازمانی میتوانند از این دو مدل به عنوان زیرساختی پایدار جهت طراحی ایجنتهای صوتی استفاده کنند.
قابلیتها و استدلال پیشرفته در جیمنای 3.8 لایو
بررسیهای فنی گوگل نشان میدهد مدل Gemini 3.8 Live Extended Thinking توانسته رتبه اول شاخص کیفیت صدابهصدا در پایگاه سنجش هوش مصنوعی Artificial Analysis را با امتیاز ۸۲.۶ به دست بیاورد. این مدل در انجام وظایف ایجنتی مستقل روی بنچمارک τ-Voice امتیاز ۶۸.۶ درصد و در آزمون Sierra به نام τ-Voice-banking امتیاز ۳۵.۱ درصد را ثبت کرده است. علاوهبراین، در آزمون استدلال صوتی Big Bench Audio موفق به کسب امتیاز ۹۷.۷ درصد شده و همزمان قیمت رقابتی خود را در مقایسه با سایر محصولات هوش مصنوعی پیشرو بازار حفظ کرده است.
در ویدیو زیر، کاربر طرحی از یک وبسایت را برای مدل Gemini 3.8 Live Extended Thinking روی کاغذ میکشد و سپس هوش مصنوعی گوگل مرحلهبهمرحله آن را پیادهسازی میکند.
مدل سبکتر جیمنای 3.8 لایو نیز رتبه دوم را در بنچمارک Speech Agent Arena از نظر ترجیح کاربران از آن خود کرده است. همچنین در ارزیابی EVA-Bench که برای بررسی عملکرد ایجنتهای صوتی ارائه شده، این مدلها تعادل خوبی میان دقت و کیفیت طبیعی مکالمه داشتهاند.
یکی از مشخصههای کلیدی مدل پایه، درک سریع ورودیهای تصویری در مکالمه عنوان شده است که پاسخهای کاربردیتری را به همراه میآورد. این هوش مصنوعی توانایی تشخیص خودکار و جابهجایی پیوسته بین ۹۷ زبان مختلف را در طول یک گفتوگو دارد. از سوی دیگر، ابزارها و دستورات نرمافزاری آن میتوانند در پسزمینه اجرا شوند، بدون آنکه اختلالی در روند صحبت با کاربر ایجاد کنند؛ یعنی مدل در حین پیگیری درخواستها یا محاسبات پشتصحنه، مکالمه را زنده نگه میدارد. بهعلاوه، نسخه Extended در هنگام حل مسائل دشوار میتواند استدلال ذهنی و صحبت کردن را بهطور همزمان پیش ببرد و با مواردd مثل گزارش لحظهای پیشرفت مراحل، ارتباط صوتی را قطع نمیکند.
در ویدیو زیر کاربر با نمایش لولههای آب از طریق دوربین گوشی خود، از مدل پایه جیمنای 3.8 لایو برای حل مشکل کمک میگیرد.
تمامی صداهای تولیدشده توسط این سیستمها نیز با فناوری SynthID واترمارک میشوند تا اصالت محتوا قابل رهگیری باشد.
هماکنون انتشار هر دو مدل رسماً شروع شده است. مدل Gemini 3.8 Live برای توسعهدهندگان از طریق Gemini API و Google AI Studio، برای کسبوکارها در پیشنمایش خصوصی Gemini Enterprise، و برای عموم کاربران در بخش Search Live فعال شده است. همچنین نسخه Gemini 3.8 Live Extended Thinking برای توسعهدهندگان در استودیو، برای مشتریان تجاری Workspace، و برای کاربران عادی در جمینای لایو و مشترکین پلنهای گوگل در داکس، جیمیل و Keep ارائه شده است.




