Google Rilis Gemini 3.8 Live, Bisa Pahami Visual dan 97 Bahasa


Gedung Kantor Google

Gedung Kantor Google

Google memperkenalkan Gemini 3.8 Live dan Gemini 3.8 Live Extended Thinking, dua model AI terbaru yang dirancang untuk menghadirkan percakapan suara lebih alami dan cerdas. Keduanya membawa kemampuan penalaran hampir real-time, pemahaman visual, dukungan 97 bahasa, serta kemampuan menjalankan tugas kompleks di latar belakang sambil tetap berbicara dengan pengguna.

Kehadiran dua model tersebut menandai langkah Google untuk membuat interaksi manusia dengan AI semakin menyerupai percakapan alami. Pengguna tidak hanya dapat memberikan perintah melalui suara, tetapi juga meminta AI mengerjakan tugas yang membutuhkan sejumlah tahapan penalaran.

Google menjelaskan, Gemini 3.8 Live dikembangkan untuk penggunaan dalam skala besar dengan biaya yang lebih efisien. Model ini menggabungkan kemampuan percakapan, dialog yang mengalir, dan pemahaman terhadap konteks visual.

Sementara itu, Gemini 3.8 Live Extended Thinking ditujukan untuk kebutuhan yang lebih kompleks. Model ini memiliki kemampuan penalaran multi-langkah yang memungkinkan AI menangani tugas dengan tingkat kesulitan lebih tinggi.

Bagi pengembang dan perusahaan, kedua model tersebut dapat menjadi fondasi untuk membangun voice agent yang siap digunakan dalam lingkungan produksi. Teknologi ini juga diterapkan untuk meningkatkan pengalaman interaksi suara di berbagai layanan Google, termasuk aplikasi Gemini, Google Workspace, dan Search.

 

Percakapan Suara Semakin Cerdas

Salah satu fokus utama Gemini 3.8 Live dan Gemini 3.8 Live Extended Thinking adalah meningkatkan kualitas percakapan suara. Google tidak hanya mengejar kemampuan AI dalam memahami ucapan, tetapi juga bagaimana AI merespons, bernalar, dan mempertahankan konteks selama percakapan berlangsung.

Gemini 3.8 Live Extended Thinking disebut memiliki kemampuan penyelesaian tugas dan kecerdasan tingkat enterprise. Berdasarkan pengujian yang dikutip Google, model tersebut menempati posisi teratas secara keseluruhan dalam Speech to Speech Quality Index dari Artificial Analysis dengan skor 82,6.

Pada pengujian tugas berbasis agen, Gemini 3.8 Live Extended Thinking mencatat skor 68,6 persen pada benchmark τ-Voice. Sementara pada benchmark τ-Voice-banking dari Sierra, model tersebut memperoleh skor 35,1 persen.

Kemampuan penalarannya juga diuji melalui Big Bench Audio, dengan skor 97,7 persen. Google menyebut performa tersebut tetap ditawarkan dengan harga yang kompetitif dibandingkan sejumlah model AI generasi terbaru lainnya.

Di sisi lain, Gemini 3.8 Live memperoleh posisi kedua dalam Speech Agent Arena berdasarkan preferensi pengguna. Model tersebut juga dirancang dengan mempertimbangkan efisiensi biaya sehingga dapat digunakan untuk kebutuhan dalam skala besar.

Kedua model juga diuji melalui EVA-Bench milik ServiceNow, yang digunakan untuk mengevaluasi kemampuan voice agent. Dalam pengujian tersebut, model Gemini diarahkan untuk menangani alur kerja kompleks dengan menyeimbangkan akurasi dan kualitas percakapan.

 

Bisa Memahami Visual Hampir Secara Real-Time

Kemampuan menarik lainnya dari Gemini 3.8 Live adalah pemrosesan input visual hampir secara real-time. Artinya, AI dapat menggunakan informasi visual sebagai konteks tambahan ketika memberikan jawaban kepada pengguna.

Kemampuan tersebut berpotensi membuat percakapan suara menjadi lebih kontekstual. Pengguna tidak hanya berbicara dengan AI, tetapi juga dapat memberikan informasi melalui gambar atau input visual yang kemudian dipahami sebagai bagian dari percakapan.

Gemini 3.8 Live juga mampu mendeteksi dan berpindah di antara 97 bahasa yang didukung ketika percakapan sedang berlangsung. Kemampuan tersebut memungkinkan percakapan multibahasa berlangsung tanpa harus menghentikan sesi terlebih dahulu untuk mengubah pengaturan bahasa.

Selain itu, model dapat menjalankan tool dan panggilan API di latar belakang. Ketika pengguna meminta AI melakukan sebuah tugas, Gemini dapat mengonfirmasi permintaan tersebut dan tetap melanjutkan percakapan sembari proses berlangsung.

Dengan mekanisme ini, pengguna tidak harus selalu menunggu sampai sebuah proses selesai sebelum dapat berbicara kembali dengan AI.

 

Extended Thinking Bisa Bernalar Sambil Berbicara

Untuk kebutuhan yang lebih kompleks, Google mengandalkan Gemini 3.8 Live Extended Thinking. Salah satu kemampuan yang ditekankan adalah kemampuan model untuk bernalar sekaligus berbicara.

Dalam percakapan biasa, pengguna sering kali merasa tidak nyaman ketika AI membutuhkan waktu untuk memproses permintaan tetapi tidak memberikan respons apa pun. Gemini 3.8 Live Extended Thinking mencoba mengatasi persoalan tersebut dengan memberikan respons awal dan pembaruan selama proses berlangsung.

Misalnya, AI dapat mengatakan, "Biar saya periksa dulu..." sebagai tanda bahwa permintaan pengguna sedang diproses. Setelah itu, model dapat memberikan informasi mengenai perkembangan tugas yang sedang dikerjakan.

Untuk tugas yang terdiri dari beberapa langkah, proses tersebut dapat berlangsung di latar belakang. Pengguna tetap dapat mengikuti perkembangan pekerjaan AI tanpa kehilangan alur percakapan. Pendekatan ini membuat interaksi terasa lebih natural karena AI tidak sekadar memberikan jawaban akhir, tetapi juga dapat berkomunikasi selama menjalankan proses yang diperlukan.

 

Terintegrasi dengan Layanan Google

Google juga membawa kemampuan model Live terbaru ke sejumlah layanan dalam ekosistemnya. Gemini Live dirancang untuk menghadirkan pengalaman yang lebih intuitif ketika digunakan bersama Google Workspace, Search, dan aplikasi Gemini.

Dengan kemampuan percakapan suara yang lebih baik, pengguna dapat meminta bantuan AI tanpa harus selalu mengetik instruksi. Hal ini terutama berguna untuk pekerjaan yang membutuhkan beberapa langkah atau ketika pengguna ingin berinteraksi dengan AI secara lebih spontan.

Di lingkungan produktivitas, kemampuan tersebut dapat membantu pengguna menjalankan tugas sambil tetap mempertahankan komunikasi dengan AI.

 

Dorong Pengembangan Voice Agent

Google juga membuka kemampuan Gemini Live melalui Gemini Live API. API ini memungkinkan pengembang memanfaatkan kemampuan percakapan suara Gemini untuk membangun aplikasi dan layanan mereka sendiri.

Sejumlah platform pengembang, termasuk Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel, dan Vision Agents, disebut telah memanfaatkan Gemini Live API.

Platform tersebut membantu menangani infrastruktur streaming media secara real-time di balik layar. Dengan begitu, pengembang dapat lebih berkonsentrasi pada desain aplikasi dan pengalaman pengguna tanpa harus membangun seluruh infrastruktur komunikasi suara dari awal.

Google juga menggandeng perusahaan seperti Salesforce, Genspark, dan Lumeris. Ketertarikan perusahaan-perusahaan tersebut antara lain berkaitan dengan latensi, kelancaran percakapan, serta kemampuan Gemini dalam menjalankan tool dan panggilan API.

 

Audio AI Dilengkapi Watermark SynthID

Di tengah semakin luasnya penggunaan AI untuk menghasilkan suara, Google juga menyoroti aspek transparansi. Seluruh audio yang dihasilkan produk AI Google dilengkapi watermark SynthID. Watermark tersebut tidak terlihat atau terdengar oleh pengguna karena ditanamkan secara langsung ke dalam keluaran audio. Namun, keberadaannya memungkinkan konten yang dibuat AI tetap dapat dideteksi.

Google mengatakan teknologi tersebut ditujukan untuk membantu mengurangi risiko penyalahgunaan konten AI, termasuk penggunaan audio sintetis dalam penyebaran informasi yang menyesatkan. Informasi lebih lanjut mengenai aspek keamanan dan penggunaan AI secara bertanggung jawab juga disediakan Google melalui model card untuk model tersebut.

 

Mulai Rilis untuk Pengembang dan Pengguna

Google mulai merilis Gemini 3.8 Live secara bertahap. Untuk pengembang, model tersebut tersedia melalui Gemini API dan Google AI Studio.

Untuk pelanggan perusahaan, Gemini 3.8 Live tersedia dalam tahap private preview di Gemini Enterprise dan akan hadir di Gemini Enterprise for Customer Experience. Sementara bagi pengguna umum, model ini tersedia melalui Search Live.

Gemini 3.8 Live Extended Thinking juga mulai diluncurkan. Pengembang dapat mengaksesnya melalui Gemini API dan Google AI Studio.

Untuk perusahaan, model tersebut tersedia dalam tahap private preview di Gemini Enterprise dan akan hadir di Gemini Enterprise for Customer Experience serta pelanggan bisnis Google Workspace.

Sementara bagi pengguna umum, Gemini 3.8 Live Extended Thinking tersedia melalui Gemini Live. Model ini juga dapat digunakan pelanggan Google AI Pro dan Ultra di Workspace melalui Docs, serta pelanggan Google AI di Gmail dan Keep.

Dengan Gemini 3.8 Live dan Gemini 3.8 Live Extended Thinking, Google berupaya membawa percakapan suara AI melampaui sekadar kemampuan menjawab pertanyaan. Kedua model dirancang untuk memahami konteks visual, melakukan penalaran, menjalankan tugas di latar belakang, menggunakan berbagai tool dan API, serta tetap berinteraksi dengan pengguna selama proses berlangsung.

Perkembangan tersebut menunjukkan arah baru interaksi dengan AI, di mana suara bukan lagi sekadar metode untuk memasukkan perintah, tetapi menjadi antarmuka utama untuk berkolaborasi dengan sistem AI dalam menyelesaikan pekerjaan yang semakin kompleks.

Bagikan artikel ini

Komentar ()

Video Terkait