A Google I/O 2026-on a vállalat két új modellcsaládot mutatott be: a Gemini Omnit és a Gemini 3.5-öt. A cég ezzel egyértelműen az “ügynöki Gemini-korszak” irányába mozdult el – a hangsúly a passzív chatbotokról az önállóan cselekvő AI-ügynökökre helyeződött át.

Bármilyen bemenetből bármilyen kimenet

A Gemini Omni úgy készít tartalmat, hogy szöveget, képet, hangot és videót is felhasználhat bemenetként – jelenleg videó kimenettel. A modell a fizikai világ jobb megértésére épül: pontosabban szimulálja a gravitációt, a mozgásenergiát és a folyadékok viselkedését, így a generált jelenetek élethűbbek.

Az igazi újdonság azonban a szerkesztés módja: a videókat természetes nyelven, beszélgetve lehet módosítani. Minden utasítás az előzőre épül, a karakterek és a fizikai törvények konzisztensek maradnak a jelenetek között. Minden Omnival készült videó láthatatlan SynthID vízjelet kap, amely jelzi, hogy AI generálta.

A Gemini Omni Flash már elérhető díjmentesen a YouTube Shorts Remixben, és fokozatosan érkezik az API-khoz is fejlesztők és vállalati ügyfelek számára.

Gemini 3.5 Flash: gyors és ügynöki

A Gemini 3.5 család első tagja, a 3.5 Flash kifejezetten hosszú, több lépéses ügynöki feladatokra készült. A Google szerint a modell felülmúlja a korábbi Gemini 3.1 Pro-t több kódolási és ügynöki benchmarkon is, mindezt jelentősen alacsonyabb költség mellett.

A 3.5 Flash azonnal az alapértelmezett modell lett a Gemini alkalmazásban és a Search AI Mode-ban világszerte – ingyenes felhasználók számára is, külön beállítás nélkül.

Egyre több agentikus funkció

Az I/O-n bemutatott újdonságok közé tartozik a Google Antigravity 2.0 fejlesztői platform, amely már önálló asztali alkalmazásként és parancssori eszközként is elérhető, valamint az “információs ügynökök”, amelyek a háttérben folyamatosan figyelik a felhasználó számára releváns témákat, és összefoglalót küldenek, amikor releváns új információ érkezik.


Forrás: Google – 100 things we announced at Google I/O 2026