Le géant américain a présenté son nouveau modèle d’intelligence artificielle. Baptisée Gemini, cette IA prend en considération du texte, de l’image, de la vidéo ou bien encore du son. Capable d’interagir avec l’utilisateur, ses capacités pourraient dépasser celles d’experts humains dans certains domaines. Aussi bluffant qu’inquiétant, le modèle d’IA générative de Google fascine déjà. Un après le lancement de ChatGPT par OpenAI, le géant californien a qualifié Gemini de modèle d’IA, «le plus conséquent, le plus doué et aussi le plus général». A travers une vidéo de présentation, la firme américaine montre que son IA est capable de voir, entendre et comprendre du texte mais aussi des images, du code ou du son et d’en faire l’analyse pour ses utilisateurs. Ce modèle mesure également la compréhension et les capacités de raisonnement dans de multiples domaines dont le langage, les maths, l’histoire, la physique, la médecine ou bien encore le droit. L’objectif pour Google est de créer une intelligence artificielle générale (AGI), capable de raisonner aussi bien, voire mieux que les humains. «C’est une étape de plus vers notre vision : vous amener le meilleur collaborateur d’IA au monde», a déclaré Sissie Hsiao, vice-présidente de Google chargée de Bard, l’outil d’IA conversationnelle de Google. Avant d’ajouter : «Cette nouvelle ère de modèles représente l’un des plus grands efforts scientifiques et techniques que nous ayons entrepris en tant que société».
Let's go hands-on with #GeminiAI.
Our newest AI model can reason across different types of inputs and outputs — like images and text. See Gemini's multimodal reasoning capabilities in action ↓ pic.twitter.com/tikHjGJ5Xj — Google (@Google) December 6, 2023
Photo d'ouverture : @Brett Jordan
