ENFR
8news

Tech • IA • Crypto

Aujourd'huiTopicsVidéosCryptoArchivesFavoris

Créer des applications créatives avec la suite GenMedia (I/O Connect ‘26)

9.4/10
GoogleGoogle for Developers6 juillet 2026 à 18:1427:25
Lecteur audio
0:00 / 0:00

INTRO

Google DeepMind a présenté une suite d’outils de médias génératifs capables de transformer des livres entiers en expériences multimédias cohérentes combinant images, vidéo, musique et voix.

POINTS CLÉS

Passage aux médias génératifs

L’IA générative dépasse le texte pour inclure images, vidéo, audio et voix, reflétant la manière dont les gens communiquent naturellement. Ce tournant positionne les « gen media » comme la prochaine grande phase après les grands modèles de langage, avec des systèmes multimodaux au cœur des usages quotidiens.

Fondation multimodale avec Gemini

Gemini a été conçu dès le départ comme un modèle multimodal capable de traiter texte, images et audio au sein d’un même système. Sa grande fenêtre de contexte permet d’ingérer des documents entiers, y compris des livres complets, et de s’en servir pour générer divers médias.

Génération de contenu de bout en bout à partir de livres

Un livre du domaine public comme The Wind in the Willows peut être chargé une seule fois et réutilisé. Le système peut extraire les personnages, résumer les chapitres et générer des invites structurées pour alimenter des modèles en aval, permettant des pipelines automatisés d’illustration et de narration.

Visualisation des personnages et des scènes

Des modèles d’images comme Nano Banana créent des portraits de personnages et des illustrations de scènes cohérents. En chaînant les requêtes via une API avec état, le système maintient une cohérence stylistique sur plusieurs sorties, assurant des traits reconnaissables tout au long de l’histoire.

API d’interactions avec état

La nouvelle Interactions API permet de conserver le contexte entre plusieurs requêtes sans renvoyer les données à chaque fois. Cela réduit l’usage de tokens et améliore l’efficacité, surtout pour des workflows complexes impliquant de nombreux assets (images, invites).

Génération vidéo avec invites contextuelles

Le modèle vidéo Veo peut animer des images fixes en courts clips. Les résultats s’améliorent lorsque les invites décrivent ce qui se passe après la scène, plutôt que de répéter l’invite initiale, soulignant l’importance du contexte temporel.

Bandes-son musicales générées par IA

Le modèle musical Lyria produit des morceaux instrumentaux ou complets adaptés aux scènes ou chapitres. Il permet de contrôler structure, tempo et style, pour des musiques alignées avec le ton narratif, comme des thèmes « cyberpunk » ou « acoustiques ».

Synthèse vocale multi-personnages

Un modèle Gemini TTS peut générer des dialogues narrés à partir de deux voix de base, tout en simulant plusieurs personnages via des techniques d’invite. Les variations de ton et de style donnent l’illusion d’une distribution complète, utile pour les livres audio ou récits dramatisés.

Sortie multimédia intégrée

En combinant images, narration et musique, le système peut assembler des contenus multimédias cohérents. Même des scripts complexes de synchronisation peuvent être générés automatiquement, montrant comment l’IA orchestre des pipelines de production complets.

Modèle émergent d’édition vidéo Omni

Le futur modèle Omni introduit une édition vidéo fine via des invites. Au lieu de régénérer des clips entiers, les utilisateurs modifient des éléments précis — voix, style, objets — tout en conservant le reste, permettant une édition itérative « pilotée par prompts ».

Considérations de scalabilité

Si le chaînage de grands contextes fonctionne en démo, la production exige des optimisations, comme le chargement sélectif des assets pertinents. Cela met en évidence les compromis entre capacités, coûts et performances à grande échelle.

CONCLUSION

Les progrès de l’IA multimodale permettent des pipelines de création entièrement automatisés, marquant le passage d’outils centrés sur le texte à des systèmes intégrés générant des expériences visuelles, audio et interactives complètes.

Transcription complète

Sur le même sujet : Google