GLM 5.2 Release Video [Made with GLM 5.2]
GLM 5.2 génère des vidéos via Remotion, comparable à Fable mais inférieur à Gemini 3.1 Pro. Surcharge serveurs observée sur OpenRouter avec timeouts sur sorties longues.
La génération de vidéos par IA désigne la création automatique de séquences animées à partir d'un texte, d'une image ou d'un son. Sora (OpenAI) est un exemple de modèle capable de produire des clips réalistes depuis une simple description textuelle.
GLM 5.2 génère des vidéos via Remotion, comparable à Fable mais inférieur à Gemini 3.1 Pro. Surcharge serveurs observée sur OpenRouter avec timeouts sur sorties longues.
OpenMontage est un système de production vidéo open-source et agentic avec 12 pipelines, 52 outils et 500+ compétences d'agent. Transforme un assistant de codage IA en studio de production vidéo complet.
OpenMontage est un système de production vidéo open-source et agentic avec 12 pipelines, 52 outils et 500+ compétences d'agent. Transforme un assistant de codage IA en studio de production vidéo complet.
xAI rend accessible Grok Imagine Video 1.5, son modèle de génération vidéo capable de produire des vidéos avec audio synchronisé.
Mel AI démontre des personnages IA vidéo-natifs capables de parler, synchroniser les lèvres, réagir faciales et répondre en temps réel au contexte caméra. Le système détecte l'environnement visuel de l'utilisateur et adapte ses réactions. Cette approche dépasse le chat textuel de Character AI (fondé par d'anciens développeurs Google/LaMDA).
Mirage, un modèle vidéo de Microsoft Research, stocke les informations de scène en espace latent au lieu de nuages de points basés sur les pixels. Cela réduit le temps de calcul et la mémoire graphique tout en maintenant la cohérence spatiale lors de mouvements de caméra longs. Le suivi d'objets en mouvement reste limité.
Nouvel article arXiv présentant MINARD, un système de génération vidéo qui transforme les figures scientifiques en vidéos narratives avec annotations régionales. Le pipeline génère des narrations ancrées au papier et les aligne séquentiellement aux régions de la figure. Benchmark FigTalk inclus avec métriques d'ancrage au niveau composant.
Méthode d'allocation adaptative de tokens vidéo exploitant la redondance temporelle dans l'espace latent d'un tokeniseur gelé. Un seuil fixe sur les différences L1 temporelles identifie les positions redondantes; un Latent Inpainting Transformer (LIT) les reconstruit. Pipeline efficace: 31× plus rapide qu'ElasticTok-CV, 2× qu'InfoTok sur TokenBench et DAVIS.
Google DeepMind lance Gemma 4 12B, un modèle multimodal unifié sans encodeur dédié. Le modèle traite texte, images et vidéo dans une architecture unique, optimisé pour l'inférence sur appareils.
Hugging Face présente Room360, une plateforme de reconstruction 3D spatiale à partir de vidéo. L'outil convertit des séquences vidéo en modèles 3D exploitables pour applications immersives et architecturales.
NVIDIA lance Nemotron 3.5 Content Safety, un modèle de sécurité multimodal open-source pour détecter contenus nuisibles (texte, image, vidéo). Personnalisable pour entreprises globales, il offre contrôle granulaire des politiques de modération selon régions et cas d'usage.
NVIDIA lance Cosmos, une plateforme ouverte de modèles du monde physique, datasets et outils pour développer des systèmes d'IA physique destinés aux robots, véhicules autonomes et infrastructures intelligentes.
Pixelle-Video est un moteur de génération vidéo automatisé basé sur l'IA. Le projet GitHub propose une solution complète pour créer des vidéos courtes sans intervention manuelle.
xAI lance grok-imagine-video-1.5-preview, un modèle image-vers-vidéo générant des vidéos cinématiques jusqu'à 720p à partir d'images fixes et de prompts texte. Plusieurs clips peuvent être assemblés en scènes plus longues.
Grok Imagine Video 1.5 de xAI est disponible sur AI Gateway. Le modèle génère des vidéos à partir d'une image avec audio synchronisé en une seule passe. Améliorations : qualité audio, suivi des prompts, photorealisme, cohérence des caractères sur séquences longues, support étendu des images de référence.
NVIDIA publie Cosmos 3, une collection de modèles omnimodaux (Nano 16B, Super 64B) capables de générer vidéo, image, audio et commandes d'action à partir de texte, image, vidéo et trajectoires. Disponible sur Hugging Face pour applications Physical AI.
GEM est une méthode d'effacement de concepts pour les modèles Rectified Flow Transformers. Elle combine des signaux de trajectoire (Generative Flow Networks) et un guidage par enseignant pour supprimer sélectivement les contenus nuisibles (deepfakes, violations de copyright) tout en préservant la génération bénigne.
NVIDIA annonce Cosmos 3 (modèle vidéo), Nemotron 3 Ultra (LLM optimisé) et RTX Spark. Jensen Huang revendique une victoire majeure pour l'entreprise.
Ethan He, responsable de Grok Imagine chez xAI, explique le développement du modèle de génération vidéo en 3 mois, compare l'approche vidéo aux modèles du monde, et argumente pourquoi les agents vidéo sont la prochaine frontière.
Nvidia lance à GTC Taipei trois modèles pour l'IA physique : Cosmos 3 (world model), Alpamayo 2 Super (modèle de conduite autonome amélioré) et une plateforme de référence ouverte pour robots humanoïdes.
Google corrige des bugs dans les limites d'utilisation de Gemini : une vidéo Omni consommait la totalité du quota. Les membres Ultra obtiennent désormais deux fois plus de générations vidéo, les requêtes échouées ne sont plus facturées, et Google prévoit plus de transparence.
Amazon MGM Studios et AWS lancent un fonds pour créateurs IA et une plateforme interne « Project Nara ». Trois séries animées sont en production avec des délais de cinq semaines pour les pilotes. Amazon revendique le seul écosystème de contenu IA end-to-end du secteur.
Utilisation de modèles de diffusion pour simuler des trajectoires de basketball conditionnées par des esquisses partielles de mouvements. Le modèle affine conjointement les trajectoires de tous les joueurs, produisant des simulations plus naturelles qu'une génération autoregressive. Code et modèle open-sourcés.
YouTube déploie un système de détection automatique pour signaler les contenus générés ou fortement modifiés par l'IA à partir de mai 2026. Les labels seront affichés de manière plus visible : sous le lecteur pour les vidéos longues et en overlay sur les Shorts. Les recommandations et la monétisation ne seront pas affectées.
YouTube impose des labels visibles pour identifier les vidéos générées par IA. Cette mesure vise à améliorer la transparence et aider les utilisateurs à distinguer le contenu authentique du contenu synthétique.
MoneyPrinterTurbo : outil open-source générant des vidéos courtes haute définition en un clic via modèles IA. Automatise la création de contenu vidéo.
MoneyPrinterTurbo : outil open-source générant des vidéos courtes HD en un clic via modèles IA. Automatise la création de contenu vidéo.
Les modèles de diffusion vidéo autorégressifs utilisent un cache KV quantifié pour réduire la mémoire, mais la quantization crée un biais d'attention (Jensen bias) qui dégrade la qualité. Les auteurs proposent une correction per-attention-score calculée à partir des pas de quantization, récupérant la qualité perdue avec INT2 tout en utilisant 50% moins de mémoire qu'INT4.
Tail-Aware HiFloat4 applique la quantification post-entraînement W4A4 au modèle Wan2.2 de génération vidéo texte. La méthode adapte ViDiT-Q en utilisant le format HiFloat4, quantifie les couches linéaires du transformer, préserve les modules sensibles en haute précision, et introduit un calibrage percentile conscient des queues d'activation pour réduire l'impact des valeurs aberrantes.
Créateurs ont produit une bande-annonce de film de braquage cinématographique en combinant 4 modèles IA pour 60 dollars. Démonstration de faisabilité de production vidéo IA à bas coût.
Un court-métrage présenté à Cannes a coûté 500 k$ à produire, dont 400 k$ en calcul IA. Le ratio révèle l'importance croissante des coûts d'infrastructure pour la génération vidéo et contenu créatif.
Meituan annonce LongCat-Video-Avatar 1.5, framework open-source pour la génération vidéo d'avatars humains pilotée par l'audio. Remplace Wav2Vec2 par Whisper-Large, supporte Audio-Text-to-Video et Video Continuation avec inférence en 8 étapes. Évaluation humaine sur 508 paires image-audio couvrant 6 scénarios et 2 langues.
xAI lance Grok Imagine Video 1.5, capable de transformer une image statique en clip court avec audio synchronisé en une seule passe. Guide d'utilisation pour optimiser les résultats.
PRISM est un benchmark de 10 372 paires instruction-code pour l'évaluation de la génération vidéo programmatique par LLM. Il propose 4 métriques : fiabilité du code, cohérence spatiale, complexité visuelle et densité temporelle. L'évaluation de 7 LLM révèle un écart d'exécution-spatial de 41% : le code exécutable ne garantit pas une sortie visuellement cohérente.
Google dévoile Gemini Omni lors de sa conférence I/O 2026, une IA vidéo capable de maîtriser la physique et de maintenir la cohérence des personnages dans les générations vidéo.
ByteDance publie Lance, un modèle multimodal open-source de 3B paramètres actifs. Supporte génération/édition d'images et vidéos dans un seul framework. Entraîné from scratch sur 128 A100-GPU.
Hyperframes est un framework permettant aux agents IA de générer du contenu vidéo via HTML. Outil conçu pour automatiser la création vidéo dans les workflows d'agents.
ViMax est un système de génération vidéo agentique intégrant directeur, scénariste, producteur et générateur vidéo. Le projet GitHub propose une architecture multi-agents pour orchestrer la création vidéo de bout en bout.
Focused Forcing optimise les caches KV dans la génération vidéo diffusion autorégressive en sélectionnant par frame et par head les frames historiques pertinents. La méthode combine scores d'attention et scores de diversité, atteignant 1.48× d'accélération sans entraînement tout en améliorant la qualité visuelle et l'alignement textuel.
ANVIL est un système génératif multimodal qui automatise la création d'animations pédagogiques basées sur des analogies pour l'informatique. À partir d'une définition de concept, il génère une analogie textuelle, la compile en scénario visuel structuré, et produit du code manim exécutable. Évaluation via études enseignants et utilisateurs.