Cours
On disait que 2025 serait l’année des agents IA, mais à trois mois de l’échéance, j’ai plutôt l’impression que c’est celle des médias générés par l’IA, avec des sorties très populaires comme Veo 3, Nano Banana, et désormais, Sora 2.
Je voulais publier un test complet de Sora 2, comme je l’ai fait pour Veo 3, mais je n’y ai pas encore accès, même avec un abonnement ChatGPT Pro. Pour l’instant, le déploiement est très progressif, avec une priorité donnée aux codes d’invitation via la nouvelle app sociale Sora (j’y reviens juste après).
L’objectif est sans doute de pousser plus d’utilisateurs vers l’app, mais je pense que c’est une mauvaise idée dès le départ, car j’imagine que la plupart des gens veulent surtout générer des vidéos avec Sora plutôt que d’utiliser un réseau social.
OpenAI a du chemin à rattraper face au duo de Google, Veo 3 et Nano Banana, et, selon moi, ils ont mal commencé en rendant l’accès dépendant de la possession d’un iPhone aux États‑Unis ou au Canada — y compris pour celles et ceux qui paient déjà 200 $ pour un abonnement ChatGPT Pro.
Cela dit, je vais passer en revue tout ce que l’on sait à ce stade sur Sora 2 (le modèle et la nouvelle app sociale) et — parce que Meta a aussi lancé Vibes la semaine dernière, qui est en substance un flux de vidéos IA — j’expliquerai aussi pourquoi, selon moi, les entreprises d’IA accélèrent d’un coup sur les usages médias et divertissement.
Nous tenons nos lecteurs au courant de l’actualité de l’IA via The Median, notre newsletter gratuite du vendredi qui décode les infos clés de la semaine. Abonnez‑vous pour rester affûté en quelques minutes par semaine :
Qu’est‑ce que Sora 2 ?
Sora 2 n’est pas seulement un nouveau modèle vidéo — c’est aussi le nom de la toute dernière app sociale d’OpenAI. En ce moment, quand on parle de Sora, on peut donc désigner deux choses distinctes :
- Sora 2, le modèle, qui génère de la vidéo et de l’audio à partir de prompts texte (comme Veo 3), et
- Sora, l’app sociale, une nouvelle plateforme iOS sur invitation uniquement, qui permet de remixer des vidéos avec l’apparence d’autres personnes, de découvrir du contenu dans un flux, et de partager des clips générés par l’IA.
Les deux sont étroitement liés, puisque l’app fonctionne avec le modèle Sora 2, mais leurs objectifs diffèrent. Le modèle est la tentative d’OpenAI de proposer un système de génération vidéo et audio polyvalent. L’app est une expérimentation : que se passe‑t‑il si l’on ajoute une couche sociale, courte et remixable, par‑dessus cette capacité ?
Nous allons détailler les deux dans les sections suivantes. Mais commençons par la star du moment : Sora 2, le modèle vidéo.
Sora 2 : le modèle vidéo
La première chose qui m’a frappé avec Sora 2, c’est que l’équipe d’OpenAI semble avoir enfin maîtrisé la sortie audio native — qui était jusqu’ici l’un des arguments phares de Veo 3. Sora 2 peut générer dialogues, ambiances sonores et effets en même temps que l’image, sans avoir à recoller des pistes a posteriori.
Au‑delà de ça, le modèle promet plusieurs autres améliorations. Passons en revue chaque avancée annoncée et examinons quelques exemples de façon critique.
Plus fidèle à la physique
Sora 2 est censé mieux comprendre des notions comme le poids, l’équilibre, la permanence des objets et la causalité. Si quelqu’un rate un tir au basket, le ballon doit rebondir sur l’arceau — et non se téléporter magiquement dans le panier comme on l’a vu avec d’anciens modèles. Analysons cet exemple :
La dynamique physique paraît assez convaincante pendant la majeure partie de la vidéo, mais si vous regardez les toutes dernières images (les 0,5 seconde finales), vous verrez que les jambes du skateur s’étirent dans une forme impossible, presque déformée.
Quand le chat tombe de la tête du skateur, la chute semble sans poids et peu naturelle. Puis, à la toute fin, le chat effectue une pirouette impossible.
Autre gros problème : on a une continuité sonore sans continuité visuelle. En écoutant l’animateur au micro dans l’arène, on comprend que l’action et le temps sont continus, car il n’y a pas de coupe audio, mais la vidéo de 10 secondes est en réalité composée de trois plans distincts, manifestement tournés à des moments différents. Il est clair pour moi que Sora 2 ne maîtrise pas encore les règles élémentaires du montage.
Capable de simuler l’échec
Autre amélioration subtile (mais très utile) : Sora 2 peut désormais générer des ratés crédibles. Les modèles plus anciens rendaient surtout des actions réussies — on atterrit toujours le saut, on marque toujours le but. Sora 2 tente de simuler l’échec, ce qui est plus difficile qu’il n’y paraît. Pour l’IA, « se tromper » de manière réaliste exige souvent un modèle interne plus fin de la physique et des comportements humains.
Voyons un exemple :
J’aime assez cette vidéo : elle parvient presque à me convaincre que la chute est réelle. La seule chose qui casse l’illusion, c’est l’équilibre impossible vers la fin. On peut en débattre, mais je pense que l’homme aurait dû tomber bien plus tôt.
Cela dit, la capacité à générer des erreurs ouvre beaucoup de possibilités. Le cas d’usage le plus évident : lorsqu’il faut filmer une cascade dangereuse. Plutôt que de mobiliser une vraie personne, on pourrait tenter l’IA pour éviter les complications et réduire aussi le budget.
Meilleure continuité
OpenAI affirme que Sora 2 suit des prompts complexes sur plusieurs plans tout en conservant le même personnage, la même lumière et un état du monde cohérent. Si vous demandez à un homme en veste rouge d’entrer dans un bâtiment, de descendre un couloir, puis de prendre un journal sur un bureau, la veste doit rester rouge, le couloir identique, et on ne doit pas voir apparaître soudain deux journaux ou trois bras.
Voici l’exemple le plus pertinent que j’ai trouvé pour cette fonctionnalité :
Cet exemple condense six plans en une seule vidéo de 10 secondes, ce qui est impressionnant. Ce qui porte vraiment la continuité, c’est le son : les bruits de fond, les feux d’artifice et les dialogues sont remarquablement bien générés. Je ne peux pas juger la sémantique car je ne comprends pas la langue parlée, mais d’un point de vue acoustique, ça fonctionne.
En revanche, dès que l’on regarde l’image de plus près, ça se brouille. La distance entre les personnages varie trop — parfois éloignés, puis soudain mains presque jointes quelques secondes plus tard. La caméra franchit l’axe de manière qui semble aléatoire, rendant la géographie de l’espace et la position des personnages difficile à comprendre.
Cela étant, la constance des visages est impeccable, donc je crédite le modèle sur ce point. L’éclairage est aussi cohérent, et l’étalonnage noir et blanc tient sur l’ensemble des plans.
Souple côté style
OpenAI affirme que le modèle passe avec fluidité entre des styles réalistes, cinématographiques et animés — y compris l’anime — tout en préservant le mouvement et l’identité. Utile pour les créateurs qui veulent un rendu stylisé sans perdre totalement la main sur la scène.
Je dois dire que c’est peut‑être l’exemple que je préfère parmi tout ce qui a été montré. Il y a des choses qui fonctionnent et d’autres moins, mais sur le plan narratif, la scène est très belle, à mon avis, surtout parce qu’elle a une dynamique émotionnelle qui tient la route.
Le monde autour des protagonistes est joyeux : on dirait une fête nocturne, les feux d’artifice illuminent le ciel, l’ambiance est à la célébration. Mais au milieu de tout cela, les deux personnages principaux semblent avoir une conversation très difficile — on a l’impression qu’ils sont au bord d’une rupture irréversible.
Je ne comprends pas la langue, donc je ne peux pas dire précisément ce qui se dit, mais le ton émotionnel passe clairement. La musique est très bien choisie — légèrement entraînante, en phase avec le décor — et le gros plan final, avec le reflet des feux d’artifice dans les yeux du personnage féminin, scelle vraiment l’intention.
Si j’avais une réserve, ce serait que les gens autour d’eux ne bougent pas du tout. Mais cela peut aussi être un choix volontaire : une vision subjective de la scène, où le monde s’arrête un instant, tant ils sont absorbés par leur propre tension — subjectivement, le monde extérieur n’existe plus.
Je vous recommande aussi de consulter notre guide sur l’un des concurrents les plus solides de Sora, le Seedance 2.0 de ByteDance.
Sora : l’app sociale
En parallèle du modèle, OpenAI a aussi lancé une nouvelle app iOS, Sora, qui ajoute une couche sociale complète à l’expérience de génération vidéo. Pour l’instant, c’est la principale voie d’accès à Sora 2 — et, pour le moment, c’est sur invitation et limité aux utilisateurs aux États‑Unis et au Canada.
J’imagine qu’OpenAI veut observer ce qui se passe quand les gens se remixent entre eux, s’insèrent dans des scènes et traitent la vidéo IA comme un langage social. Est‑ce que cela deviendra le nouveau TikTok ? C’est une autre question (je pense que la probabilité est nulle), mais la mécanique est intéressante.
Comment fonctionne l’app sociale Sora
Au cœur, Sora est une plateforme à flux, pensée pour la vidéo IA remixable. Vous faites défiler de courts clips générés par d’autres utilisateurs, dont beaucoup incluent l’apparence de personnes réelles via un système appelé cameos (j’y reviens ci‑dessous). Pour créer le vôtre, vous pouvez soit rédiger un nouveau prompt, soit remixer une vidéo existante en utilisant le cameo de quelqu’un — avec son autorisation.
Vous pouvez « aimer », remixer, repartager ou suivre des utilisateurs comme sur tout réseau social. Le flux est personnalisé, mais OpenAI indique ne pas optimiser le temps de visionnage. À la place, ils affirment privilégier la création et l’inspiration, et ont ajouté des contrôles de bien‑être, dont des limites quotidiennes de génération pour les adolescents et des réglages parentaux via ChatGPT.
L’app inclut aussi un système de recommandation piloté en langage naturel, ce qui permet d’orienter le contenu que vous voyez en anglais simple (par ex. « montrez‑moi des vidéos drôles avec des animaux » ou « moins de contenu surréaliste »).
Fonctionnalités Cameo
C’est sans doute la nouveauté la plus marquante. Les cameos vous permettent d’enregistrer un court clip unique vidéo et audio de vous‑même, que le modèle utilise ensuite pour générer une ressemblance corps entier — voix, apparence, expressions, tout y est. Une fois votre cameo vérifié et téléversé, vous pouvez vous insérer dans n’importe quelle scène ou autoriser vos amis à vous remixer dans la leur.
OpenAI présente le système comme vous laissant le contrôle permanent de votre image :
- Vous décidez qui peut utiliser votre cameo.
- Vous pouvez révoquer l’accès ou supprimer toute vidéo où vous apparaissez.
- Vous pouvez consulter toutes les vidéos (brouillons compris) où figure votre ressemblance.
Le système est astucieux, mais il soulève aussi beaucoup de questions — sur le consentement, le droit d’auteur, la modération et la mise à l’échelle. OpenAI dit constituer des équipes de relecture humaine pour traiter les cas limites comme le harcèlement, et impose des permissions plus strictes pour les publics jeunes.
Pourquoi cet engouement soudain pour les médias générés par l’IA ?
Comme l’a récemment souligné un rapport de Stanford, l’IA n’a pas encore bouleversé tant d’industries — à une exception près : les médias.

Source : State of AI in Business 2025 Report
Je ne pense pas que ce soit un simple artefact statistique. J’ai échangé directement avec des producteurs publicitaires, et ils prennent ce virage très au sérieux. Beaucoup expérimentent activement l’IA pour réduire les coûts de production, accélérer les délais et éviter les casse‑têtes logistiques des tournages.
La tendance est visible publiquement. Parcourez LinkedIn n’importe quel jour, et vous verrez des créateurs publier des courts‑métrages, des pubs et des bandes‑annonces conceptuelles générés par l’IA. Un bon exemple est cette pub Kalshi — une vraie campagne pour une vraie entreprise — produite entièrement avec l’IA :
C’est pourquoi je pense que des acteurs comme OpenAI, Google et Meta accélèrent d’un coup sur les médias générés par l’IA. S’il y a un domaine où l’IA générative est déjà utile — et où l’on dépense temps et argent — c’est bien celui‑ci. Il est donc logique que les labos se précipitent pour bâtir des plateformes, des écosystèmes et des couches sociales autour de la vidéo.
La semaine dernière, Meta a lancé Vibes, un nouveau flux de vidéos courtes générées par l’IA, qui semble viser le même créneau que l’app Sora d’OpenAI. Le schéma est clair : capitaliser maintenant sur les médias et le divertissement, tant que la technologie n’est pas encore assez fiable pour bousculer d’autres secteurs plus réglementés comme la santé ou la finance.
En bref, la vidéo est le fruit le plus accessible — et tout le monde tente de le cueillir en premier.
Conclusion
Sans perdre l’esprit critique, il faut reconnaître les progrès réalisés par ces modèles d’IA. Souvenez‑vous qu’au début de 2023, le mieux que l’on avait, c’était la vidéo Will Smith mangeant des spaghettis . Aujourd’hui, on parle d’audio natif, de continuité émotionnelle et d’apps sociales de remix à grande échelle où vous pouvez vous projeter dans un duel à l’épée sur un navire pirate ou une émission de cuisine surréaliste présentée par votre chien.
Cela dit, Sora 2 peine encore avec la cohérence spatiale, la logique de montage de base et un réalisme physique subtil. Et la décision d’OpenAI de verrouiller l’accès derrière une app iOS sur invitation n’aide pas vraiment son image auprès des pros en quête d’outils sérieux. Il y a du potentiel, mais aussi des frictions.
Une chose est sûre : les médias générés par l’IA sont à surveiller de près.
FAQ
Comment accéder à Sora 2 avec un abonnement ChatGPT Plus ou Pro ?
Beaucoup d’utilisateurs sur X et Reddit, déjà abonnés à OpenAI, sont frustrés par le déploiement par vagues, qui priorise les gros utilisateurs de Sora 1 avant d’étendre aux offres Plus et Pro. Si vous êtes sur Pro, guettez une notification push dans l’app ChatGPT ou connectez‑vous sur sora.com : l’accès devrait bientôt débloquer des générations illimitées en 720p/10 s, avec le mode 1080p/20 s « Sora 2 Pro » pour Pro. Les abonnés Plus bénéficient d’avantages similaires mais avec des files d’attente possibles ; l’offre gratuite propose des essais généreux mais limités. Sans invitation pour l’instant ? La demande est forte — attendez‑vous à des vagues au cours de la semaine, d’abord aux États‑Unis et au Canada avant un déploiement mondial.
Quelles sont les limites de génération et les tarifs de Sora 2 ?
Les limites de génération font débat, certains sur X jugeant floues les « limites généreuses » d’OpenAI ; les utilisateurs gratuits subissent des temps d’attente (p. ex., une génération toutes les 15 minutes), tandis que Plus offrirait des générations standard illimitées et Pro des rendus plus rapides et en plus haute définition, sans plafonds. Sur Reddit, on suppose que les coûts de calcul réservent les vidéos plus longues (au‑delà de 20 s) aux offres premium, mais pas de paywalls stricts pour l’instant — c’est gratuit au lancement, avec des options payantes pour des extras comme les rendus en lot. Surveillez votre tableau de bord pour des quotas en temps réel, car ils s’ajustent selon l’usage.
Sora 2 est‑il disponible en dehors des États‑Unis et du Canada ?
L’app iOS et l’accès complet ont d’abord été lancés aux États‑Unis et au Canada le 30 septembre 2025, mais OpenAI prévoit une expansion mondiale rapide — des utilisateurs de l’UE indiquent déjà un accès bêta via ChatGPT Pro, avec d’éventuels contournements VPN pour télécharger l’app. Consultez le centre d’aide d’OpenAI pour l’état de votre pays ; les délais proviennent de contraintes liées aux lois sur la protection des données, mais la plupart des régions devraient être couvertes en quelques semaines.
Comment Sora 2 se compare‑t‑il à Veo 3 ou Runway ?
Sur X, les comparaisons le confrontent à Veo 3 de Google (meilleur sur la longueur brute) et à Runway (meilleurs outils d’édition), mais Sora 2 l’emporterait sur la fidélité physique, la cohérence des personnages et l’audio intégré — des utilisateurs disent que cela ressemble à un « simulateur de monde » pour des histoires cohérentes. Sur Reddit, on note que Veo garde une avance en 4K, mais la contrôlabilité de Sora (multi‑plans, styles) et son app sociale le rendent plus ludique et accessible. Bémols : des rendus plus lents et un plafonnement à 720p pour l’instant. En somme, c’est l’état de l’art pour le réalisme, mais la course est serrée — testez les démos pour vous faire une idée.
Je suis rédacteur et écrivain et je couvre les blogs, les tutoriels et les actualités sur l'IA, en m'assurant que tout est conforme à une stratégie de contenu solide et aux meilleures pratiques en matière de référencement. J'ai rédigé des cours de science des données sur Python, les statistiques, les probabilités et la visualisation des données. J'ai également publié un roman primé et je consacre mon temps libre à l'écriture de scénarios et à la réalisation de films.
