Il n'en reste pas moins vrai que l'utilisation conjointe de plusieures IA spécialisée reste (encore) souvent requise.
L'interface utilisateur qui s'impose de plus en plus est la voix.
Un grand classique de l'IA, popularisé notamment par Siri (2011) ou Alexa (2014) pour les instructions par reconnaissance vocale, la reconnaissance de la voix.
Le traitement automatique du langage permet aux systèmes informatiques d'analyser et de produire du langage humain. Les approches ont évolué des systèmes fondés sur des règles vers l'apprentissage statistique puis les réseaux de neurones et les grands modèles de langage.
L'application GoSpeech permet de générer le texte d'un fichier audio enregistré (limité à 3 fichiers de 10 minutes chacun en version gratuite).
Amazon Transcribe Medical est un outil permettant aux professionnels de la santé d'enregistrer rapidement et efficacement des conversations cliniques dans des systèmes de dossiers de santé électroniques à des fins d'analyse. Par exemple, dans le secteur bancaire, la synthèse vocale est utilisée via un service client activé par la voix. Dans le secteur de la santé, la synthèse vocale contribue à améliorer l'efficacité en fournissant un accès immédiat aux informations et en saisissant des données.
Il est possible de procéder à la reconnaissance de texte d'un fichier audio directement dans une IA.
La taille des fichiers est souvent limitée, moins de 25 Mo et le nom ne doit pas comprendre d'espace.
Si le fichier fait plus de 25 Mo, vous pouvez le reduire via audacity en l'enregistrant avec les paramètres de qualité minimaux et/ou en le découpant en morceaux (même chose mais sur les sélections).
Le site turboscribe.ai permet la transcription
de 3
fichiers de 30 minutes maximum par jour.
Procède à la reconnaissance de texte de ce fichier audio.
Un exemple de fichier transcrit sur le droit des robots.
Ce fichier peut ensuite être analysé, résumé, etc.
Dicet.ai est un assistant de réunion IA souverain.
Dicte crée des comptes-rendus automatiques sur la base des échanges enregistrés en réunion ou de notes vocales personnelles.
Dicte offre un enregistrement, une transcription et un traitement fluides des discussions en réunion, rendant chaque réunion plus productive et accessible, le tout avec identification des intervenants, .
120 min / mois gratuites.
Processus inverse, il s'agit de faire parler la machine en lui soumettant un texte. Rire et voix d'enfants sont les plus difficile à reproduire.
Les résultats sont de plus en plus convaincants.
Voici le texte qui est proposé, ensuite enregistré via un téléphone.
Dans la série des outils d'OpenAI, Whisper est un système de reconnaissance vocale automatique passé en opensource (ASR) formé sur 680 000 heures de données supervisées multilingues et multitâches collectées sur le Web.
Whisper est le nom du réseau de neurones utilisé. Il est proposé sur github pour les codeurs.
Dans le même esprit, assemblyAI propose une API très simple aux codeurs. Avec quelques lignes de code, par exemple en Python avec vos élèves, un fichier son peut lui être fournit en entrée pour disposer de sa transcription en sortie.
Voir également elevenlabs.io/.
Dans l'exemple ci-dessous, les voix ont été entrainées à partir d'échantillons divers notamment en chinois. Le plus difficile, reproduire les voix des enfants ou les rires. Un comédien peu donc produire tout seul toutes les voix.
Entrainer les modèles de voix à partir des échantillons nécessite de grosses puissances de calculs (confiées aux cartes graphiques) ou via la location d'une instance de machine virtuelle en ligne. L'écriture du scénario est assistée par un moteur de développement de jeux vidéos.
Whisper va générer automatiquement les sous-titres.
Les voix, notamment, mais aussi les illustrations sont générées par l'IA et/ou des "Modificateur de voix".
Le résultat peut être "écouté" en cliquant sur l'image ci-dessous. Tales Audio propose des fictions audios immersives sur le thème du fantastique, de l'horreur et de la SF.
Perplexity propose désormais un podcast sur les derniers développements en matière de technologie, de science et de culture. Discover Daily vous tient informé des tendances et des idées qui façonnent notre avenir en s'appuyant sur la recherche de Perplexity et la voix IA d'ElevenLabs.
Le site voicemod permet de générer une musique à partir de n'importe quel texte en sélectionnant une voix, un style etc.
Il est donc désormais possible de faire de la musique générative à partir de :
Voir également
Une IA qui extraie les instruments, voix et sons d'un fichier sonore.
Certains modèles peuvent encore produire des résultats différents selon la langue du prompt. L'anglais peut parfois être avantageux pour certains modèles ou styles, mais il n'est plus pertinent d'en faire une règle générale.
La technique évolue, les déceptions restent. Deux exemples.
L'on précisera donc pour un prompt image :




Le sitenightcafepropose des crédits gratuits pour réaliser des images à partir de différents modèles Stable Diffusion, SDXL.
L’approche guidée par CLIP avecdream.aiest un réseau de neurones open source créé par l’équipe de recherche d’OpenAI.
Un sérieux concurrent de Midjourney, 100 images gratuites par jour au moment de la rédaction.
Les images peuvent également être retouchées, et cela même uniquement par la voix pour certaines IA.
Note. Le cours de bourse était faux à la date de génération.
Le slop
est un média de mauvaise qualité, comprenant des textes , des sons et des images, réalisé à
l'aide d'une technologie d'intelligence artificielle générative. Inventé dans les années 2020,
le terme a une connotation péjorative proche de celle de « spam ».
“Contrairement à un robot conversationnel”, affirme The Guardian, le slop n’est pas interactif et
il est rarement destiné à répondre aux questions des internautes ou à leurs besoins.
“Au lieu
de cela, précise le quotidien, il existe principalement pour donner l’apparence d’un contenu
créé par l’humain, générer des revenus publicitaires et orienter l’attention des moteurs de
recherche vers d’autres sites.”
Tome permet de faire une présentation assistée par ordinateur. Après avoir sélectionné un "template", une série de "slides" préremplies sont proposées. Vous pouvez y adjoindre des vidéos, du texte à l'instar de toute autre présentation assistée (genially, Google slide, Power point, Prezi ou Beautiful.ai par exemple).
Offre gratuite variable — vérifier les conditions actuelles du service.
Les vidéos ci-dessous sont générées à partir du script suivant :
Vidnoz
Pictori
Bon ! Tel que cela a surtout le mérite d'être drôle.
Dans la réalité, comme pour un vrai film, il faut découper une histoire en plans, prévoir un storybord, donner des indications de lumières etc. Si l'IA peut aider, l'on n'en est pas encore -pour l'instant- à placer une caméra à l'endroit que l'on souhaite, avec l'angle que l'on choisit etc.
Ce premier scenario est enrichi.
Les images de deux personnes et deux animaux ont été générées et servent de modèles.
DESCRIPTION DES SCÈNES
Iatu : femme élégante, cheveux bruns ondulés courts, lunettes rondes, allure très maîtrisée façon espionne sophistiquée des années 50.
Iago : homme aux cheveux poivre-et-sel, moustache fine, costume trois pièces impeccable, présence calme et froide d’un agent des services secrets des années 50.
Taille : même taille, démarche assurée, duo parfaitement synchronisé.
Le Lama : adorable… mais l’air clairement un peu bête, regard vide mais enthousiaste, talent olympique du crachat.
Le poulet : c'est le pilote du biplan. Un poulet à plumes, un peu rigolo avec des lunettes de soleil.
Scène 1
Iago et Iatu marchent côte à côte le long des quais de la Seine à Paris, tenus droits comme deux
espions en mission.
Ils portent tous les deux des vêtements inspirés des agents secrets des années 50 :
costumes
sombres, silhouettes élégantes, allure sérieuse.
Entre eux, un lama tenu en laisse avance en zigzaguant, l’air vaguement stupide, les oreilles
molles.
À intervalles réguliers, il s’arrête pour cracher au pied des arbres, sans aucune forme de
respect
pour la capitale.
La lumière du matin se reflète sur la Seine, ambiance calme… sauf pour le lama.
Scène 2
Soudain arrive un avion, un vieux biplan des années 30 qui pétarade. Un vieux biplan des années
30,
brinquebalant et pétaradant, arrive en rase-mottes au-dessus du quai.
Aux commandes : un poulet, un vrai, affublé d’énormes lunettes d’aviateur rondes et d’une
écharpe
flottant au vent.
Le moteur tousse, l’avion tremble, mais le pilote semble… terriblement concentré pour un
gallinacé.
Scène 3
Voyant le biplan approcher, le lama relève soudain la tête, plisse
ses
yeux mi-idiots mi-déterminés, prend une grande inspiration… et tente de cracher en direction de
l’avion.
Le jet rate bien sûr.
Le poulet, vexé (probablement), ouvre la trappe latérale du biplan et jette un œuf en piqué.
L’œuf traverse l’air comme un projectile parfaitement calculé, frappe le lama en pleine tête et
éclate.
De la coquille jaillit un petit papier roulé qui s’envole.
Sur le billet : “iago.re” écrit à la main.
Scène 4
Danse de victoire du poulet sur l'aile de biplan.
Scène 5
Gros plan sur la tête du Lama avec l'oeuf écrasé. Les restes d'œuf
dégoulinent lentement sur son poil. Il fulmine et prépare
sa réaction. Son expression hésite entre la surprise totale et le vide intersidéral.
Un moment de cinéma.
Scène 6
Le poulet revient, le lama crache une boule rouge dans l'hélice,
l'avion
s'écrase, le
poulet nage vers la berge.
Scène 7
Les deux personnages marchent le long de la Seine, vue de dos, IaTu
tient
le Lama en laisse
IaGo le poulet. Au loin c'est Paris plage.
VideoGen génère 7 plans avec un avion qui n'a rien d'un biplan et plein de faux raccorts…
Canva est assez généreux en vidéos grauites (50) et génère 1 plan de biplan…
KlingAI génère un joli plan de 10 secondes en intégrant l'avatar de IaGo et un biplan…
higgsfield.ai permet d'ajouter des effets spéciaux…
Ou comment créer une image à partir d'un simple dessin au crayon, ci-dessous avec un hamac (désolé pour la piètre qualité du dessin original, mais après tout il s'agit d'un test).

A
partir d'un simple dessin au crayon,
il est possible de générer des intérieurs complets, par exemple une cuisine, un salon, ou alors des
paysages et de les faire varier à l'infini.
Pour tous ces sites un compte est obligatoire, à part pour canva, ils ne font aucune propositon "éducation", ce sont donc les tests gratuits qui ont été utilisés.
Maintenant si le hamac n'est pas le sujet, vous pouvez également le générer dans n'importe quel contexte.






Outre les solutions dédiées aux codeurs et désormais intégrables dans les éditeurs de code, par exemple Github Copilot ou codium ou même les solutions de type "nocode" type Zapier.com, n8n ou make, il est toujours possible de demander une sortie en code (html, javscipt, python).
Claude la propose d'ailleurs directement.
Génère le code html de cette maquette
Des outils de type Napkin permettent d'insérer directemt une illustration à partir d'un texte. Cette illustration est modifiable.
napkin

Autre exemple avec canva (edu) qui génère à la fois un texte mais aussi un shéma.
Procède à l'analyse émotionnelle de cette photo

La photo montre une salle de classe remplie d'élèves, principalement jeunes, assis à leurs pupitres en bois. L'ambiance générale semble sérieuse et studieuse.
Un enfant au premier plan, regardant vers le haut et légèrement à droite, semble pensif ou concentré. D'autres enfants semblent attentifs au cours, tandis que certains ont une expression neutre. Il n'y a pas d'indications claires d'émotions fortes comme la joie exubérante, la tristesse ou la colère.
L'environnement suggère un cadre éducatif formel.
Une IA multimodale peut produire une interprétation d'une expression faciale ou d'une scène. Mais cette description ne constitue pas une mesure fiable de l'état émotionnel d'une personne.
En effet, « semble triste », « paraît concentré » ou « semble en colère » sont des inférences, pas des observations directes de l'émotion.
Une expression faciale n'est pas une preuve de l'état émotionnel.
Le règlement européen sur l'intelligence artificielle (AI Act) du 13 juin 2024 prévoit des obligations pour les fournisseurs de systèmes d'IA à des fins générales (GPAI) et interdit certains systèmes d'IA attentatoires aux droits fondamentaux.
La reconnaissance des émotions sur le lieu de travail et les établissements d'enseignement, sauf pour des raisons médicales ou de sécurité est interdite.
Ce nouveau rendez-vous mensuel explore la création IA et questionne ses limites, usages et conséquences.
Les deux premiers épisodes ci-dessous.