Problème
Les produits multimodal impliquent souvent une compréhension égale entre les médias tout en s’appuyant principalement sur des interfaces linguistiques et des composants spécialisés inégaux. Cela masque ce que le système perçoit, quelles transformations se produisent et où les preuves sont perdues.
Présentation
La culture humaine est multimodale. Une version musicale peut comprendre des enregistrements, couvrir l’art, la typographie, les notes, les séquences de performance et les métadonnées. Une archive de recherche peut combiner des documents, des photographies, des diagrammes, des entrevues et des mesures de capteurs. Une oeuvre d’art numérique peut répondre simultanément au mouvement, au son et au langage.
L’IA multimodale tente d’apprendre ou d’opérer à travers ces différentes formes. Un système peut récupérer une image à partir d’une phrase, transcrire la parole, décrire la vidéo, générer du son à partir de texte, répondre à des questions sur un diagramme ou aligner un événement audio sur une chronologie visuelle. Le label large cache de nombreuses architectures et des capacités inégales.
La question la plus importante n’est pas de savoir si un modèle accepte plusieurs types de fichiers. C’est ainsi que chaque modalité est représentée, que les relations sont apprises, que l’information est perdue et que le rendement est évalué. Un modèle linguistique entouré d’outils spécialisés est multimodal d’une manière différente d’un modèle de bout en bout formé conjointement sur l’image, le texte et l’audio.
Ce qui compte comme modalité
Une modalité est une forme par laquelle l’information est représentée ou perçue. Le texte, l’image, l’audio et la vidéo sont des exemples communs, mais des tableaux structurés, des graphiques, des cartes de profondeur, la capture de mouvement, les coordonnées géospatiales et les signaux biologiques peuvent aussi être des modalités.
Les modalités diffèrent selon la structure. Le texte est discret et séquentiel. Les images sont des tableaux spatiaux. L’audio est une forme d’onde variable dans le temps. La vidéo combine l’espace, le temps et souvent le son. Les graphiques encodent les entités et les relations. La conversion de tous en unités de type token peut simplifier l’architecture, mais peut jeter des propriétés spécifiques à un domaine.
Les systèmes multimodal ont besoin de représentations qui préservent ce qui compte pour la tâche. La transcription des discours peut ignorer certains timbres alors que l’identification des haut-parleurs en dépend. Le sous-titrage d’image peut résumer une scène alors que l’analyse art-historique nécessite de la composition, du matériel et de la provenance.
Alignement
L’alignement relie les représentations selon les modalités. Une image et une légende appariées indiquent que deux enregistrements se rapportent au contenu connexe. Une transcription vidéo aligne les mots avec le temps. Une vidéo musicale peut aligner le rythme, l’édition et le mouvement de façon plus souple.
CLIP a démontré une approche scalable image-text en apprenant quelles légendes correspondaient aux images sur un grand ensemble de données appariées. La représentation partagée qui en a résulté a permis aux descriptions en langage naturel de récupérer ou de classer des images sans étiquette conventionnelle spécifique à une tâche.
Les espaces d’intégration partagés sont puissants parce qu’ils permettent une recherche modale. Ils sont aussi réducteurs. La proximité dit que les éléments sont liés à un objectif appris, pas ce que signifie la relation. Un graphique peut préserver des relations explicites telles que depicts, documents, soundtrackOf ou derivedFrom.
Modèles architecturaux
Un modèle utilise des encodeurs séparés. Un encodeur d’image et un codeur de texte entrées de carte dans une représentation partagée pour la récupération ou la comparaison. Cela est efficace lorsque la tâche est l’alignement plutôt que la génération ouverte.
Un second modèle ajoute un adaptateur de modalité à un modèle de langue. Les fonctions visuelles ou audio sont transformées en représentations que le modèle de langue peut traiter. Le modèle de langage devient une couche de raisonnement et de réponse, tandis que les encodeurs spécialisés gèrent la perception.
Un troisième modèle utilise un espace de token unifié et forme un modèle sur de nombreux types de médias. Cela peut supporter une génération flexible, mais nécessite des données et des calculs énormes.
Un quatrième motif est l’orchestration des outils. Un modèle linguistique appelle reconnaissance de la parole, détection d’objets, génération d’images, analyse audio ou services de traitement vidéo et combine leurs résultats. Cette architecture peut être plus inspectable car chaque outil spécialisé a une fonction définie.
Aucun modèle n’est universellement supérieur. La composition des outils peut être plus facile à évaluer et à remplacer. Les modèles de bout en bout peuvent capter les interactions qui manquent aux pipelines modulaires.
Architecture
Une architecture multimodale combine des encodeurs de modalité, des couches d’alignement ou de fusion, des représentations partagées, des décodeurs générateurs, la récupération, la mise à la terre temporelle et une interface qui expose les observations spécifiques à la source.
Texte et image
Les systèmes texte-image supportent le sous-titrage, la réponse aux questions visuelles, la recherche, la classification, l’édition et la génération. Ils peuvent rendre les collections d’images plus accessibles et permettre aux utilisateurs de spécifier des intentions visuelles par le langage.
La langue peut également dominer. Un modèle peut s’appuyer sur des repères textuels ou des stéréotypes appris plutôt que sur des preuves visuelles. Les petits textes à l’intérieur des images, les relations spatiales et le comptage exact restent difficiles pour certains systèmes. Les légendes générées décrivent souvent des objets reconnaissables tout en ignorant le style, le pouvoir, le contexte culturel ou l’incertitude.
Pour une archive, les descriptions automatiques doivent être traitées comme des métadonnées dérivées. Ils peuvent améliorer la découverte mais ne doivent pas remplacer les observations du catalogueur ou les titres fournis par le créateur. Le dossier devrait indiquer le modèle, la date et la confiance.
Audio et discours
L’audio comprend la parole, la musique, le son environnemental, le bruit et le silence. La reconnaissance de la parole cartographie les formes d’onde au texte, mais cette transformation supprime les informations sur le timbre, la salle, le rythme et l’expression non verbale. La classification audio indique les événements, tandis que la séparation des sources estime les signaux des composants. Les modèles musicaux peuvent générer ou transformer du son à partir de textes, de notations ou d’exemples.
L’écoute automatique dépend de la représentation. Les spectrogrammes transforment l’audio du domaine temporel en images de fréquence temporelle. L’intégration audio apprise peut supporter la recherche de similarité. Les détecteurs d’événements segmentent les transitoires ou les modèles. Chaque représentation évoque certaines propriétés et supprime d’autres.
ORETH fournit un contexte d’Electronic Artefacts pour ce travail. Le programme traite le son comme matériel et preuve. Un système multimodal pourrait connecter un segment audio à un spectrogramme, une note d’analyse, une référence visuelle et un dossier de projet Palimpsests. Elle devrait préserver la différence entre la mesure automatisée et l’interprétation artistique.
Vidéo et heure
La vidéo n’est pas simplement une séquence d’images indépendantes. La signification dépend du mouvement, de la durée, de l’édition, de la causalité et du son. L’échantillonnage de quelques cadres peut manquer de brefs événements ou inverser les relations temporelles. Le traitement de chaque cadre peut dépasser le contexte et calculer les budgets.
Les systèmes vidéo combinent souvent la sélection des images, l’encodage visuel, la transcription vocale et l’agrégation temporelle. Les questions peuvent nécessiter de localiser un événement, de résumer une séquence ou de connecter le dialogue à l’action.
Pour les archives culturelles, les timecodes sont une provenance essentielle. Un résumé généré doit relier les intervalles exacts. Motion, musique et typographie peuvent former une composition qui ne peut être comprise à partir de cadres isolés.
Production multimodale
Les systèmes génériques peuvent traduire entre les modalités : texte à image, image à vidéo, texte à parole, audio à notation ou geste au son. Ils peuvent également se transformer à l’intérieur d’une modalité sous la direction d’une autre.
La valeur créative ne se limite pas à la sortie automatique. Les modèles transmodaux peuvent devenir des instruments pour explorer les correspondances. Un artiste peut naviguer les images à travers des descripteurs sonores, générer du mouvement à partir d’une structure musicale ou utiliser du texte pour contrôler un système visuel procédural.
Le contrôle est un défi central. Le langage rapide peut ne pas exprimer le moment exact, la composition ou le comportement matériel. Les entrées de référence, masques, échéanciers, graphiques et contrôles de paramètres peuvent rendre le système plus modifiable. Un outil créatif devrait permettre l’itération et la sélection plutôt que de présenter la génération comme un seul clic.
Données et représentation culturelle
Les modèles multimodal dépendent de données appariées ou alignées. Les légendes peuvent être bruyantes, culturellement étroites ou optimisées pour la recherche plutôt que pour l’interprétation. Les ensembles de données à l’échelle du Web reproduisent des conditions inégales de visibilité et de droits. Les ensembles de données audio peuvent surreprésenter la parole et la musique commerciale tout en négligeant les cultures sonores locales.
La documentation des ensembles de données doit indiquer la source, la méthode de collecte, le filtrage, la langue, le consentement et les lacunes connues. Lorsque la divulgation complète n’est pas disponible, les utilisateurs en aval devraient éviter les allégations de neutralité.
Pour Electronic Artefacts, la provenance est une exigence de conception. Si un système génère un visuel à partir d’archives ou aligne un son sur des références externes, le processus devrait enregistrer les entrées, le contexte du modèle et les décisions rédactionnelles.
Évaluation par modalité
Un système multimodal a besoin de plus d’un score global. Évaluer la perception au sein de chaque modalité, l’alignement entre les modalités et la tâche finale.
Pour la réponse aux questions d’image, vérifier si la réponse dépend de la preuve visuelle plutôt que des antécédents rapides. Pour la récupération audio, la localisation des événements et les faux matches. Pour la vidéo, tester l’ordre temporel et la précision du timecode. Pour la génération, évaluer la contrôlabilité, la cohérence, les droits et l’édition.
Les cas de défaillance modal sont particulièrement importants. Que se passe-t-il lorsque le texte contredit l’image? Est-ce qu’une transcription écrase un signal audio ? Une référence visuelle change-t-elle le sens d’un prompt ambiguë? Un système robuste devrait exposer les conflits plutôt que de choisir silencieusement la modalité la plus facile.
L’évaluation humaine reste nécessaire pour les tâches culturelles et créatives. La similarité technique ne permet pas de saisir le symbolisme, le contexte historique ou la cohérence esthétique.
Interfaces
Les interfaces multimodales devraient montrer ce que le système perçoit. Un utilisateur doit inspecter des images sélectionnées, des segments de transcription, des intervalles audio ou des images récupérées. Le prétraitement caché rend la correction difficile.
Les interfaces horaires fonctionnent bien pour l’audio et la vidéo. Les superpositions spatiales aident les images. Les vues graphiques peuvent connecter les enregistrements multimédias aux concepts et sources. Le texte reste utile pour les commandes et les explications, mais il ne devrait pas devenir la seule représentation visible.
L’accessibilité peut s’améliorer lorsque les modalités se renforcent mutuellement : sous-titres audio, descriptions pour images, transcriptions pour vidéo et sonification pour données. Le contenu d’accessibilité généré doit encore être revu, en particulier pour les noms et les documents adaptés à la culture.
Systèmes de connaissances
Les archives multimodales ont besoin d’identités stables pour les fichiers, dérivés, segments et descriptions originaux. Une transcription doit être reliée à son enregistrement. Un cadre doit être relié à sa vidéo et son horodatage. L’intégration doit être traitée comme un indice dérivé plutôt que comme un enregistrement primaire.
Les graphes de connaissances sont bien adaptés à cette structure composée. Ils peuvent exprimer qu’une image documente un projet, un segment audio a été analysé par ORETH, une publication interprète un motif et un artefact généré dérive de plusieurs sources.
Les systèmes RAG peuvent alors être récupérés selon les modalités. Une requête texte peut sélectionner des segments audio et des images, tandis que la réponse cite leurs enregistrements canoniques.
Implications pour Electronic Artefacts
Palimpsests est déjà multimodal par le design. Il combine musique, langage visuel, mémoire, recherche et traces d’archives. L’IA pourrait favoriser la découverte et la transformation, mais le projet ne devrait pas être réduit au modèle de production.
ORETH peut fournir des méthodes d’écoute automatique et des observations audio. VASTE peut modéliser les identités, les permissions et les relations entre les médias. Le centre de connaissances peut expliquer les concepts et préserver les citations. Ensemble, ils forment une architecture plus forte qu’une démo multimodale isolée.
Les applications potentielles comprennent un explorateur composé d’albums, la recherche d’archives transmodales, l’installation en temps réel, la réponse visuelle aux fonctionnalités audio et les interfaces de recherche qui relient les preuves de forme d’onde à l’interprétation culturelle.
Risques
Les systèmes multimodal peuvent créer des preuves synthétiques convaincantes. Les images, les voix et la vidéo générées peuvent être confondues avec des enregistrements. La preuve et la divulgation sont donc essentielles.
Le risque pour la vie privée augmente parce que les images et l’audio contiennent des informations biométriques, spatiales et contextuelles. Une photographie peut révéler un emplacement; un enregistrement peut contenir des passants. Le traitement local peut réduire l’exposition, mais ne supprime pas les obligations de consentement.
L’automatisation peut aplatir la différence. Traduire chaque support en texte peut privilégier ce qui est facile à nommer. Les systèmes culturels doivent préserver l’ambiguïté et la spécificité sensorielle.
Orientation future
L’avenir est susceptible de combiner des modèles multimodal généraux avec des outils spécialisés et des connaissances structurées. Un modèle partagé peut interpréter une requête, tandis que les systèmes de domaine effectuent une analyse audio précise, une recherche de graphiques ou un rendu.
L’architecture durable est modulaire et inspectable. Chaque modalité conserve l’identité source. Les transformations deviennent explicites. Les créateurs humains peuvent intervenir à des points significatifs. L’évaluation suit les propriétés réelles des médias plutôt qu’un score générique d’IA.
Mise en œuvre
Choisissez une tâche modal, conservez le support original et le temps ou les localisations spatiales, testez chaque modalité séparément, puis testez l’alignement. Conservez les descriptions et les intégrations sous forme d’enregistrements dérivés avec des métadonnées de modèle et de version.
Éléments de preuve
CLIP démontre l’alignement scalable du texte image par une supervision appariée. La recherche multimodale sur les modèles de fondation documente la progression des encodeurs spécialisés vers les assistants généraux tout en conservant les défis propres à chaque modalité.
Limites
Le champ change rapidement et aucune architecture ne couvre tous les milieux également. L’interprétation audio, vidéo et culturelle nécessite une évaluation par domaine au-delà des repères génériques en texte d’image.
Concepts connexes
Lire IA multimodale, IA générative, Provenance et Archéologie des signaux.
Programmes et projets connexes
Voir ORETH et Palimpsestes.
Glossaire
Modalité : une forme d’information représentée ou détectée.
Alignement : correspondance apprise ou explicite entre les modalités.
Encodeur : un composant modèle qui transforme l’entrée en représentation.
Repérage transmodal : recherche d’une modalité avec une requête d’une autre.
Mise à la terre temporelle : reliant une interprétation à un intervalle de temps spécifique.
Références
- Radford et al. Apprentissage de modèles visuels transférables de la supervision des langues naturelles. 2021.
- Li et al. Multimodal Foundation Models. 2023.