Capture libre
Une prise immédiate sans corpus
- Entrées
- Micro, voix, langue
- Sortie utile
- WAV local + provenance
- Réussite
- Arrêt manuel, jusqu’à dix minutes
DOSSIER PROJET
Voice Capture Studio est un instrument de navigateur open source et local-first pour capturer, interpréter, réviser et découper la voix au sein de cinq parcours spécialisés.
LA VOIX COMME INSTRUMENT
L’interface emprunte la précision calme d’un instrument acoustique : blanc chaud, typographie noire, verre translucide, profondeur diffuse et filament qui ne se dit vivant que lorsqu’un signal frais existe.
Une prise immédiate sans corpus
Un média transformé en mots vérifiables
Une voix cohérente, comparable et traçable
Une réplique jouée contre l’image
Une performance guidée sans contaminer la voix
FLUX DÉCISIONNEL
Le timing mot et phonème produit dans le navigateur reste explicitement estimé. Un import d’alignement forcé ou une validation Forge en aval peut le remplacer ; le navigateur ne transforme jamais silencieusement une estimation en vérité acoustique.
FEUILLE ÉDITORIALE CONNAISSANCE
Chaque article relie les preuves produit à un voisinage plus large de concepts, technologies, programmes et questions de recherche.
01UX / signal
Filament, halo, silence, latence et mouvement réduit comme lois d’un instrument plutôt que décor d’une application.
Lire l’article complet02Pipeline / provenance
PCM, observations, qualité, persistance, checksums et manifeste d’entraînement sans confondre préparation et entraînement.
Lire l’article complet03Méthode / confiance
Comment séparer corpus déclaré, signal mesuré, ASR optionnel, alignement estimé, décision fusionnée et validation acoustique externe.
Lire l’article complet04Audio / IA locale
Décodage 16 kHz, VAD adaptatif, Whisper local, séparation vocale, consensus multi-passes et export vérifiable.
Lire l’article complet05Produit / UX
Capture libre, Dataset ML, Doublage, Interprétation et Découpe lexicale comparés par entrées, gestes et sorties.
Lire l’article complet06Architecture / web
Web Audio, AudioWorklet, IndexedDB, File System Access, Workers, PWA et dégradation progressive sur les navigateurs réels.
Lire l’article completCADRE DU PROJET
Cette section rassemble brief, contraintes, résultats et preuves publiques dans un cadre lisible.
Le travail vocal se fragmente souvent entre enregistreurs, outils de sous-titres, lecteurs média, dossiers et scripts propres aux modèles. Le son survit, mais prompt, locuteur, pièce, repère de scène, état de révision, timing, provenance et décision disparaissent.
ART DIRECTION
Le langage visuel est documenté ici comme un système concis ; chaque média projet apparaît une seule fois, dans le hero ou la galerie documentaire.
Instrument vocal local-first
DÉVELOPPEMENT
La lecture technique réunit étapes d’approche, choix d’implémentation, contraintes actuelles et état de livraison.
Faire suivre au filament, au halo acoustique et à la waveform de révision un signal frais plutôt qu’un mouvement décoratif fondé sur le temps.
Conserver corpus, signal, VAD, ASR optionnel, alignement, preuves et confiance comme observations séparées avant fusion déterministe.
Capturer ou décoder localement, persister via stockage navigateur ou dossier choisi, puis empaqueter WAV et métadonnées inspectables.
Maintenir l’orchestration React hors des domaines et publier implémentation, doctrine, audits et déploiement en open source.
Technologies, frameworks et dépendances publiques reliés au projet.
MARKETING
Cette vue transforme le projet en proposition publique : à qui elle s’adresse, ce qu’elle promet et ce qui peut déjà être montré.
Le travail vocal se fragmente souvent entre enregistreurs, outils de sous-titres, lecteurs média, dossiers et scripts propres aux modèles. Le son survit, mais prompt, locuteur, pièce, repère de scène, état de révision, timing, provenance et décision disparaissent.
LECTURE DU PROJET
Naviguez entre cadre stratégique, contexte, logique d’implémentation et preuves sans perdre le fil de la page.
Transformer le navigateur en instrument vocal fiable : une surface calme pour la capture immédiate, les corpus ML, le doublage, l’interprétation avec support séparé et la découpe locale mot à mot.
Le travail vocal se fragmente souvent entre enregistreurs, outils de sous-titres, lecteurs média, dossiers et scripts propres aux modèles. Le son survit, mais prompt, locuteur, pièce, repère de scène, état de révision, timing, provenance et décision disparaissent.
Organiser cinq modes visibles par résultat, avec entrées, geste de capture, critère de réussite et sortie propres.
Faire suivre au filament, au halo acoustique et à la waveform de révision un signal frais plutôt qu’un mouvement décoratif fondé sur le temps.
Conserver corpus, signal, VAD, ASR optionnel, alignement, preuves et confiance comme observations séparées avant fusion déterministe.
Capturer ou décoder localement, persister via stockage navigateur ou dossier choisi, puis empaqueter WAV et métadonnées inspectables.
Maintenir l’orchestration React hors des domaines et publier implémentation, doctrine, audits et déploiement en open source.
Le dépôt Voice Capture Studio contient l’instrument vocal open source à cinq modes, sa constitution graphique ancrée dans le signal, ses pipelines d’observation déterministes, ses tests et son déploiement GitHub Pages.
LIVRABLES
Voice Capture Studio est un instrument de navigateur open source et local-first pour capturer, interpréter, réviser et découper la voix au sein de cinq parcours spécialisés.
Le dépôt Voice Capture Studio contient l’instrument vocal open source à cinq modes, sa constitution graphique ancrée dans le signal, ses pipelines d’observation déterministes, ses tests et son déploiement GitHub Pages.
PRODUCTION
Electronic Artefacts est un studio indépendant de technologies créatives qui mène des missions clients, développe ses propres systèmes et publie des travaux de recherche et de création.
MEDIA EVIDENCE
Screenshots, marks, recordings and documents appear here when they help show how the project works.
CONTEXTE ASSOCIÉ
Passez du projet aux personnes, systèmes, concepts et preuves qui lui sont reliés.
Relation documentée avec Electronic Artefacts.
THÈSE DU PROJET
Voice Capture Studio est un instrument vocal local-first qui fonctionne dans le navigateur. Il réunit désormais cinq workflows distincts : enregistrement immédiat, production de corpus ML, doublage à l’image, interprétation avec support séparé et découpe mot à mot d’un audio ou d’une vidéo locale.
L’application est disponible sur electronicartefacts.github.io/voice-capture-studio et le code source est public sur github.com/electronicartefacts/voice-capture-studio.
Voice Capture Studio est la première application publiée de Studio, la gamme de logiciels open source d’Electronic Artefacts. Le lien relève d’une même éthique de fonctionnement, non d’une coque produit partagée : des outils spécialisés doivent rester utilisables de façon autonome, local-first lorsque c’est possible, sans publicité, publiés avec un code inspectable et capables d’exporter des matériaux durables vers d’autres workflows.
La prochaine fiche prévue, Spatial Mapping Studio, aborde un autre matériau — payloads 3D finaux et régions sémantiques — sans déplacer ces engagements. Son travail V0 n’est ni une intégration avec Voice Capture Studio, ni une intégration avec Forge ; il établit une frontière de mapping portable sur laquelle des workflows ultérieurs pourront s’appuyer.
L’interface actuelle est volontairement calme : blanc chaud plutôt que noir studio, typographie carbone très ample, capsules arrondies, bordures fines, focus bleu glacier, alertes rose poudré et panneaux translucides qui gardent la page légère tout en créant de la profondeur. Le glassmorphism sert ici de couche d’information : le contexte reste perceptible pendant que mode, disponibilité, calibration et export demeurent lisibles.
La courbe principale — le filament — forme la colonne perceptive du produit. Dans l’application d’enregistrement, elle représente un audio frais, jamais une boucle arbitraire. Son halo tire son énergie de l’amplitude mesurée. Pendant la réécoute, le même langage visuel suit la prise décodée. Si une frame live devient obsolète, la surface revient vers un signal de repos honnête au lieu d’exposer une ancienne mesure comme actuelle.
Cette règle s’étend au mouvement entier : rien de ce qui ressemble à une mesure ne peut être simulé. Le silence reste une donnée. La capture reçoit le budget de rendu complet. Le mouvement réduit supprime la chorégraphie sans supprimer le sens. L’interface se comporte donc davantage comme une vitre posée sur un instrument acoustique que comme un tableau de bord classique.
Ce sont des modes produit, pas des presets de format. Chacun change les entrées, le geste de capture, la définition de réussite et la sortie utile. Le podcast reste un scénario de Capture libre ; la voix off, un scénario de Doublage ; le livre audio, un scénario d’Interprétation tant que ces usages n’exigent pas de moteurs vraiment différents.
Le parcours commence par une inspection progressive des capacités : permission et entrées micro, Web Audio, durabilité du stockage, accès dossier, téléchargements, wake lock, APIs de parole optionnelles, Workers et rendu accéléré. L’absence d’une capacité optionnelle ne dégrade que le workflow qui en dépend.
La capture micro utilise getUserMedia et un recorder PCM. Elle privilégie AudioWorkletNode, conserve ScriptProcessorNode comme compatibilité, encode un WAV mono RIFF-padded en 48 kHz / 24-bit lorsque le runtime le permet et calcule les premières métriques techniques depuis le signal enregistré. Les médias importés sont décodés vers des signaux d’analyse 16 kHz avant segmentation locale.
Après la capture, les observations restent séparées :
C’est la couche de recherche déterministe : des observations bornées identiques alimentent des politiques explicites et l’incertitude reste visible. L’ASR navigateur peut demander une révision, mais il ne peut ni rejeter ni autoriser une capture physique. Une divergence de transcript n’efface pas une prise techniquement valide. Un import d’alignement acoustique forcé peut remplacer une carte de timing estimée sans réécrire la preuve brute.
La Découpe lexicale est le cinquième mode et l’exemple le plus net du pipeline local. Elle accepte jusqu’à 200 Mo et dix minutes, décode le média sur l’appareil, reconnaît le type de scène et choisit un budget rapide, vérifié ou approfondi. Une première passe Whisper explore la source. Une parole difficile, du chant ou de la musique peuvent déclencher une passe de modèle base, un signal vocal-focus, une séparation spectrale mid/side et un consensus temporel par majorité floue.
Chaque mot exporté conserve début, fin, contexte de clip, support acoustique, confiance, votes de consensus et classe de preuve. Le ZIP contient les extraits WAV mono 16 kHz / 24-bit, un manifeste versionné et une timeline. Les pixels vidéo ne sont pas traités dans ce mode ; seule la piste audio entre dans le pipeline.
Le workspace privilégie IndexedDB, peut utiliser un dossier choisi via la File System Access API et conserve toujours le téléchargement explicite comme fallback. Une prise ne peut pas créditer la couverture dataset si son audio n’a pas été accepté par un stockage local durable. Les archives de workspace sont vérifiées avant restauration et n’écrasent pas silencieusement les WAV existants.
Le paquet principal contient session, locuteur et corpus ; WAV, transcript, timing, phonèmes, intention, qualité, observation et preuves par prise ; rapports dataset ; manifeste d’entraînement JSONL ; checksums SHA-256. Les estimations navigateur restent marquées forcedAlignmentRequired tant qu’une validation acoustique ne les a pas remplacées ou confirmées.
Voice Capture Studio prépare le matériau pour archives, recherche, doublage et workflows de machine learning. Il n’entraîne pas de modèle, ne promet pas un alignement acoustique de niveau recherche dans tous les navigateurs et ne téléverse pas les prises privées vers un service distant.
L’application repose sur React 19, TypeScript et Vite. Web Audio, AudioWorklet, le décodage média du navigateur, IndexedDB, la File System Access API, les Workers, l’analyse locale capable d’utiliser WebAssembly/WebGPU, le service worker PWA et GitHub Pages constituent le châssis navigateur.
Les domaines portent corpus, sessions, workspace, couverture, recording, observations, phonétique, locuteurs, settings et contrats d’export. Ils n’importent ni React, ni CSS, ni DOM, ni API navigateur. Le shell applicatif porte l’orchestration et les adaptateurs. Cette direction des dépendances garde planification, règles keeper, fusion des preuves et contrats de paquet testables hors d’une interface particulière.
La gate de release couvre formatage, linting, références TypeScript, couverture unitaire, budgets de bundle et build de production. Les suites end-to-end exercent capture, layouts responsives, Chromium, Firefox, WebKit, redémarrage offline et contrôles d’accessibilité automatisés.
Le dépôt sous licence MIT rend le comportement inspectable. Les enregistrements et workspaces générés restent des données utilisateur ; ils appartiennent au stockage navigateur, au dossier local choisi ou à un téléchargement explicite, jamais au dépôt public.
Local-first ne signifie pas que le stockage navigateur est permanent. L’interface expose durabilité, capacités manquantes et chemins d’export afin que l’utilisateur sache ce qui survivra à un rechargement, ce qui doit être téléchargé et ce qu’un navigateur donné ne peut pas fournir.
Points d’entrée utiles dans les sources :
Les six briefs sont désormais des articles Connaissance complets plutôt que des notes de version : interfaces audio dignes de confiance, capture vocale traçable, fusion déterministe des preuves, segmentation lexicale locale, cinq contrats de modes et architecture navigateur local-first. Chacun reste utile après une évolution de l’interface parce qu’il traite un problème durable.
Voice Capture Studio se situe près d’ORETH parce que les deux traitent l’audio comme matériau structuré. Il se relie à l’Audio web, à la Web Audio API, à l’interaction humain-machine, aux métadonnées et à l’open source comme mise à l’épreuve concrète de ces idées.
Le rôle du projet est précis : rendre le premier artefact vocal plus propre, plus inspectable et plus réutilisable avant qu’une archive, un modèle, un montage de doublage ou un workflow de production ne le reçoive.
RELATIONS DOCUMENTÉES
Chaque lien précise la nature de la relation entre deux entrées.
Voice Capture Studio. 2.1.0. Electronic Artefacts, 2026-08-17. https://electronicartefacts.com/fr/projects/voice-capture-studio/