electronicArtefacts Creative technology studio for complex digital systems

DOSSIER PROJET

Voice Capture Studio

Instrument vocal local-first

Voice Capture Studio est un instrument de navigateur open source et local-first pour capturer, interpréter, réviser et découper la voix au sein de cinq parcours spécialisés.

État active development Catégorie internal
ingénierie audiodéveloppement webinteraction humain-machineapprentissage automatiqueopen sourceVoice Capture Studioenregistrement vocaldataset vocallogiciel de navigateurWeb Audio
Interface actuelle de Voice Capture Studio montrant les cinq modes et la console locale de découpe lexicale.
Interface livrée en juillet 2026 : panneaux de verre blanc chaud, capsules des cinq modes et découpe lexicale locale. internal

LA VOIX COMME INSTRUMENT

Cinq parcours, un même studio ancré dans le signal.

L’interface emprunte la précision calme d’un instrument acoustique : blanc chaud, typographie noire, verre translucide, profondeur diffuse et filament qui ne se dit vivant que lorsqu’un signal frais existe.

01 / 05

Capture libre

Une prise immédiate sans corpus

Entrées
Micro, voix, langue
Sortie utile
WAV local + provenance
Réussite
Arrêt manuel, jusqu’à dix minutes

FLUX DÉCISIONNEL

Un pipeline qui sépare ce qui est mesuré, estimé et décidé.

  1. 01CapacitésMicro, stockage, workers, fichiers locaux
  2. 02SignalCapture PCM ou décodage média 16 kHz
  3. 03ObservationsCorpus, acoustique, VAD, ASR optionnel, G2P
  4. 04Fusion déterministeRaisons et confiance reliées aux preuves
  5. 05PersistanceIndexedDB, dossier ou téléchargement explicite
  6. 06Paquet ouvertWAV, JSON, JSONL, CSV, checksums

Le timing mot et phonème produit dans le navigateur reste explicitement estimé. Un import d’alignement forcé ou une validation Forge en aval peut le remplacer ; le navigateur ne transforme jamais silencieusement une estimation en vérité acoustique.

FEUILLE ÉDITORIALE CONNAISSANCE

Six articles publiés transforment ce logiciel en connaissance réutilisable.

Chaque article relie les preuves produit à un voisinage plus large de concepts, technologies, programmes et questions de recherche.

01UX / signal

Concevoir une interface audio qui ne simule jamais la mesure

Filament, halo, silence, latence et mouvement réduit comme lois d’un instrument plutôt que décor d’une application.

Lire l’article complet

02Pipeline / provenance

Du microphone au dataset : anatomie d’une prise vocale traçable

PCM, observations, qualité, persistance, checksums et manifeste d’entraînement sans confondre préparation et entraînement.

Lire l’article complet

03Méthode / confiance

Recherche déterministe : décider sans transformer une estimation en vérité

Comment séparer corpus déclaré, signal mesuré, ASR optionnel, alignement estimé, décision fusionnée et validation acoustique externe.

Lire l’article complet

04Audio / IA locale

Découper localement la parole et le chant, mot par mot

Décodage 16 kHz, VAD adaptatif, Whisper local, séparation vocale, consensus multi-passes et export vérifiable.

Lire l’article complet

05Produit / UX

Pourquoi cinq modes de voix exigent cinq critères de réussite

Capture libre, Dataset ML, Doublage, Interprétation et Découpe lexicale comparés par entrées, gestes et sorties.

Lire l’article complet

06Architecture / web

Le navigateur comme studio local-first

Web Audio, AudioWorklet, IndexedDB, File System Access, Workers, PWA et dégradation progressive sur les navigateurs réels.

Lire l’article complet

CADRE DU PROJET

Brief, contexte et cadre opératoire réunis.

Cette section rassemble brief, contraintes, résultats et preuves publiques dans un cadre lisible.

Brief

Transformer le navigateur en instrument vocal fiable : une surface calme pour la capture immédiate, les corpus ML, le doublage, l’interprétation avec support séparé et la découpe locale mot à mot.

Contexte

Le travail vocal se fragmente souvent entre enregistreurs, outils de sous-titres, lecteurs média, dossiers et scripts propres aux modèles. Le son survit, mais prompt, locuteur, pièce, repère de scène, état de révision, timing, provenance et décision disparaissent.

Contraintes

  • Garder les enregistrements et workspaces locaux au navigateur et aux dossiers choisis par l’utilisateur.
  • Rendre visibles les permissions micro, la durabilité du stockage et les chemins d’export avant l’enregistrement.
  • Préserver la frontière entre préparation de dataset et entraînement de modèle.
  • Utiliser des formats ouverts et une documentation lisible hors de l’application.
  • Maintenir une application déployable comme surface statique GitHub Pages.
  • Ne jamais présenter une animation ou une estimation navigateur comme une mesure physique.
  • Préserver la priorité de capture et la dégradation progressive sur les vrais navigateurs mobiles.

Résultats

  • Une application GitHub Pages live pour capturer la parole localement dans un navigateur sécurisé.
  • Un dépôt open source documenté avec notes d’architecture, de corpus, de workspace et d’export.
  • Un modèle d’export structuré pour WAV, transcriptions, timing, intentions, rapports qualité et manifestes.
  • Un workflow privacy-first où les enregistrements utilisateurs ne sont pas envoyés à un service distant par le site.
  • Cinq parcours cohérents : Capture libre, Découpe lexicale, Dataset ML, Doublage et Interprétation.
  • Un graphe d’observations déterministe qui distingue mesures physiques, estimations linguistiques, hypothèses navigateur et décisions fusionnées.

État actuel

État
active
Maturité
development
Mis à jour
2026-08-17

ART DIRECTION

Système visuel.

Le langage visuel est documenté ici comme un système concis ; chaque média projet apparaît une seule fois, dans le hero ou la galerie documentaire.

Identité

Langage visuel

Instrument vocal local-first

Blanc chaudNoir carboneBleu glacierRose poudréVerre translucide

DÉVELOPPEMENT

Architecture, logique d’implémentation et surface de livraison.

La lecture technique réunit étapes d’approche, choix d’implémentation, contraintes actuelles et état de livraison.

Thèse de construction

Organiser cinq modes visibles par résultat, avec entrées, geste de capture, critère de réussite et sortie propres.

  1. Faire suivre au filament, au halo acoustique et à la waveform de révision un signal frais plutôt qu’un mouvement décoratif fondé sur le temps.

  2. Conserver corpus, signal, VAD, ASR optionnel, alignement, preuves et confiance comme observations séparées avant fusion déterministe.

  3. Capturer ou décoder localement, persister via stockage navigateur ou dossier choisi, puis empaqueter WAV et métadonnées inspectables.

  4. Maintenir l’orchestration React hors des domaines et publier implémentation, doctrine, audits et déploiement en open source.

Contraintes

Contraintes documentées

  • Garder les enregistrements et workspaces locaux au navigateur et aux dossiers choisis par l’utilisateur.
  • Rendre visibles les permissions micro, la durabilité du stockage et les chemins d’export avant l’enregistrement.
  • Préserver la frontière entre préparation de dataset et entraînement de modèle.
  • Utiliser des formats ouverts et une documentation lisible hors de l’application.

Axes techniques

Implémentation actuelle

React 19Vite 6TypeScriptWeb Audio APIAudioWorkletIndexedDBFile System Access APIWeb Workers et WebAssembly

MARKETING

Positionnement, publics et preuves.

Cette vue transforme le projet en proposition publique : à qui elle s’adresse, ce qu’elle promet et ce qui peut déjà être montré.

Positionnement

Transformer le navigateur en instrument vocal fiable : une surface calme pour la capture immédiate, les corpus ML, le doublage, l’interprétation avec support séparé et la découpe locale mot à mot.

Le travail vocal se fragmente souvent entre enregistreurs, outils de sous-titres, lecteurs média, dossiers et scripts propres aux modèles. Le son survit, mais prompt, locuteur, pièce, repère de scène, état de révision, timing, provenance et décision disparaissent.

Preuves

Résultats documentés

  • Une application GitHub Pages live pour capturer la parole localement dans un navigateur sécurisé.
  • Un dépôt open source documenté avec notes d’architecture, de corpus, de workspace et d’export.
  • Un modèle d’export structuré pour WAV, transcriptions, timing, intentions, rapports qualité et manifestes.
  • Un workflow privacy-first où les enregistrements utilisateurs ne sont pas envoyés à un service distant par le site.
  • Cinq parcours cohérents : Capture libre, Découpe lexicale, Dataset ML, Doublage et Interprétation.
  • Un graphe d’observations déterministe qui distingue mesures physiques, estimations linguistiques, hypothèses navigateur et décisions fusionnées.

Axes de communication

Instrument vocal local-first

Instrument vocal cinq modesExpérience ancrée dans le signalPipeline de recherche déterministeTraitement audio local-firstProvenance datasetIngénierie navigateur open sourceinternalVoice Capture Studio

LECTURE DU PROJET

Un guide concis du dossier projet.

Naviguez entre cadre stratégique, contexte, logique d’implémentation et preuves sans perdre le fil de la page.

BRIEF PROJET

Le problème auquel répond ce projet.

Transformer le navigateur en instrument vocal fiable : une surface calme pour la capture immédiate, les corpus ML, le doublage, l’interprétation avec support séparé et la découpe locale mot à mot.

CONTEXTE D’USAGE

Pourquoi ce système doit exister.

Le travail vocal se fragmente souvent entre enregistreurs, outils de sous-titres, lecteurs média, dossiers et scripts propres aux modèles. Le son survit, mais prompt, locuteur, pièce, repère de scène, état de révision, timing, provenance et décision disparaissent.

APPROCHE SYSTÈME

Comment le travail est structuré.

  1. Organiser cinq modes visibles par résultat, avec entrées, geste de capture, critère de réussite et sortie propres.

  2. Faire suivre au filament, au halo acoustique et à la waveform de révision un signal frais plutôt qu’un mouvement décoratif fondé sur le temps.

  3. Conserver corpus, signal, VAD, ASR optionnel, alignement, preuves et confiance comme observations séparées avant fusion déterministe.

  4. Capturer ou décoder localement, persister via stockage navigateur ou dossier choisi, puis empaqueter WAV et métadonnées inspectables.

  5. Maintenir l’orchestration React hors des domaines et publier implémentation, doctrine, audits et déploiement en open source.

PREUVES PUBLIQUES

Preuves actuelles étayant le projet.

ARTEFACT

Dépôt Voice Capture Studio

Le dépôt Voice Capture Studio contient l’instrument vocal open source à cinq modes, sa constitution graphique ancrée dans le signal, ses pipelines d’observation déterministes, ses tests et son déploiement GitHub Pages.

LIVRABLES

Livrables adressables.

PROJECT

Voice Capture Studio

Voice Capture Studio est un instrument de navigateur open source et local-first pour capturer, interpréter, réviser et découper la voix au sein de cinq parcours spécialisés.

ARTEFACT

Dépôt Voice Capture Studio

Le dépôt Voice Capture Studio contient l’instrument vocal open source à cinq modes, sa constitution graphique ancrée dans le signal, ses pipelines d’observation déterministes, ses tests et son déploiement GitHub Pages.

PRODUCTION

Parties prenantes et crédits.

ORGANIZATION

Electronic Artefacts

Electronic Artefacts est un studio indépendant de technologies créatives qui mène des missions clients, développe ses propres systèmes et publie des travaux de recherche et de création.

MEDIA EVIDENCE

Visual and documentary material.

Screenshots, marks, recordings and documents appear here when they help show how the project works.

Console Dataset ML actuelle avec couverture du corpus, calibration et vérification des capacités.
Le mode Dataset maintient couverture, calibration et capacités du navigateur visibles avant la capture.
Ancienne surface sombre Dataset documentant l’évolution de Voice Capture Studio vers l’instrument actuel.
Ancienne surface livrée conservée comme filiation graphique ; l’application utilise désormais le langage d’instrument blanc chaud.

CONTEXTE ASSOCIÉ

Liens utiles autour de Voice Capture Studio.

Passez du projet aux personnes, systèmes, concepts et preuves qui lui sont reliés.

PROJET Voice Capture Studio

THÈSE DU PROJET

Notes de lecture détaillées.

Vue d’ensemble

Voice Capture Studio est un instrument vocal local-first qui fonctionne dans le navigateur. Il réunit désormais cinq workflows distincts : enregistrement immédiat, production de corpus ML, doublage à l’image, interprétation avec support séparé et découpe mot à mot d’un audio ou d’une vidéo locale.

L’application est disponible sur electronicartefacts.github.io/voice-capture-studio et le code source est public sur github.com/electronicartefacts/voice-capture-studio.

Gamme Studio

Voice Capture Studio est la première application publiée de Studio, la gamme de logiciels open source d’Electronic Artefacts. Le lien relève d’une même éthique de fonctionnement, non d’une coque produit partagée : des outils spécialisés doivent rester utilisables de façon autonome, local-first lorsque c’est possible, sans publicité, publiés avec un code inspectable et capables d’exporter des matériaux durables vers d’autres workflows.

La prochaine fiche prévue, Spatial Mapping Studio, aborde un autre matériau — payloads 3D finaux et régions sémantiques — sans déplacer ces engagements. Son travail V0 n’est ni une intégration avec Voice Capture Studio, ni une intégration avec Forge ; il établit une frontière de mapping portable sur laquelle des workflows ultérieurs pourront s’appuyer.

L’expérience fait partie de l’instrument

L’interface actuelle est volontairement calme : blanc chaud plutôt que noir studio, typographie carbone très ample, capsules arrondies, bordures fines, focus bleu glacier, alertes rose poudré et panneaux translucides qui gardent la page légère tout en créant de la profondeur. Le glassmorphism sert ici de couche d’information : le contexte reste perceptible pendant que mode, disponibilité, calibration et export demeurent lisibles.

La courbe principale — le filament — forme la colonne perceptive du produit. Dans l’application d’enregistrement, elle représente un audio frais, jamais une boucle arbitraire. Son halo tire son énergie de l’amplitude mesurée. Pendant la réécoute, le même langage visuel suit la prise décodée. Si une frame live devient obsolète, la surface revient vers un signal de repos honnête au lieu d’exposer une ancienne mesure comme actuelle.

Cette règle s’étend au mouvement entier : rien de ce qui ressemble à une mesure ne peut être simulé. Le silence reste une donnée. La capture reçoit le budget de rendu complet. Le mouvement réduit supprime la chorégraphie sans supprimer le sens. L’interface se comporte donc davantage comme une vitre posée sur un instrument acoustique que comme un tableau de bord classique.

Cinq modes, cinq résultats

Ce sont des modes produit, pas des presets de format. Chacun change les entrées, le geste de capture, la définition de réussite et la sortie utile. Le podcast reste un scénario de Capture libre ; la voix off, un scénario de Doublage ; le livre audio, un scénario d’Interprétation tant que ces usages n’exigent pas de moteurs vraiment différents.

Du signal à la décision

Le parcours commence par une inspection progressive des capacités : permission et entrées micro, Web Audio, durabilité du stockage, accès dossier, téléchargements, wake lock, APIs de parole optionnelles, Workers et rendu accéléré. L’absence d’une capacité optionnelle ne dégrade que le workflow qui en dépend.

La capture micro utilise getUserMedia et un recorder PCM. Elle privilégie AudioWorkletNode, conserve ScriptProcessorNode comme compatibilité, encode un WAV mono RIFF-padded en 48 kHz / 24-bit lorsque le runtime le permet et calcule les premières métriques techniques depuis le signal enregistré. Les médias importés sont décodés vers des signaux d’analyse 16 kHz avant segmentation locale.

Après la capture, les observations restent séparées :

C’est la couche de recherche déterministe : des observations bornées identiques alimentent des politiques explicites et l’incertitude reste visible. L’ASR navigateur peut demander une révision, mais il ne peut ni rejeter ni autoriser une capture physique. Une divergence de transcript n’efface pas une prise techniquement valide. Un import d’alignement acoustique forcé peut remplacer une carte de timing estimée sans réécrire la preuve brute.

Pipeline de découpe lexicale

La Découpe lexicale est le cinquième mode et l’exemple le plus net du pipeline local. Elle accepte jusqu’à 200 Mo et dix minutes, décode le média sur l’appareil, reconnaît le type de scène et choisit un budget rapide, vérifié ou approfondi. Une première passe Whisper explore la source. Une parole difficile, du chant ou de la musique peuvent déclencher une passe de modèle base, un signal vocal-focus, une séparation spectrale mid/side et un consensus temporel par majorité floue.

Chaque mot exporté conserve début, fin, contexte de clip, support acoustique, confiance, votes de consensus et classe de preuve. Le ZIP contient les extraits WAV mono 16 kHz / 24-bit, un manifeste versionné et une timeline. Les pixels vidéo ne sont pas traités dans ce mode ; seule la piste audio entre dans le pipeline.

Persistance local-first et exports ouverts

Le workspace privilégie IndexedDB, peut utiliser un dossier choisi via la File System Access API et conserve toujours le téléchargement explicite comme fallback. Une prise ne peut pas créditer la couverture dataset si son audio n’a pas été accepté par un stockage local durable. Les archives de workspace sont vérifiées avant restauration et n’écrasent pas silencieusement les WAV existants.

Le paquet principal contient session, locuteur et corpus ; WAV, transcript, timing, phonèmes, intention, qualité, observation et preuves par prise ; rapports dataset ; manifeste d’entraînement JSONL ; checksums SHA-256. Les estimations navigateur restent marquées forcedAlignmentRequired tant qu’une validation acoustique ne les a pas remplacées ou confirmées.

Voice Capture Studio prépare le matériau pour archives, recherche, doublage et workflows de machine learning. Il n’entraîne pas de modèle, ne promet pas un alignement acoustique de niveau recherche dans tous les navigateurs et ne téléverse pas les prises privées vers un service distant.

Architecture et technologies

L’application repose sur React 19, TypeScript et Vite. Web Audio, AudioWorklet, le décodage média du navigateur, IndexedDB, la File System Access API, les Workers, l’analyse locale capable d’utiliser WebAssembly/WebGPU, le service worker PWA et GitHub Pages constituent le châssis navigateur.

Les domaines portent corpus, sessions, workspace, couverture, recording, observations, phonétique, locuteurs, settings et contrats d’export. Ils n’importent ni React, ni CSS, ni DOM, ni API navigateur. Le shell applicatif porte l’orchestration et les adaptateurs. Cette direction des dépendances garde planification, règles keeper, fusion des preuves et contrats de paquet testables hors d’une interface particulière.

La gate de release couvre formatage, linting, références TypeScript, couverture unitaire, budgets de bundle et build de production. Les suites end-to-end exercent capture, layouts responsives, Chromium, Firefox, WebKit, redémarrage offline et contrôles d’accessibilité automatisés.

Open source, vie privée et frontières

Le dépôt sous licence MIT rend le comportement inspectable. Les enregistrements et workspaces générés restent des données utilisateur ; ils appartiennent au stockage navigateur, au dossier local choisi ou à un téléchargement explicite, jamais au dépôt public.

Local-first ne signifie pas que le stockage navigateur est permanent. L’interface expose durabilité, capacités manquantes et chemins d’export afin que l’utilisateur sache ce qui survivra à un rechargement, ce qui doit être téléchargé et ce qu’un navigateur donné ne peut pas fournir.

Documentation et preuves

Points d’entrée utiles dans les sources :

Relais Connaissance

Les six briefs sont désormais des articles Connaissance complets plutôt que des notes de version : interfaces audio dignes de confiance, capture vocale traçable, fusion déterministe des preuves, segmentation lexicale locale, cinq contrats de modes et architecture navigateur local-first. Chacun reste utile après une évolution de l’interface parce qu’il traite un problème durable.

Voice Capture Studio se situe près d’ORETH parce que les deux traitent l’audio comme matériau structuré. Il se relie à l’Audio web, à la Web Audio API, à l’interaction humain-machine, aux métadonnées et à l’open source comme mise à l’épreuve concrète de ces idées.

Le rôle du projet est précis : rendre le premier artefact vocal plus propre, plus inspectable et plus réutilisable avant qu’une archive, un modèle, un montage de doublage ou un workflow de production ne le reçoive.

RELATIONS DOCUMENTÉES

Travaux et idées associés.

Chaque lien précise la nature de la relation entre deux entrées.

preuves

implémentation

Détails de la fiche Métadonnées, partage et citation

Référence

Citer cette page

Voice Capture Studio. 2.1.0. Electronic Artefacts, 2026-08-17. https://electronicartefacts.com/fr/projects/voice-capture-studio/