Luisteren
Spraak, taal, geluiden en stiltes herkennen.
Ping Media · AI / Vibe coding / Accessibility
Een eerste proof of concept waarin meerdere AI-processen samenwerkten om video sneller digitaal toegankelijk te maken.
Spraak, taal, geluiden en stiltes herkennen.
Beeld, tekst, scènes en context analyseren.
Audio en beeld samenbrengen tot bruikbare outputs.
Project in het kort
De aanleiding
Video digitaal toegankelijk maken bestaat uit verschillende, vaak handmatige stappen. Spraak moet worden omgezet naar tekst, betekenisvolle geluiden moeten worden herkend en visuele informatie moet beschikbaar worden gemaakt voor mensen die deze niet kunnen zien. Ik onderzocht hoe AI deze losse onderdelen kon verbinden in één geautomatiseerde flow.
De proof of concept
De video opdelen in signalen: gesproken taal, betekenisvolle geluiden, stiltes, scènes en tekst in beeld.
Meerdere gespecialiseerde AI-modellen en scripts laten samenwerken binnen één aangestuurde workflow.
De analyses vertalen naar ondertiteling, SDH, een leesbaar transcript en een versie met audiodescriptie.
Van POC naar praktijk
Deze versie was bewust een eerste technische verkenning. Het proces bestond toen uit meer afzonderlijke stappen dan tegenwoordig nodig zou zijn. De waarde zat in het aantonen dat de onderdelen gekoppeld konden worden en samen een bruikbaar resultaat opleverden. Inmiddels gebruikt Ping Media een verder ontwikkelde en verbeterde versie van dit principe in de praktijk.
Waarom dit project telt
Deze POC laat zien hoe ik nieuwe technologie benader: niet als losse gimmick, maar als materiaal waarmee je een concreet probleem kunt oplossen. Door zelf te bouwen, testen en itereren kon ik een abstract idee veranderen in een werkende blauwdruk.