Capture

Il entend chaque mot et lit chaque écran.

Deux flux avancent côte à côte. Lirovo transcrit l'audio parlé et lit ce qui est à l'écran en même temps, puis aligne les deux sur une seule chronologie. La moitié qui est dite et la moitié qui est montrée, les deux capturées.

Deux moitiés du même moment

La plupart des outils ne traitent que la moitié audio. Ils vous remettent une transcription et s'arrêtent là. Lirovo capture les deux moitiés et les maintient synchronisées.

Entend

L'audio, transcrit intervenant par intervenant

La parole est transcrite et attribuée à celui qui l'a prononcée, de sorte qu'une citation n'est jamais une ligne de texte isolée. Chaque mot se place à la seconde où il a été dit, ce qui lui permet de s'aligner sur ce qui était à l'écran à cette même seconde.

Lit

L'écran, lu image par image

Un modèle de vision lit ce qui est réellement à l'écran : les diapositives, les graphiques, les sous-titres et les bandeaux, les tableaux de bord, le code. Le chiffre qu'un intervenant désigne mais ne prononce jamais à voix haute est tout de même capturé, parce que Lirovo l'a vu.

Ce que la lecture de l'écran capte

01
Diapositives et graphiques

Les chiffres sur une diapositive, les libellés sur un graphique, l'axe sur lequel se situe une valeur. Les chiffres qu'un intervenant désigne mais ne lit jamais à voix haute.

02
Sous-titres et bandeaux

Bandeaux du tiers inférieur, bandeaux d'actualité, cartons de nom et sous-titres incrustés. Le texte à l'écran qui indique qui parle et ce qu'il représente.

03
Tableaux de bord

Une métrique dans un partage d'écran, un statut dans une console, une ligne dans un tableau. L'état d'un système tel qu'il était montré à l'instant donné.

04
Code à l'écran

Une fonction dans un éditeur, une commande dans un terminal, une configuration en cours d'édition. Le texte exact affiché, et non une paraphrase de celui-ci.

Seulement ce qui a changé

Il étudie les images qui comptent, pas chaque image

Lire chaque image serait lent et inutile, et la plupart des images sont quasi identiques à la précédente. Lirovo commence donc par normaliser la vidéo, détecte les changements de scène et supprime les images quasi dupliquées. Ce qui reste est l'ensemble des images qui ont réellement changé.

Seules ces images sont lues par le modèle de vision, pendant que l'audio est transcrit en parallèle. Cela garde la capture rapide et peu coûteuse, sans travail redondant et sans rien manquer à l'écran.

Mistral CEO Arthur Mensch
analysis ready
Mistral CEO Arthur Mensch
Mistral CEO Arthur Mensch
CNBC · 45:59
Timeline0:00 / 45:59
Arthur
Arjun
Events
0:0011:2922:5934:2945:59
Compute & sovereignty
AI economics
Semiconductors
Vibe & agents
Cybersecurity
AGI & physical world
ContradictionDecisionClaimclick to scrub
Speakers2
Arthur Mensch
92%
Arjun Karpal
4%
b_rollFRAME · 0:29

A stylized shot of the Eiffel Tower in Paris at dusk.

Objects detected · 2
Eiffel Towercityscape
read by VLM · gemini-3.1-flash-lite

Alignés sur une seule chronologie

Les mots prononcés et les moments à l'écran sont alignés seconde par seconde sur une seule chronologie. Une affirmation dite à voix haute à une seconde se place à côté du graphique qui était à l'écran à cette même seconde, afin que les deux puissent se confirmer mutuellement.

Cette chronologie devient ensuite le graphe de connaissances : les personnes, les sujets, les chiffres et les décisions au sein de la vidéo, reliés aux moments exacts dont ils proviennent.

Chaque appel de modèle dans ce pipeline s'exécute sur votre propre inférence, de sorte que vous utilisez le meilleur modèle pour chaque étape, transcription, vision et raisonnement, et vous n'êtes jamais verrouillé sur un seul fournisseur.

Voyez le graphe qu'il construit

La capture est la première moitié de l'histoire. Ensuite, les deux flux sont reliés sur une seule chronologie et connectés en un graphe que vous pouvez interroger.