Il entend chaque mot et lit chaque écran.
Deux flux avancent côte à côte. Lirovo transcrit l'audio parlé et lit ce qui est à l'écran en même temps, puis aligne les deux sur une seule chronologie. La moitié qui est dite et la moitié qui est montrée, les deux capturées.
Deux moitiés du même moment
La plupart des outils ne traitent que la moitié audio. Ils vous remettent une transcription et s'arrêtent là. Lirovo capture les deux moitiés et les maintient synchronisées.
L'audio, transcrit intervenant par intervenant
La parole est transcrite et attribuée à celui qui l'a prononcée, de sorte qu'une citation n'est jamais une ligne de texte isolée. Chaque mot se place à la seconde où il a été dit, ce qui lui permet de s'aligner sur ce qui était à l'écran à cette même seconde.
L'écran, lu image par image
Un modèle de vision lit ce qui est réellement à l'écran : les diapositives, les graphiques, les sous-titres et les bandeaux, les tableaux de bord, le code. Le chiffre qu'un intervenant désigne mais ne prononce jamais à voix haute est tout de même capturé, parce que Lirovo l'a vu.
Ce que la lecture de l'écran capte
Les chiffres sur une diapositive, les libellés sur un graphique, l'axe sur lequel se situe une valeur. Les chiffres qu'un intervenant désigne mais ne lit jamais à voix haute.
Bandeaux du tiers inférieur, bandeaux d'actualité, cartons de nom et sous-titres incrustés. Le texte à l'écran qui indique qui parle et ce qu'il représente.
Une métrique dans un partage d'écran, un statut dans une console, une ligne dans un tableau. L'état d'un système tel qu'il était montré à l'instant donné.
Une fonction dans un éditeur, une commande dans un terminal, une configuration en cours d'édition. Le texte exact affiché, et non une paraphrase de celui-ci.
Il étudie les images qui comptent, pas chaque image
Lire chaque image serait lent et inutile, et la plupart des images sont quasi identiques à la précédente. Lirovo commence donc par normaliser la vidéo, détecte les changements de scène et supprime les images quasi dupliquées. Ce qui reste est l'ensemble des images qui ont réellement changé.
Seules ces images sont lues par le modèle de vision, pendant que l'audio est transcrit en parallèle. Cela garde la capture rapide et peu coûteuse, sans travail redondant et sans rien manquer à l'écran.

A stylized shot of the Eiffel Tower in Paris at dusk.
Alignés sur une seule chronologie
Les mots prononcés et les moments à l'écran sont alignés seconde par seconde sur une seule chronologie. Une affirmation dite à voix haute à une seconde se place à côté du graphique qui était à l'écran à cette même seconde, afin que les deux puissent se confirmer mutuellement.
Cette chronologie devient ensuite le graphe de connaissances : les personnes, les sujets, les chiffres et les décisions au sein de la vidéo, reliés aux moments exacts dont ils proviennent.
Chaque appel de modèle dans ce pipeline s'exécute sur votre propre inférence, de sorte que vous utilisez le meilleur modèle pour chaque étape, transcription, vision et raisonnement, et vous n'êtes jamais verrouillé sur un seul fournisseur.
Voyez le graphe qu'il construit
La capture est la première moitié de l'histoire. Ensuite, les deux flux sont reliés sur une seule chronologie et connectés en un graphe que vous pouvez interroger.
