Le son embarqué dans le SDI expliqué : groupes, canaux, embedder et de-embedder

0

En production télévisée, le son ne circule pas toujours dans son propre câble. La plupart du temps, il voyage à l’intérieur du signal vidéo, embarqué dans le SDI. Pour un ingénieur venu de l’audio, c’est une logique déroutante : comment seize canaux d’audio tiennent-ils dans un câble censé transporter de l’image ? Comprendre le son embarqué, c’est comprendre une bonne partie de la plomberie d’un car régie, d’un plateau ou d’une régie finale. Ce guide fait le tour de la question, du principe aux pièges de terrain.

Qu’est-ce que l’audio embarqué dans le SDI

Le SDI (Serial Digital Interface) est la liaison vidéo numérique standard de la télévision professionnelle, sur câble coaxial et connecteur BNC. Un flux vidéo n’occupe pas en permanence toute la bande passante : entre les lignes et les images actives, il reste des espaces « ancillaires » (ancillary data), prévus pour transporter des données annexes. C’est là que l’audio se loge. Autrement dit, un seul câble SDI achemine l’image et jusqu’à seize canaux audio numériques, parfaitement synchrones avec elle.

Ce couplage est le grand intérêt du SDI embarqué : image et son restent solidaires d’un bout à l’autre de la chaîne. Là où une installation audio séparée multiplie les câbles et les risques de désynchronisation, le SDI transporte l’ensemble sur une seule liaison, ce qui simplifie le câblage d’un car ou d’un plateau.

Groupes et canaux : la structure

Les seize canaux audio ne sont pas en vrac : ils s’organisent en quatre groupes de quatre canaux. Chaque groupe correspond à deux paires AES, ce qui donne la grille suivante, universelle dans le métier.

GroupeCanauxÉquivalent
Groupe 1Canaux 1 à 42 paires AES
Groupe 2Canaux 5 à 82 paires AES
Groupe 3Canaux 9 à 122 paires AES
Groupe 4Canaux 13 à 162 paires AES

L’audio embarqué est généralement en 48 kHz, la fréquence d’échantillonnage de référence en vidéo, et surtout il est synchrone avec le signal vidéo : son horloge est celle de l’image. Cette grille de groupes est importante en exploitation, car c’est en termes de groupes qu’on décide ce qu’on insère, ce qu’on extrait et ce qu’on laisse passer.

Embedder et de-embedder : les deux gestes de base

Deux opérations structurent toute la chaîne. L’embedder (ou multiplexeur audio) insère des canaux audio — venus d’entrées AES ou analogiques, voire d’une console — dans l’espace ancillaire d’un flux SDI. Le de-embedder (démultiplexeur) fait l’inverse : il extrait un ou plusieurs groupes du SDI pour les ressortir en AES, en analogique ou vers un réseau audio.

Dans la vraie vie, ces fonctions prennent plusieurs formes : petits convertisseurs dédiés en bord de plateau, cartes dans un châssis de routeur vidéo, ou fonctions intégrées aux équipements eux-mêmes. Les mélangeurs de production, les caméras et les enregistreurs embarquent et extraient l’audio en permanence, souvent sans qu’on y pense. L’essentiel est de savoir, à chaque point de la chaîne, dans quel groupe se trouve le son qui vous intéresse.

Les pièges du terrain

Le premier piège est la synchronisation. Pour embarquer de l’audio dans un flux vidéo, cet audio doit être calé sur l’horloge vidéo ; une source non synchrone provoque des clics ou des glitches à l’insertion. D’où l’importance du calage d’horloge dans toute installation, un sujet qui rejoint directement la synchronisation par PTP dans les réseaux audio-sur-IP.

Le deuxième piège est le décalage lèvres-son (lip-sync). Chaque traitement vidéo — incrustation, conversion, mise à l’échelle — ajoute un retard à l’image. Si l’audio n’est pas retardé d’autant, le son précède l’image. Gérer le lip-sync, c’est réaligner l’audio sur la latence vidéo, à l’embedding comme à la diffusion. Enfin, surveillez les niveaux et le respect du loudness en broadcast : un de-embedder mal réglé, et c’est tout l’étalonnage de niveau qui part de travers avant même la mise en onde.

Du SDI à l’IP : quand les flux se séparent

La bascule vers l’audio-sur-IP change la donne. Avec SMPTE ST 2110, image et son ne voyagent plus ensemble : la norme sépare les flux, la vidéo d’un côté (ST 2110-20), l’audio de l’autre (ST 2110-30, compatible AES67). On ne « de-embed » plus un groupe : on s’abonne à un flux audio sur le réseau. C’est un changement de paradigme que l’on a vu arriver avec des équipements comme le stagebox Lawo Edge One, et qui s’inscrit dans la grande migration décrite dans notre guide de l’audio sur IP.

Pour autant, le SDI embarqué ne disparaît pas : il reste omniprésent sur les plateaux, dans les cars et partout où l’infrastructure n’est pas encore passée au tout-IP. Les grandes consoles broadcast vivent d’ailleurs à cheval sur les deux mondes et savent dé-embarquer le SDI aussi bien que s’abonner à un flux ST 2110 — c’est le cas de surfaces comme la Calrec Argo, la Lawo mc²96 ou la SSL System T. Comprendre le son embarqué reste donc indispensable, y compris pour aborder sereinement la transition vers l’IP.

Mon avis

Le son embarqué dans le SDI est l’un de ces sujets qu’on croit réservés aux vidéastes et qui rattrapent vite l’ingénieur du son dès qu’il met un pied en télé. L’idée de faire voyager seize canaux dans un câble d’image a quelque chose d’élégant : un seul lien, image et son solidaires, un câblage qui respire. Le prix à payer, ce sont deux disciplines à ne jamais lâcher, la synchro et le lip-sync, qui ne pardonnent pas l’approximation. L’IP et le ST 2110 séparent à nouveau les flux pour gagner en souplesse, mais pour quelques années encore, savoir lire des groupes et piloter un de-embedder reste un réflexe de métier. La vraie question n’est pas « SDI ou IP ? », mais jusqu’où votre infrastructure mélange encore les deux.

Partager.

À propos de l’auteur

Après plus de 20 ans dans le son professionnel : régie live, direction technique de studio (Deep Forest, Pierre Jacquot), responsable marketing digital de Playback.fr. Témoin et acteur de la bascule analogique→numérique, je suis toute l'actualité audio et je la décrypte ici, sans langue de bois.