![đ€ LâIA vocale française veut rivaliser avec les gĂ©ants mondiaux (Patrick PĂ©rez, Kyutai) [REDIF]](https://static.audiomeans.fr/img/episode/de502171-d9a6-46a6-8f21-c8d2ed266145.jpg)
Monde Numérique - Actu Tech
đ€ LâIA vocale française veut rivaliser avec les gĂ©ants mondiaux (Patrick PĂ©rez, Kyutai) [REDIF]
·34 min
Kyutai, laboratoire français de recherche en intelligence artificielle, dĂ©veloppe des modĂšles vocaux capables de dialoguer en temps rĂ©el, de traduire instantanĂ©ment et de fonctionner sur des appareils plus modestes. Patrick PĂ©rez explique comment un petit labo peut innover face aux gĂ©ants de lâIA. INTERVIEW : Patrick PĂ©rez - Directeur gĂ©nĂ©ral de KyutaiRediffusion du 29 octobre 2025 L'essentiel- Nous ne faisons pas de produit, nous sommes entiĂšrement consacrĂ©s Ă la recherche.- Moshi permet des interactions vocales plus naturelles entre lâhumain et la machine.- La finalitĂ© de lâopen source, câest que dâautres sâen saisissent.- Nous avons fait des choses que dâautres nâavaient pas fait avant nous.Comment Kyutai trouve-t-il sa place dans la course mondiale Ă lâintelligence artificielle face aux gĂ©ants du secteur ?Nous sommes un laboratoire de recherche Ă but non lucratif, financĂ© par du mĂ©cĂ©nat privĂ©. Notre objectif nâest pas de lancer des produits, mais de faire avancer la connaissance en dĂ©veloppant des prototypes et en partageant les rĂ©sultats, les modĂšles et le code. MĂȘme dans un domaine dominĂ© par de trĂšs grandes organisations, il reste possible pour de petites Ă©quipes de faire Ă©merger des innovations importantes. Avec Moshi, vous avez dĂ©veloppĂ© une IA vocale capable de conversations trĂšs naturelles. Quelle Ă©tait lâinnovation principale ?Moshi est un modĂšle conversationnel vocal qui permet une interaction sans tour de parole imposĂ©. La machine peut couper la parole Ă bon escient, comme dans une vraie conversation. Pour y arriver, nous avons Ă©vitĂ© de passer par une transcription textuelle intermĂ©diaire de la parole, ce qui permet dâaller plus vite et de conserver des informations importantes comme le timbre, lâĂ©motion ou lâaccent de la voix. Vos travaux portent aussi sur la traduction simultanĂ©e et la synthĂšse vocale. Quels sont les prochains dĂ©fis ?Nous travaillons beaucoup sur des IA multimodales capables de rester fluides dans la conversation tout en ayant accĂšs Ă des informations nouvelles, comme des documents, des vidĂ©os ou des contenus audio. Lâobjectif est de crĂ©er des assistants qui peuvent comprendre diffĂ©rents types dâinformations et interagir naturellement avec les utilisateurs. HĂ©bergĂ© par Audiomeans. Visitez audiomeans.fr/politique-de-confidentialite pour plus d'informations.

Podcast
Monde Numérique - Actu Tech