Agenda

Soutenance de doctorat de Xiaolin Wang : L’intelligence artificielle efficace fondée sur le paradigme enseignant-élève

Mercredi 9 septembre 2026 à 14h30 (heure de Paris) à Télécom Paris

Télécom Paris, 19 place Marguerite Perey F-91120 Palaiseau [y aller], amphi 2

Titre intégral : L’Intelligence artificielle efficace fondée sur le paradigme enseignant-élève : comprendre l’apprentissage à faible rang et améliorer le décodage de canaux

Titre original : Efficient Artificial Intelligence Based On Teacher-Student Paradigm: Understanding Low-Rank Learning and Improving Channel Decoding

Jury

  • Sheng Yang, Professeur, L2S, CentraleSupélec, Université Paris-Saclay, France (Examinateur)
  • François Malgouyres, Professeur, IMT, Université de Toulouse , France (Rapporteur)
  • Helmut Bölcskei, Professeur, École polytechnique fédérale de Zurich, Suisse (Rapporteur)
  • Anissa Mokraoui, Professeure, L2TI, Institut Galilée, Université Sorbonne Paris Nord, France (Examinatrice)
  • Michel Kieffer, Professeur, L2S, CentraleSupélec, Université Paris-Saclay, France (Examinateur)
  • Vincent Corlay, Docteur, Mitsubishi Electric R&D Centre Europe, France (Examinateur)
  • Olivier Rioul, Professeur, LTCI, Télécom Paris, Institut Polytechnique de Paris, France (Directeur de thèse)
  • Joseph Jean Boutros, Professeur, Texas A&M University at Qatar, Qatar (Directeur de thèse)
  • Pierre Duhamel, Professeur, L2S, CentraleSupélec, Université Paris-Saclay, France (Invité)

Résumé

Cette thèse aborde une question à travers le paradigme professeur-élève : quand un petit modèle peut-il accomplir le travail d’un grand ? Son principe central : l’efficacité en échantillons et en paramètres d’un modèle appris est fixée par la capacité d’approximation de la tâche et par la voie selon laquelle l’élève absorbe l’a priori structurel du professeur – implicitement par descente de gradient sur une paramétrisation factorisée, ou explicitement par une couche de prétraitement consciente de la tâche.

En savoir plus
La voie implicite est développée pour des réseaux peu profonds sous des professeurs de bas rang. Pour l’activation quadratique, un élève optimal en forme close à tout rang prescrit met au jour le biais irréductible de l’apprentissage de bas rang, et des entrées corrélées adoucissent le seuil de complexité d’échantillonnage en une loi d’échelle à deux régimes fixée par le rang effectif du professeur. Pour la classification ReLU, une transition en trois phases – tirage aléatoire, apprentissage de représentations, saturation limitée par le rang – émerge avec une taille critique d’échantillon linéaire en la dimension d’entrée et le rang effectif partagé. La capacité s’y réduit au nombre de modes singuliers du professeur.
La voie explicite est développée pour les décodeurs de canal neuronaux des codes linéaires binaires. Une réduction par décalage de syndrome au voisinage de l’origine abaisse la complexité en morceaux affines de la frontière bit-MAP d’exponentielle en la dimension du code à polynomiale en la longueur du code, avec un degré fixé par la distance minimale. Une couche de prétraitement consciente du code comble ensuite l’écart de capacité via des statistiques extrinsèques de contrôle de parité en forme close, produisant des décodeurs compacts -du perceptron sigmoïde au transformeur pre-norm -qui approchent le décodeur BCJR sur des codes BCH courts et de longueur moyenne et un nouvel état de l’art sur un code BCH long.