Ce que le logiciel public peut nous apprendre : les découvertes de Software Heritage
Télécom Paris, 19 place Marguerite Perey F-91120 Palaiseau [y aller], amphi Estaunié
Software Heritage constitue la plus grande archive existante de code source de logiciel public et de son historique de développement : plus de 20 milliards de fichiers de code source uniques et 5 milliards de commits, collectés à partir de plus de 400 millions de projets. L’objectif principal de cette archive est la préservation du savoir humain précieux contenu dans les logiciels, mais elle offre un effet secondaire majeur : pour la première fois, l’intégralité du code public est accessible en tant qu’objet d’étude unique, uniforme et ouvert, plutôt que dispersé sur différentes plateformes.
Dans cette présentation, je commencerai par introduire l’initiative Software Heritage et son état actuel. Ensuite, je montrerai ce que rend possible ce trésor inédit de code, grâce à des résultats de recherche récents obtenus en utilisant l’archive comme jeu de données à grande échelle : suivre l’origine réelle du code et son parcours, mesurer la croissance et la santé des communs numériques, étudier les personnes qui écrivent et maintiennent le code ainsi que les inégalités dans l’accès à cette activité.
