Nous cherchons à estimer les moyennes de différentes distributions d'un même espace de grande dimension à partir d'échantillons indépendants. Par exemple ces moyennes peuvent être des kernel mean embeddings (KME) de différentes distributions, un outil classique de machine learning. Notre objectif est d'améliorer l'estimation de ces moyennes relativement à l'estimation naïve par une seule moyenne empirique. Notre approche consiste à considérer des combinaisons convexes des moyennes empirique de chacun des échantillons avec des poids appris à partir des données. On constate un effet type "James-Stein" en grande dimension. Lorsque les données ne sont pas isotropes comme pour des KMEs, une notion de dimension effective intervient. Je vous présenterai l'intuition derrière nos approches et des bornes supérieures et inférieures sur le risque.
Ce travail est en collaboration avec Hannah Marienwald et Gilles Blanchard (https://arxiv.org/abs/2403.15038).