arXiv cs.CL
· Papers
Multilingual Embedding Probes Fail to Generalize Across Learner Corpora
arXiv:2604.07095v2 Announce Type: replace Abstract: Do multilingual embedding models encode a language-general representation of proficiency? We investigate this by training linear and non-linear probes on hidden-state activations from seven embedding models (0.3-8B) to predict CEFR proficiency levels from learner text