Open-weight 4B models approach o3-level medical question answering in Swedish [P]
I have been running some experiments with smaller open-weight LLMs on multiple-choice questions of Swedish medical licensing exams. On a dataset called MedQA-SWE, GPT-4 scored 84%…