I analyzed 31,352 hourly LLM benchmark scores: within-day variation was 2.8 points, while between-day variation was 8.4 [P]
6/10Cette étude a analysé 31 352 scores horaires de benchmarks de grands modèles linguistiques, révélant une variation intra-jour de 2,8 points et inter-jour de 8,4 points, mettant en évidence des fluctuations de performances.
Reddit - r/MachineLearning · 29/08/2026 11:08:03
