Кризис бенчмарков: почему впечатляющие результаты ИИ в тестах вводят в заблуждение
В 2025 году индустрия искусственного интеллекта столкнулась с системным кризисом доверия к собственным методам оценки. Исследования показывают, что существующие бенчмарки зачастую не в состоянии предсказать их реальную полезность и надежность, создавая опасный разрыв между лабораторными показателями и практическим применением. Масштаб проблемы демонстрирует исследование ученых из Института безопасности ИИ при правительстве Великобритании, Оксфорда, Стэнфорда и Калифорнийского университета в Беркли. Они изучили […]
