Ярмарка бенчмарков ИИ: можно ли им доверять?
Бенчмарки для генеративного искусственного интеллекта широко используются компаниями, но всегда ли они информативны? Да, но только при условии, что известны все детали и условия тестирования, которые редко раскрываются. Поэтому к ним стоит относиться с осторожностью.
Модели генеративного ИИ появляются с поразительной скоростью, и каждая новая версия сопровождается множеством цифр и бенчмарков, призванных продемонстрировать ее превосходство над предшественниками и конкурентами. Но насколько надежны эти данные?
Чтобы ответить на этот вопрос, мы изучили более десятка пресс-релизов и публикаций в блогах от OpenAI и Anthropic – двух ведущих коммерческих LLM разработчиков (ChatGPT и Claude). Мы также проанализировали анонсы Moonshot IA (Kimi K3) и Qwen (3.8-Max), а также результаты тестов от Artificial Analysis, независимой компании, специализирующейся на бенчмарках генеративного ИИ.
Мы уже рассказывали о том, как данные могут существенно влиять на результаты, но это не единственная проблема. Даже при использовании одних и тех же бенчмарков и данных (иногда «скрытых») оценки могут сильно различаться в зависимости от того, кто и как проводит измерения.
- Рассуждения генеративного ИИ: бенчмарки вводят нас в заблуждение
SWE-bench Pro: Внимание к наборам данных
Начнем с широко используемого бенчмарка SWE-bench Pro. Разработанный Scale AI, он, по заявлению компании, «обеспечивает строгую и реалистичную оценку агентов ИИ для разработки программного обеспечения». Является ли SWE-bench Pro просто «профессиональной» версией SWE-bench? И да, и нет; на самом деле это не одно и то же.
SWE-bench был запущен в 2023 году исследователями из Принстона и Стэнфорда. SWE-bench Pro появился в 2025 году благодаря компании Scale AI. Важно не путать эти две версии, даже если «Pro» позиционируется как преемник: «SWE-Bench Pro продолжает там, где остановился SWE-Bench Verified, предлагая более разнообразные задачи, повышенную сложность и код, который модели еще не видели».
В SWE-bench Pro существует несколько различных типов тестов, отличающихся используемыми данными. Таким образом, говорить просто «SWE-bench Pro» не имеет смысла, хотя именно так его часто используют в качестве эталона.
- Public Set: 731 задача и 11 репозиториев
- Held-out Set: 858 задач и 12 репозиториев
- Commercial или Private Set: 276 задач и 18 репозиториев
Наиболее часто используются Public и Private наборы. Первый имеет как преимущество, так и недостаток в своей публичности: любой может его использовать, данные свободно доступны, что позволяет проводить оптимизацию моделей (как намеренно, так и случайно).
С Private набором модели сталкиваются с ранее невиданными данными (теоретически). Тесты на Public Set можно сравнить с архивными заданиями, в то время как итоговый экзамен — это Private Set. Held-Out, в свою очередь, похож на внезапный антидопинговый контроль, проводимый Scale AI.
SWE-bench Pro: Значительные расхождения в зависимости от условий и параметров
Свежие материалы — Новости IT-индустрии

Arch Linux: Снова беспорядки в репозитории AUR, новая волна вредоносного кода
Раньше было лучше Во второй раз за два месяца команде дистрибутива Arch Linux пришлось вмешаться в работу репозитория AUR (Arch User Repository). Причиной стала новая волна захватов существующих пакетов с целью внедрения в них вредоносного кода. Решение было первоначально объявлен

Proxmox VE теперь официально доступен для Arm64
Raspberry Pi остается за бортом Это значительное событие: Proxmox официально выпустил версию своей платформы для машин с процессорами Arm. Данное нововведение стало возможным благодаря сотрудничеству с NVIDIA, чьи платформы являются единственными, которые получают полную поддержку. Для

Хакеры взломали Adform: подмена криптокошельков через рекламный скрипт
Adform, одно из крупнейших рекламных онлайн-агентств, среди клиентов которого значатся многочисленные американские СМИ и Spotify, подверглось хакерской атаке. Скрипт агентства, используемый на всех клиентских сайтах, был изменен для подмены адресов криптовалютных кошельков пользователей.

Летняя головоломка: Найдите настоящего Марка Цукерберга в метавселенной
Этим летом мы предлагаем вам развлечения с играми и головоломками, чтобы стимулировать ваш ум, где бы вы ни находились — на пляже, в горах или в дороге. Эти занятия созданы, чтобы развлечь вас и испытать ваши интеллектуальные способности. Сегодняшняя задача — помочь Марку Цукербергу. О

Apple и ИИ-баги: Перегрузка Отчетов и Новые Правила для Исследователей
Apple, подобно другим технологическим гигантам, тонет в потоке сообщений об ошибках, сгенерированных искусственным интеллектом. Пытаясь справиться с этим наплывом, компания ввела ряд мер, направленных на ограничение объема получаемых отчетов, что, в свою очередь, рискует вызвать недоволь

Ubisoft и NFT: Бесконечные Попытки Игрового Гиганта В Криптомире
Невзаимозаменяемые токены (NFT) оказались лишь кратковременным эпизодом в долгой истории спекулятивных пузырей, часто связанных с мошенничеством. После ажиотажа 2021-2022 годов, когда изображения обезьян продавались за баснословные деньги, а обещания быстрого обогащения и поспешно созданны