Одна модель, разные результаты: как инфраструктура меняет бенчмарки ИИ-агентов

В этом году Anthropic опубликовала исследование инфраструктурного шума в бенчмарках для ИИ-агентов, которые пишут и запускают код. На Terminal-Bench 2.0 разница между самой строгой и неограниченной конфигурациями достигла шести процентных пунктов. Это больше, чем типичный разрыв между соседними пози…
Мы публикуем лишь краткий анонс. Все права на материал принадлежат Хабр — ИИ.
Ещё по теме
🤖Дайджест ИБ, 30 сентября – 6 октября: ИИ-агенты на сайтах властей, Google остановила bug bounty
Новости информационной безопасности за неделю с 30 сентября по 6 октября, в одну строку с ссылками на источник. Темы: ИИ, Уязвимости, Атаки…
От железа к собственным VST инструментам
От Железа к собственным VST плагинамЯ музыкант без навыков программирования. Продал свой железный сетап, не нашёл плагинов для живой игры и…
🤖Почему не стоит писать AI-агента с нуля: что скрывается внутри harness
У вас есть модель, API к ней и идея продукта с агентом. Кажется, осталось написать цикл: отправить запрос, получить tool call, выполнить его…
🤖Уроки GEO-продвижения: как за 2 месяца увеличить видимость в нейросетях в 50 раз и обогнать СКОЛКОВО
Привет, Хабр! Я руководитель группы экспериментальных клиентов Kokoc Performance (входит в Kokoc Group). Мы в Kokoc Group занимаемся продвиж…
🤖Зачем мы совместили съёмку на зелёном фоне, 3D-рендеры и генеративный ИИ в одном видео и что у нас получилось
Использовать возможности нейросетей или организовать традиционную видеосъёмку? Рассказываем, как, получив задачу создать имиджевое видео, мы…
🤖Ассистент рисует и достраивает самого себя: метапознание и зарождение собственного замысла
см. часть 1: Как я создавал персонального ассистента на домашнем железесм. часть 2: Ассистент получает личность: память, сновидения и самовы…