Бенчмарки LLM

Промпт-инжиниринг работает: одна модель, два результата

11 мин чтения

15 августа на arXiv вышла неприметная работа StateM – четыре автора, без громкой лаборатории. Внутри есть цифра, на которой стоит остановиться: DeepSeek-V4 Flash, модель не из лидерской группы нашего бенчмарка, после «адаптации» стоимостью $38 поднимается на Terminal-Bench 2.1 с 82,7% до 88,1%. А на общем ядре из 88 задач доходит до 89,1% – уровень флагманских прогонов GPT-5.6 Sol, эталонный прогон которых обошёлся в $574. Итоговый счёт всей конфигурации на DeepSeek – $52.

StateM не одиночка: за последние две недели вышло ещё минимум две работы о том, что даёт промпт-инжиниринг в агентных системах. DarwinX добавляет в среднем 17 пунктов на четырёх бенчмарках, LongHorizon-Harness поднимает Qwen 3.7-Plus на Terminal-Bench с 69,7% до 77,2%. Во всех трёх случаях веса модели заморожены. Меняется только то, что вокруг неё: промпты, инструкции, контроль исполнения.

Это прямо бьёт по популярному тезису о том, что промпт-инжиниринг вот-вот станет не нужен: модель сама напишет себе оптимальный промпт, учиться управлять ИИ не нужно. У свежих работ есть границы применимости – и есть практические следствия для руководителя, который работает с ИИ в обычном чате, без лабораторной инфраструктуры.

Читать полностью
Промпт-инжиниринг работает: одна модель, два результата
40 кейсов GigaChat: проверяем данные Сбера по бенчмарку
20 мин

40 кейсов GigaChat: проверяем данные Сбера по бенчмарку

Сбер выпустил рекламный спецпроект: сорок бизнес-кейсов компаний, которые внедрили GigaChat и рассказывают об эффектах. EdTech, MedTech, HRTech, кибербезопасность, PropTech. Красивые карточки, конкретные цифры, реальные стартапы.

Рекламный проект Сбера

На изображении: промо-слайд «На шаг впереди» от акселератора Sber500×ГигаЧат – 40 стартапов из 9 индустрий. Заявленные эффекты: ускорение бизнес-процессов до x16, снижение затрат до 90%, автоматизация задач до 95%, рост выручки до 30%.

У нас есть бенчмарк: 29 моделей, 4 308 независимых оценок на управленческих задачах. GigaChat в нём занимает последнее, 29-е место по итогам второй волны тестирования. Это создаёт интересную ситуацию.

Не потому что Сбер лжёт. Кейсы реальные, стартапы существуют, автоматизация работает. Вопрос в другом: была ли это оптимальная модель для задач, которые они решали?

Бенчмарки ИИ теряют смысл – как тогда выбирать модель
7 мин

Бенчмарки ИИ теряют смысл – как тогда выбирать модель

В марте мы разбирали, как устроены бенчмарки LLM – GPQA Diamond, SWE-bench, Chatbot Arena. В апреле протестировали 53 модели и обнаружили, что разница в качестве между топовыми моделями – десятые доли балла, а в цене – три порядка величины.

Теперь – следующий вопрос. Что если сами бенчмарки перестают работать?

Как оценивают качество нейросетей в 2026: бенчмарки LLM для менеджера
7 мин

Как оценивают качество нейросетей в 2026: бенчмарки LLM для менеджера

Представьте, что вы выбираете служебный автомобиль для команды. Один дилер говорит: «Наша машина самая быстрая». Другой: «У нас лучший расход топлива». Третий: «Мы лидируем по безопасности». Все они правы – но каждый меряет своё. Без понимания того, что именно и как измеряется, вы не можете сравнить предложения объективно.