Kimi

Промпт-инжиниринг работает: одна модель, два результата

11 мин чтения

15 августа на arXiv вышла неприметная работа StateM – четыре автора, без громкой лаборатории. Внутри есть цифра, на которой стоит остановиться: DeepSeek-V4 Flash, модель не из лидерской группы нашего бенчмарка, после «адаптации» стоимостью $38 поднимается на Terminal-Bench 2.1 с 82,7% до 88,1%. А на общем ядре из 88 задач доходит до 89,1% – уровень флагманских прогонов GPT-5.6 Sol, эталонный прогон которых обошёлся в $574. Итоговый счёт всей конфигурации на DeepSeek – $52.

StateM не одиночка: за последние две недели вышло ещё минимум две работы о том, что даёт промпт-инжиниринг в агентных системах. DarwinX добавляет в среднем 17 пунктов на четырёх бенчмарках, LongHorizon-Harness поднимает Qwen 3.7-Plus на Terminal-Bench с 69,7% до 77,2%. Во всех трёх случаях веса модели заморожены. Меняется только то, что вокруг неё: промпты, инструкции, контроль исполнения.

Это прямо бьёт по популярному тезису о том, что промпт-инжиниринг вот-вот станет не нужен: модель сама напишет себе оптимальный промпт, учиться управлять ИИ не нужно. У свежих работ есть границы применимости – и есть практические следствия для руководителя, который работает с ИИ в обычном чате, без лабораторной инфраструктуры.

Читать полностью
Промпт-инжиниринг работает: одна модель, два результата
Лучшие AI для менеджера в России: 52 модели, 3300+ оценок
11 мин

Лучшие AI для менеджера в России: 52 модели, 3300+ оценок

Мы провели масштабное исследование: 54 модели, оценки от двух независимых LLM-судей, 8 категорий управленческих задач. Это самый полный русскоязычный рейтинг AI для менеджеров на сегодня.

Вопрос остаётся тем же: какой AI реально работает для руководителя в России – без VPN, без костылей?