Китайская компания DeepSeek представила обновленную версию своей модели DeepSeek-V4-Flash-0731, что демонстрирует: дальнейшее повышение эффективности искусственного интеллекта не обязательно связано исключительно с увеличением масштаба моделей. Новинка при неизменной архитектуре и объеме параметров значительно улучшилась благодаря новому постобучению и в независимых тестах превзошла даже более крупную модель DeepSeek-V4-Pro.
DeepSeek-V4-Flash-0731 базируется на апрельской предварительной версии модели V4-Flash. Согласно документации компании, архитектура и размер модели остались без изменений; основное внимание было уделено новому дообучению после базового этапа тренировки. Именно этот шаг обеспечил значимый рост способностей, что подчеркивает важную роль методов посттренировки наряду с самим количеством параметров.
Модель использует архитектуру Mixture-of-Experts (MoE), при которой активированы лишь часть своих параметров для каждого токена. Официальный чекпоинт, опубликованный DeepSeekem, включая модуль спекулятивного декодирования, имеет примерно 304 миллиарда параметров. Модель также доступна как open-weight решение через платформу Hugging Face.
Одной из наиболее ярких особенностей является исключительно длинный контекст. DeepSeek заявляет поддержку до одного миллиона токенов на входе и максимальной длины вывода — 384 тысяч токенов. Модель поддерживает режим рассуждений, обычный режим, вызов инструментов и другие функции, необходимые, например, при создании более автономных AI-агентов.
Меньшая модель превзошла своего старшего брата
Результаты независимой компании Artificial Analysis относятся к наиболее интересным частям обновления. DeepSeek-V4-Flash-0731 в режиме максимального рассуждения набрал 50 баллов по Индексу искусственного интеллекта от Artificial Analysis. Этот результат поставил модель среди самых производительных современных моделей, а оценщик также отметил значительное превосходство над предыдущей версией V4-Flash.
Обновленный Flash, согласно тестам, смог превзойти и более крупный DeepSeek-V4-Pro, что особенно важно с точки зрения эффективности. Развитие ИИ все больше смещается от вопроса «как создать самую большую модель» к вопросу «как из доступных вычислительных ресурсов получить максимальную интеллектность».
Кроме того, DeepSeek давит на конкурентов ценой. Artificial Analysis указывает цену API примерно 0,14 доллара за миллион входных токенов и 0,28 доллара за миллион выходных токенов. В комбинированном сценарии, включающем использование кэша, эксплуатация выходит значительно дешевле по сравнению со многими конкурентными моделями.
Именно соотношение эффективности и цены поставило DeepSeek-V4-Flash-0731 на так называемую Pareto frontier от Artificial Analysis — то есть среди моделей, для которых невозможно найти одновременно более умную и при этом более дешевую альтернативу по отслеживаемым метрикам.
Длинный контекст и быстрое генерирование
Важной частью модели также является оптимизация работы с длинным контекстом. Архитектура семейства V4 использует механизмы, снижающие объем вычислений и памяти, необходимых при обработке обширных входов. Это критически важно, например, при работе с большими документами, базами данных, длительными диалогами или автономных задачах, где модель постепенно накапливает большой массив информации.
В состав выпущенной версии также входит технология спекулятивного декодирования. Меньший вспомогательный модуль заранее предлагает несколько следующих токенов, а основная модель затем может проверить их одновременно. В результате — более быстрое генерирование без необходимости существенно изменять саму базовую модель. Hugging Face для выпущенной версии фиксирует чекпоинт размером примерно 304 миллиарда параметров.
Analytical Analysis измерила модель более чем сто выходных токенов в секунду, что относит её к быстрым моделям рассуждения этой производительной категории.
Соревнование переходит от размера к эффективности
DeepSeek-V4-Flash-0731 демонстрирует широкую тенденцию, которая всё больше утверждается в отрасли генеративного ИИ. Разработчики уже не соревнуются только в абсолютной производительности самых больших моделей, но также и в том, сколько интеллекта они могут предложить за один доллар и при каких требованиях к оборудованию.
Это особенно важно для агентов ИИ. При долгосрочном решении задач они могут потреблять миллионы токенов при работе с документами, программировании, запросами клиентов или корпоративными базами данных. Поэтому даже относительно небольшая разница в цене миллиона токенов означает значительные различия в эксплуатационных расходах при массовом внедрении.
Кроме того, DeepSeek имеет дополнительное преимущество в виде доступных весов модели. Компании так не зависят исключительно от облачных API и могут развернуть модель на собственной инфраструктуре, что может быть интересным, например, там, где важно сохранять конфиденциальные данные внутри организации. DeepSeek опубликовал модель в рамках своей коллекции V4 на Hugging Face.
Обновление V4-Flash поэтому интересно не только ещё одним сдвигом в таблицах бенчмарков. Оно показывает, что более качественный тренинг и оптимизация могут принести больший эффект, чем простое увеличение количества параметров. И именно сочетание высокой производительности, скорости, длинного контекста, открытых весов и низкой цены может быть для дальнейшего развития рынка ИИ более важным, чем гонка за абсолютно самую большую модель.
gnews.cz - tk