DeepSeek улучшила V4-Flash: новая модель AI-агента на уровне Claude

Добавь сайт в закладки нажми CTRL+D

+1
0
+1
0
+1
0
+1
0
+1
0
+1
0
+1
0

Экспериментальная версия V4-Flash-Vision-Exp способна обрабатывать текст и изображения в одном запросе, и в опубликованных тестах DeepSeek она приблизилась к Anthropic Opus 4.8

21 августа DeepSeek представила экспериментальную модель V4-Flash-Vision-Exp — мультимодальную систему, которая интегрирует анализ изображений в возможности линейки V4-Flash. Модель доступна через API и ориентирована в первую очередь на ИИ-агентов, которым необходимо одновременно работать с текстовыми и визуальными данными: скриншотами, графиками, документами и интерфейсами.

Согласно информации от DeepSeek, новинка сохраняет функционал V4-Flash в взаимодействии с агентами, рассуждениях и общих знаниях, но теперь может учитывать изображения на этапе выполнения задач. В опубликованных тестах модель набрала 83,9 балла в Terminal Bench 2.1, 57,7 в NL2Repo, 59,3 в DeepSWE, 63,6 в DSBench-Hard и 64,3 в Chartography. DeepSeek утверждает, что по сумме результатов модель приблизилась к Anthropic Opus 4.8.

Источник: DeepSeek

Тем не менее, это сравнение не указывает на абсолютное превосходство DeepSeek. В соответствии с опубликованной таблицей, новая модель обошла Opus 4.8 в трёх из 11 тестов, включая DeepSWE, Agents’ Last Exam и ZeroBench, но проиграла в остальных. Разница особенно заметна в некоторых заданиях: например, в NL2Repo она составила 12 баллов, а в DSBench-Hard — 8,1 балла. Кроме того, результаты были опубликованы самими разработчиками и зависят от конфигураций тестирования, инструментов и настроек запуска.

Важным дополнением стал Files API. Изображение можно отправить в модель через Base64, внешнюю ссылку или загрузить один раз в API и затем обращаться к нему по ‘file_id’. DeepSeek сообщает, что Files API предоставляется бесплатно, а изображения учитываются при тарификации V4-Flash — до 384 токенов за изображение.

В то же время компания выпустила DeepSeek Harness 0.1.1 с поддержкой новой модели.

Для разработчиков основное изменение заключается в том, что визуальное восприятие теперь можно интегрировать непосредственно в тот же агентский сценарий, где модель рассуждает и вызывает инструменты. Это открывает более практичные сценарии для работы, однако V4-Flash-Vision-Exp остаётся экспериментальной моделью, поэтому её надёжность в конкретных задачах ещё предстоит оценивать отдельно.

Источник
+1
0
+1
0
+1
0
+1
0
+1
0
+1
0
+1
0

Поделись видео:
Подоляка