Thinking Machines Lab представила Inkling-Small: новая модель опережает старшую при меньших затратах

Добавь сайт в закладки нажми CTRL+D

+1
0
+1
0
+1
0
+1
0
+1
0
+1
0
+1
0

Новая мультимодальная модель с 276 млрд параметров и 12 млрд активных параметров на токен обошла старшую Inkling в ключевых тестах, получив контекст до 1 млн токенов и выпущена с открытыми весами

Компания Thinking Machines Lab представила открытую мультимодальную модель Inkling-Small, основанную на архитектуре Mixture-of-Experts (MoE). С общим количеством 276 млрд параметров, модель активирует только 12 млрд параметров на токен, при этом демонстрируя высокую производительность и полную доступность весов для сообщества разработчиков.

Несмотря на то, что она считается «младшей» версией, Inkling-Small превзошла оригинальную Inkling с 41 млрд активных параметров в нескольких важных тестах.

На Terminal-Bench 2.1 она набрала 64,7% против 63,8%, на Humanity’s Last Exam — 31,6% против 29,7%, а в WE-Bench Verified достигла 80,2% против 77,6%. Разработчики связывают такой успех с улучшенной методикой обучения: модель была дообучена с использованием on-policy-дистилляции, где старшая Inkling выступала в роли «учителя», а затем еще две недели обучалась с применением reinforcement learning на задачах агентного программирования.

Источник: Thinking Machines Lab

Inkling-Small поддерживает текст, изображения и аудио, работает с контекстом до 1 млн токенов и предоставляет возможность регулировать глубину рассуждений, выбирая баланс между скоростью выполнения и качеством ответа. Полностью открытые веса уже доступны, а сама модель может быть дообучена и использована через платформу Tinker.

Источник: Thinking Machines Lab

Разработчики также пересмотрели процесс предварительного обучения: обновили набор обучающих данных и улучшили мультимодальную архитектуру без применения отдельного энкодера. Изображения делятся на фрагменты размером 40×40 пикселей, в то время как аудио обрабатывается в виде dMel-спектрограмм, после чего все виды данных совместно анализируются в сочетании с текстовыми токенами.

При меньших вычислительных затратах модель практически не уступает старшей версии в задачах визуального анализа, понимания диаграмм и документов, работы со звуком и сложными мультимодальными сценариями.

В компании подчеркивают, что Inkling по-прежнему превосходит новую модель по полноте знаний и фактической точности, однако Inkling-Small демонстрирует более выгодное соотношение производительности и вычислительных затрат.

Источник
+1
0
+1
0
+1
0
+1
0
+1
0
+1
0
+1
0

Поделись видео:
Подоляка