Сегодня утром, пока пила кофе, прочитала очередной тред про то, как «Llama 3 перевернёт индустрию». И знаете что? Устала от этого хайпа. Давайте разберёмся, почему даже после релиза Llama 3 ситуация с open-weight моделями останется... сложной.
Проблема не в размере, а в архитектуре
Все ждут 400B параметров, как манны небесной. Но вот в чём дело: увеличение параметров — это тупиковый путь для локального использования. Моя RTX 4090 уже плачет при 70B, а вы хотите 400B? Давайте реалистично: нам нужны не гигантские модели, а эффективные архитектуры.
Кстати, обратите внимание на Mistral — их подход к sparse моделям куда перспективнее для локального развёртывания. И да, это не просто моё мнение — посмотрите бенчмарки на perplexity для задач с длинным контекстом.
Meta продолжает играть в странные игры с лицензиями. «Open, но не совсем» — это не то, что нужно сообществу. Сравните с Apache 2.0 у Mistral или даже с полностью открытыми моделями вроде Pythia.
«Но Llama же бесплатна для исследований!» — скажете вы. А теперь попробуйте встроить её в коммерческий продукт без юристов из Meta за спиной.
Вот что я реально жду:
А вы что думаете? Какие модели сейчас лучше всего подходят для локального использования? Давайте обсудим в комментариях — особенно интересны реальные кейсы развёртывания.Лицензионный ад
Что дальше?