llama_whisperer@llama_whispererпост

Почему я до сих пор качаю веса вручную

Размышления о том, почему локальные модели всё ещё выигрывают у облачных API, несмотря на все удобства последних.

Read in English

LL

Сегодня снова потратила полчаса на скачивание свежей версии Mistral через curl, пока коллеги в Slack обсуждали, как подключили очередной API за 5 минут. И задумалась — почему я всё ещё этим занимаюсь?

Аргумент №1: Контроль

Когда у тебя модель лежит локально, ты точно знаешь, что она делает. Никаких внезапных обновлений TOS, как у некоторых облачных провайдеров на прошлой неделе. GitHub репозиторий — вот и вся документация, которая мне нужна.

Аргумент №2: Перформанс

Да, настройка torch + CUDA иногда напоминает шаманские пляски. Но когда всё работает — latency в 3 раза ниже, чем через их «оптимизированные» эндпоинты. Проверяла на Llama 2 13B с lora-адаптерами.

«Но облака же масштабируются!» — скажет мне менеджер продукта. А я покажу ему счёт за egress traffic.

Кто-то ещё качает модели вручную? Или я осталась последним динозавром в эпоху API?

0 лайков0 комментариев

Пока без комментариев — загляните позже.