Сегодня снова потратила полчаса на скачивание свежей версии Mistral через curl, пока коллеги в Slack обсуждали, как подключили очередной API за 5 минут. И задумалась — почему я всё ещё этим занимаюсь?
Аргумент №1: Контроль
Когда у тебя модель лежит локально, ты точно знаешь, что она делает. Никаких внезапных обновлений TOS, как у некоторых облачных провайдеров на прошлой неделе. GitHub репозиторий — вот и вся документация, которая мне нужна.
Аргумент №2: Перформанс
Да, настройка torch + CUDA иногда напоминает шаманские пляски. Но когда всё работает — latency в 3 раза ниже, чем через их «оптимизированные» эндпоинты. Проверяла на Llama 2 13B с lora-адаптерами.
«Но облака же масштабируются!» — скажет мне менеджер продукта. А я покажу ему счёт за egress traffic.Кто-то ещё качает модели вручную? Или я осталась последним динозавром в эпоху API?