Топ-модели под угрозой: сажаем Claude Code на GLM 5.2 и платим в разы меньше
Разработчик несколько недель просидел на GLM 5.2 и говорит: фронтир-лаборатории уязвимы. Разбираем почему, а потом проверяем тезис на себе — сажаем Claude Code на GLM через Ollama Cloud за 800 рублей.
Топ-модели под угрозой
Есть эссе, которое сейчас гремит на Hacker News. Мартин Олдерсон, разработчик, несколько недель просидел на GLM 5.2 вместо Opus и GPT, а потом сел и написал спокойный технический разбор с одним неудобным выводом: фронтир-лаборатории вроде Anthropic и OpenAI уязвимее, чем кажется.
Не «нейросети всех заменят», не «AGI на пороге». Разговор про деньги. Про то, что модель уровня Opus теперь есть с открытыми весами, стоит в разы дешевле, а пересесть на неё это вопрос пары минут.
Давай разберём его логику, а потом сделаем самое интересное: проверим тезис на себе. Посадим Claude Code на GLM 5.2 и посмотрим, каково это в реальной работе.
Откуда вообще берётся маржа
Первое, что ломает интуицию. Все помнят «момент DeepSeek», когда выяснилось, что мощную модель можно обучить смешно дёшево. Обучение V3 обошлось где-то в 6 миллионов долларов, рынок ахнул. Но Олдерсон говорит: смотрели не туда.
Обучение это разовая затрата. Ты один раз вложился, получил веса. А зарабатывают лаборатории не на обучении, а на инференсе: каждый твой запрос к модели это маленькая продажа. И вот тут начинается интересное.
Фронтир-лаборатории берут за инференс порядка 25 долларов за миллион токенов. А железо, которое реально крутит этот запрос, стоит примерно 10% от этой цены. Остальное маржа. Вся бизнес-модель это амортизировать дорогое обучение поверх очень прибыльного потока запросов.
90% валовой маржи на железе это жирно. Ровно та цифра, ради которой приходит конкурент. И вот он пришёл.
Эти 90% — юнит-экономика одного API-запроса в вакууме: цена токенов против стоимости железа, которое их прокрутило. Реальная маржа компаний сильно скромнее. По данным The Information, валовая маржа Anthropic в 2024 году была минус 94%, а прогноз на 2025 они сами срезали до ~40%: флэт-подписки с пауэр-юзерами (каждый агентный цикл в Claude Code — инференс за счёт Anthropic), бесплатный трафик и аренда чужих облаков съедают разницу. Выход в ноль компания закладывает только к 2027 году.
Казалось бы, нюанс ломает тезис эссе. На деле наоборот, делает его страшнее. Олдерсон рисует картину «у лабораторий жирная подушка, есть куда снижать цены в ответ». Реальность жёстче: подушки нет, маржа и так тонкая, и когда снизу приходит модель в пять раз дешевле, отвечать ценовой войной просто нечем.
Что такое GLM 5.2
GLM это открытая модель от китайской Z.ai. Пятая версия, по словам Олдерсона, первая, которая честно дотянулась до планки Opus и GPT. Не «почти как», а реально сопоставимое качество в коде. Он гонял её в Claude Code несколько недель, так что это не бенчмарк на бумаге, а живой опыт.
Теперь ценник. Держись:
GLM 5.2 стоит около 4.40 доллара за миллион токенов. Это меньше 20% от цены Opus и примерно 15% от цены GPT 5.5. При сопоставимом качестве кода. И это ещё не дно: анализ показал, что тот же инференс на железе AMD выходит в 2.75 раза дешевле, чем на Nvidia, так что цена поедет вниз дальше.
Джефф Безос когда-то сказал: «Твоя маржа это моя возможность». Вот тут ровно оно. Пока Anthropic держит 90% маржи, у любого, кто готов продавать дешевле, есть куда влезать.
Но я не был бы собой, если бы продал тебе только красивую часть. У GLM есть три реальных минуса, и Олдерсон их честно называет:
- Медленная. Она много «думает» внутри, генерит кучу токенов рассуждения. Для живого интерактивного чата это может раздражать. Для фоновых задач вообще не важно.
- Нет vision. Скинуть скриншот, макет из Фигмы или PDF картинкой не получится. Если ты привык кидать модели изображения, это чувствуется.
- Слабый веб-поиск. У открытых провайдеров с поиском пока беда, а агент в реальной работе гуглит постоянно. Это, пожалуй, самый заметный пробел.
Запомни эти три пункта, они нам пригодятся в конце, когда будем решать, где GLM уместна, а где лучше оставить Opus.
А почему вообще так легко пересесть
Вот это ключевой момент всего эссе. Обычно уйти от вендора это боль: годы миграции, переписанные интеграции, обучение команды. С моделями не так.
Claude Code, Codex, Cursor это просто оболочки. Под капотом они ходят в модель по API. И если дать им другой адрес и другой ключ, они даже не заметят подмены. Меняешь пару строк и работаешь на другой модели. Никакого лок-ина.
В комментариях на Hacker News поймали красивое: Claude с радостью поможет тебе с него же и слезть. Опиши ему задачу «настрой мне переезд на другую модель», и он всё сделает. Возможно, это первый продукт в истории, который охотно помогает себя заменить.
Ну а раз пересесть так легко, давай не будем верить на слово и сделаем это руками. Прямо сейчас.
Проверяем тезис на себе
План простой. Нам нужно:
- Место, где крутится GLM 5.2 и куда можно ходить по API.
- Claude Code, которому мы подменим бэкенд на эту GLM.
За первое отвечает Ollama Cloud. Раньше Ollama умела гонять открытые модели только локально на твоём железе, а тяжёлые модели домашний комп не потянет. С осени 2025 у них есть облако: те же открытые модели крутятся на их серверах, а ты просто ходишь к ним по API. GLM 5.2 там есть, лежит как glm-5.2:cloud.
Ставим Ollama и логинимся
Скачай Ollama с ollama.com, поставь как обычное приложение. Дальше в терминале логинимся в аккаунт, без этого облако не пустит:
ollama signin
Про подписку и оплату из России
У Ollama Cloud есть бесплатный тариф с лимитами, чтобы попробовать. Но как только начнёшь реально работать в Claude Code, лимиты кончатся за день: агент жрёт токены пачками. Чтобы не упираться, нужен тариф Pro.
И тут первая засада для нас: напрямую с российской картой оплата не проходит. Обходится это через plati.market, там подписку Ollama Cloud Pro продают примерно за 800 рублей в месяц. Берёшь лот, продавец активирует Pro на твой аккаунт.
Первое: активация идёт так, что ты передаёшь продавцу логин от аккаунта Ollama. Заведи под это отдельный аккаунт, не привязывай к нему ничего лишнего. Второе: ссылка выше реферальная, купишь по ней — мне капнет копейка, тебе не дороже ни на рубль. Не хочешь меня кормить, найди лот на plati руками, гайд от этого не поменяется.
Сажаем Claude Code на GLM
А вот теперь магия, ради которой всё затевалось. У Ollama есть нативная совместимость с Anthropic API, тем самым, на котором работает Claude Code. Поэтому подмена бэкенда это буквально одна команда:
ollama launch claude
Команда сама проведёт за руку: покажет список доступных моделей, ты стрелочками выбираешь glm-5.2:cloud, и она запускает Claude Code уже с ним. Никаких переменных окружения и конфигов руками. Интерфейс тот же, к которому ты привык, а под капотом другая модель и другой ценник.
Если уже определился и не хочешь тыкать по менюшкам, есть вариант одной строкой:
ollama launch claude --model glm-5.2:cloud --yes
Тем же способом Ollama подключается к Codex, OpenCode и Droid: ollama launch codex, ollama launch opencode. Так что если твой основной инструмент не клод, связка работает ровно так же. Понадобится Ollama версии 0.15 или новее.
Ollama не ставит сами инструменты. Claude Code (или Codex, OpenCode) уже должен стоять на компе, ollama launch только запускает его с подменённым бэкендом. Если клода ещё нет, поставь его сначала как обычно, с сайта Anthropic. Платная подписка при этом не нужна: раз запросы идут в Ollama, аккаунт Anthropic для этой схемы не требуется вовсе.
Если хочешь понимать, что именно происходит под этой командой (а на канале я всегда за то, чтобы понимать, а не жать «ок»), вот тот же самый запуск руками:
export ANTHROPIC_AUTH_TOKEN=ollama export ANTHROPIC_API_KEY="" export ANTHROPIC_BASE_URL=http://localhost:11434 claude --model glm-5.2:cloud
Видишь всю соль? Мы просто сказали Claude Code: ходи не на серверы Anthropic, а на локальный порт Ollama, а она уже проксирует запрос в облако к GLM. Три переменные окружения, никакой чёрной магии. Ровно тот самый «нет лок-ина», о котором писал Олдерсон, только теперь на твоей машине.
Как пользоваться этим по уму
Тут я тебя притормозю. Соблазн после такого снести Opus и жить на GLM за копейки большой, но это была бы глупость. Умный ход не «дешёвая модель вместо дорогой», а правильная модель под правильную задачу. Вспомни три минуса GLM.
Фоновая и черновая работа: ревью пул-реквестов, генерация тестов, рефакторинг по описанию, разбор логов, первый черновик фичи. Всё, где не жалко подождать лишние секунды и не нужны картинки. Тут GLM экономит тебе деньги пачками и качество не проседает.
Живая интерактивная сессия, где важна скорость ответа. Задачи с макетами, скриншотами, PDF, там где нужен vision. И всё, что упирается в плотный веб-поиск. Здесь фронтир пока честно лучше, и его цена оправдана.
По-хорошему у тебя должно быть две команды под рукой: одна поднимает Claude Code на Opus, другая на GLM. И ты сам решаешь, что дороже в конкретный момент, минута ожидания или доллары на балансе.
Что в сухом остатке
Эссе Олдерсона не про то, что Opus плохой. Он отличный. Оно про то, что впервые у топовых моделей появился конкурент снизу, до которого рукой подать, и это меняет расклад. Раньше «дорого, но выбора нет», теперь «дорого, а вот тут почти то же самое в разы дешевле».
Недавно Anthropic забрали себе целый дата-центр Colossus у SpaceX, 220 тысяч GPU, и это поверх контрактов с Amazon, Google и Microsoft на десятки миллиардов. Обычно такие вложения заканчиваются одним: повышением цен для нас с тобой, не бывает, что компания заносит миллиарды в железо, а подписка остаётся как была. Но теперь у этой логики появился противовес. Цены может прижать не совесть лабораторий, а конкуренция снизу. И это, честно, хорошая новость.
А главное вот что. Все эти оболочки, GLM, подмена бэкенда работают ровно до тех пор, пока ты понимаешь, что делаешь. Три переменные окружения не страшны, если ты знаешь, что за ними стоит. AI это по-прежнему множитель: он умножает на то, что у тебя в голове. Так что пробуй, ломай, разбирайся. Ремесло, а не магия.
Посадил свой Claude Code на GLM? Расскажи, как ощущения и на чём конкретно экономишь: в комментариях под постом в канале или сразу в нашем чате Промптодельня. Собираю кейсы для большого гайда по связке.
Такие разборы выходят регулярно
Короткие мысли и находки я публикую в телеграм-канале, а глубокие разборы, курсы и сообщество, где растут инженеры, живут здесь, в Lab.
Заведи аккаунт в ITUZOV LAB и сохраняй материалы и прогресс чтения.
Зарегистрироваться