zlm5.3-flash пробовали?
по моим субъективным ощущениям она лучше qwen3.8-27b , но тут надо тестровать на своих задачах. я купил подписку среднюю. могу на денек вам ключ апи дать погнять.
Вот у меня какая подписка.
Лимиты: 12 000 кредитов в 5-часовом окне + 60 000 кредитов/неделю (недельные сбрасываются каждые 7 дней от даты подписки — у тебя как раз 06.09).
• Токены на GLM-5.3: примерно 290–580 млн токенов/нед (при cache hit 95%: нижняя граница — всё в пик, верхняя — всё вне пика ×0.5).
• На GLM-5.3-Flash: ~877–1 755 млн токенов/нед — почти в 3 раза больше на тех же кредитах.
• Вне пиковых часов (пн–пт 14:00–18:00 UTC+8 = 09:00–13:00 МСК) расход кредитов вдвое меньше — тяжёлые задачи выгодно гонять вне этого окна.
• Бонус: по кампании z.ai с 23:00 до 09:00 (по сингапурскому времени?) у Pro удвоенная квота на GLM-5.3-Flash в агентах — детали: docs.z.ai/devpack/notice/event-glm-5.3-flash.
Расход по факту: https://z.ai/manage-apikey/billing → Charge Type.
Источник: docs.z.ai/devpack/overview (04.09.2026).
https://z.ai/subscribe?ic=XKRDCWGO8L - если зайдет можете через реферальную ссылку купить и вам хорошо и мне приятно.
я квартальный вариант брал, у них 20% скидка сейчас, т.е. получается 64$, а если на год берешь 30%, то вообще 56$ за месяц. минимакс это вы про какую имеете ввиду модель? я просто в августе на бесплатных токенах у квен много разных попробовал. но Квен дороже стоят токены
Спасибо за предложение.
Я подписками “обложен” полностью
уже не знаю куда их девать: ClaudeCode, Codex, Antigravity, Grok, Qwen, DeepSeek API, OpenAi API. Но задача основная - получить сильную локальную модель, но при огранчиенных ресурсах, пока это диапазон 500-1’000 тыс. руб. на всю инфраструктура (сервер+карты) из этого бюджета осталось максимум на еще либо 2 CMP170hx (всего значит будет 4 шт.) либо одну 5090 либо пару 4090.
Ставка основная была на Qwen3.8-27b, но вижно теперь вижу где его предел, нужно теперь искать что-то сильнее в те ресурсы которые мне доступны. Теперь надежда на , Qwen-next-flash либо искать что-то ещё, тот же deepseek-flash как вариант.
Вот и “экспериментирую” что бы внедрить в корпоративный контур но только он должен быть замкнут, т.е. всё локально.
https://www.youtube.com/watch?v=Nm_zN6RQ_eE вечером тестить буду, сейчас тенденция идет в MoE, оперативка и небольшое количество рабочих параметров на эксперта дают вполне годную производительность при неплохом качества. Да, медленнее, чем на 5090 или 6000, но ценник сильно приятнее и размер небольшой. Я успел свою strix halo взять за 230к
не надо искать модель. нет её. надо искать какое железо купить чтобы на нем заработала модель которая выйдет через месяц, полгода, год. все сегодняшние модели будут забыты а железо останется.
Да как бы все облачные модели давно уже мое. Впринципе в размере 120-250 много вариантов как и писали. Я бы в сторону дипсика смотрел