Опыт запуска локальных моделей на Nvidia CMP 170

zlm5.3-flash пробовали?


Оригинал в Telegram

Если без режима рассуждения, то норм.


Оригинал в Telegram

Нет, ни облачную, ни локальную, на последнюю локальных ресурсов не хватит.


Оригинал в Telegram

по моим субъективным ощущениям она лучше qwen3.8-27b , но тут надо тестровать на своих задачах. я купил подписку среднюю. могу на денек вам ключ апи дать погнять.
Вот у меня какая подписка.
Лимиты: 12 000 кредитов в 5-часовом окне + 60 000 кредитов/неделю (недельные сбрасываются каждые 7 дней от даты подписки — у тебя как раз 06.09).
Токены на GLM-5.3: примерно 290–580 млн токенов/нед (при cache hit 95%: нижняя граница — всё в пик, верхняя — всё вне пика ×0.5).
На GLM-5.3-Flash: ~877–1 755 млн токенов/нед — почти в 3 раза больше на тех же кредитах.
• Вне пиковых часов (пн–пт 14:00–18:00 UTC+8 = 09:00–13:00 МСК) расход кредитов вдвое меньше — тяжёлые задачи выгодно гонять вне этого окна.
• Бонус: по кампании z.ai с 23:00 до 09:00 (по сингапурскому времени?) у Pro удвоенная квота на GLM-5.3-Flash в агентах — детали: docs.z.ai/devpack/notice/event-glm-5.3-flash.

Расход по факту: https://z.ai/manage-apikey/billing → Charge Type.

Источник: docs.z.ai/devpack/overview (04.09.2026).
https://z.ai/subscribe?ic=XKRDCWGO8L - если зайдет можете через реферальную ссылку купить и вам хорошо и мне приятно.


Оригинал в Telegram

Это порошка за 80? С минимакс не сравнивал качество?


Оригинал в Telegram

я квартальный вариант брал, у них 20% скидка сейчас, т.е. получается 64$, а если на год берешь 30%, то вообще 56$ за месяц. минимакс это вы про какую имеете ввиду модель? я просто в августе на бесплатных токенах у квен много разных попробовал. но Квен дороже стоят токены


Оригинал в Telegram

Минимакс м3 там в подписке за 50 выходить 2.5-3.5б в неделю с кешем 95%


Оригинал в Telegram

все я понял. я таких не знал. интересно будет сравнить.


Оригинал в Telegram

Спасибо за предложение.

Я подписками “обложен” полностью :slight_smile: уже не знаю куда их девать: ClaudeCode, Codex, Antigravity, Grok, Qwen, DeepSeek API, OpenAi API. Но задача основная - получить сильную локальную модель, но при огранчиенных ресурсах, пока это диапазон 500-1’000 тыс. руб. на всю инфраструктура (сервер+карты) из этого бюджета осталось максимум на еще либо 2 CMP170hx (всего значит будет 4 шт.) либо одну 5090 либо пару 4090.

Ставка основная была на Qwen3.8-27b, но вижно теперь вижу где его предел, нужно теперь искать что-то сильнее в те ресурсы которые мне доступны. Теперь надежда на , Qwen-next-flash либо искать что-то ещё, тот же deepseek-flash как вариант.

Вот и “экспериментирую” что бы внедрить в корпоративный контур но только он должен быть замкнут, т.е. всё локально.


Оригинал в Telegram

https://habr.com/ru/articles/1071442/


Оригинал в Telegram

https://www.youtube.com/watch?v=Nm_zN6RQ_eE вечером тестить буду, сейчас тенденция идет в MoE, оперативка и небольшое количество рабочих параметров на эксперта дают вполне годную производительность при неплохом качества. Да, медленнее, чем на 5090 или 6000, но ценник сильно приятнее и размер небольшой. Я успел свою strix halo взять за 230к


Оригинал в Telegram

не надо искать модель. нет её. надо искать какое железо купить чтобы на нем заработала модель которая выйдет через месяц, полгода, год. все сегодняшние модели будут забыты а железо останется.


Оригинал в Telegram

Да как бы все облачные модели давно уже мое. Впринципе в размере 120-250 много вариантов как и писали. Я бы в сторону дипсика смотрел


Оригинал в Telegram

Китаец там тоже каких то китайских девушек легкого поведения предлагает )


Оригинал в Telegram

У нее по любому с таким объемом весов внимание поплывет при большом контексте


Оригинал в Telegram