Опыт запуска локальных моделей на Nvidia CMP 170

капчу как то не хочется добавлять


Оригинал в Telegram

просто бота админа поставь и пусть следит


Оригинал в Telegram

22Гб это только на поиграться пока, большОго контекста не получить, а если бить по нескольким картам, сразу идёт проигрыш в производительности из-за обмена данными между картами по pcie.


Оригинал в Telegram

Думаешь люди не справятся :slight_smile:


Оригинал в Telegram

да)


Оригинал в Telegram

так cmp сама по себе небыстрая, а парочка по22 гига как раз даст объем сравнимый с разлоченной. то есть контекст именно в наличии альтернатив близких по цене


Оригинал в Telegram

Она не быстрая на единичном потоке, но очень производительная при параллельных запросах, производительность почти не падает. Т.е. если запускать параллельную работу субагентов, либо просто много человек будет работать параллельно, то карта почти не просаживается по генерации, что огромный плюс. А вот с несколькими картами rtx2080 производительность будет только падать, из-за необходимости обмена между картами.


Оригинал в Telegram

пусть падает. вопрос в альтернативе. альтернативы сами по себе не гарантируют полную замену, где-то могут проигрывать, где-то выигрывать. в этом случае пусть проиграют по производительности но выиграют по цене, доступности и отсутствии лотереи с разлочкой


Оригинал в Telegram

cmp сама по себе уже альтернатива какой нибудь a100 и ничего, вполне себе альтернатива


Оригинал в Telegram

Согласен, но всё-таки это не альтернатива. Задачи всё-таки разные. У меня встал вопрос организации внутреннего контура доступа ~40 сотрудников к ИИ, что бы не перебирал, всё не нравилось, и вот cmp как глоток свежего воздуха, попробовать за относительно недорого подходящее решение.


Оригинал в Telegram

Оно по факту и есть. Мне нужно собрать mvp за минимум усилий и средств, если подтверждается, то уже собирать на нормальных решениях. Это всё игрушки пока с cmp в том числе.


Оригинал в Telegram

За последнюю неделю цена выросла со 1500$ до почти 2700$ и возможно будет рости дальше, все таки ближайший конкурент А100, правда новый и с большими объёмом памяти стоит порядка 8’500$.


Оригинал в Telegram

Гоняю весь вечер Qwen3.8-27b на патченой майнинговой Nvidia CMP170hx и сравниваю с RTX4090 и мне крайне нравится производительность первой. Пока никаких минусов в части производительности не вижу, но запас по контексту и то что огромный сама модель фактически в q8 умещается, сильно радует.

Пока я доволен, возможно даже могу рекомендовать. Даже учитывая что эти карты сильно подорожали, это даже дешевле чем RTX 4090.

Сегодня даже была возможность сравнить по качеству GPT5.6 Luna Max, и локальную модель. Первый очень сильно начал “тупить”, даже не представляю что с ним случилось, как будто бы ещё пару дней назад такого не замечал за этой моделью, ну и очень медленно к результату идёт.

Также в задачах по вскрытию локальной базы мессенджера MAX (надо было свои сообщения достать, а экспорта в МАКсе не предусмотрено :man_facepalming:) и ни одна облачная модель из ТОПа не взялась, а локальный qwen отлично справился.

В общем - рекомендасьён :slight_smile:


Оригинал в Telegram

Ну дык так вроде новая версия же вышла?) Надо продвигать AGI что бы они под этим не подразумевали


Оригинал в Telegram

Хотя народ уже ржет что модель которая типа первый AGI по бенчмаркам оказалась среднячком


Оригинал в Telegram

Дай разницу - какие веса и какие характеристики получились на cmp170x


Оригинал в Telegram

вон новые бенчмарки подъехали, чуть лучше опуса поитогу. Правда будет очень интересно, какая будет аргументация, когда выйдет опус 5.1


Оригинал в Telegram

правда твиттерским неведома логика и они думают, что если модель специально надрочили на бенчмарк то это сразу AGI
да, она более токен-эффективная, но уж точно не AGI


Оригинал в Telegram

Для начала стоит дать определение agi а то говорить можно многое а что оно реально закладывается в этот термин не кто не знает


Оригинал в Telegram

Сам в основу закладываю qwen3.8-27b-w4a16-awq, это соответствует примерно GGUF UD-Q4_K_XL.


Оригинал в Telegram