Опыт запуска локальных моделей на Nvidia CMP 170

так что хз хз
ну 262к норм


Оригинал в Telegram

Ну так флеш раз в 100 умнее квена 27b Q4 я тебе и пишу что ты хочешь получить от 27b если она даже » EOS пишет с ошибками и сама меняет заглавные буквы там где не надо и ничего тебе не говорит. Если уж хватает для работы 27b ну так и запусти полноценную, ей надо всего 60Гб памяти и будет почти флеш на домашнем компе.


Оригинал в Telegram

Компрессия в помощь и декомпозиция задач


Оригинал в Telegram

На самом деле не показатель, каждая модель по разному себя ведёт в плане заполнения контекста


Оригинал в Telegram

Есть очень говорливые модели а есть которые практически тоже самое делают в разы короче


Оригинал в Telegram

Да, буду дальше тестировать, видел что qwen3.8-flash появился, следующий шаг.


Оригинал в Telegram


ну понятно, что можно пересобрать
но как факт


Оригинал в Telegram

[Видео] video/mp4 1280x720 14s


Оригинал в Telegram

Вот как это “ощущается”.


Оригинал в Telegram

Сообщение удалено в Telegram.

у тебя 2 по 4090 стоят?
Как саб агент он подходит заебись? условно ГПТ6 может его вызывать как саб агента 48 шт одновременно?


Оригинал в Telegram

Одна 4090 и собрал сервер на двух Nvidia CMP170hx с анлоком памяти.


Оригинал в Telegram

Надо попробовать :slight_smile:


Оригинал в Telegram

ну 2 парралельных потока это не 2 субагента, а примерно 4, тк агент не всегда генерит токены, иногда он ждет тулзы и тд


Оригинал в Telegram

Подтверждаю - qwen3.8-27b туповат :slight_smile:

Уехал в командировку и надо было удалённо сменить локацию VPN, решил через Hermes это сделать - 3 дня, и только промежуточный этап получилось сделать
Тоже самое примерно решал через codex на GPT5.6 luna max, это все заняло 30 минут максимум.

Т.е. я не подтверждаю как в тестах пишут что qwen3.8-27b-xhigh = gpt5.6-Luna-max, первый значительно “тупей” :smiling_face_with_sunglasses: пришлось сперва hermes гонять на deepseek, так как работает без VPN, восстановить работу codex и уже с его помощью всё остальное делать :joy:

Буду активнее пробовать qwen3.8-next-flash, посмотрим насколько он сообразительнее.


Оригинал в Telegram

В разработке и в науке всегда используется скептический подход. Это исключает завышенные ожидания и излишний розовый цвет стекол в очках, не дает отходить от реальности и новые изменения подтверждаются большим количеством доказательств. Проще говоря, как в анекдоте про двух быков, молодого и старого, медленно медленно спустимся с горы и отымеем все стадо)


Оригинал в Telegram

Так что всегда нужны те кто хейтит и ни во что не верит, требуют больших доказательств. Позволяет не наступать на те грабли, у которых уже вся ручка в крови от разбитых лбов)


Оригинал в Telegram

не очень он сообразительный. а qwen3.8-max-0902 - это реально совсем другой уровень. конечно не астра с попусом, но прямо таки хорош


Оригинал в Telegram

Ну вот да, тестирование продолжаем, для qwen3.8-27b оставляю “чатик” и лёгкие офисные задачи, и ищу сильную агентную модель дальше.


Оригинал в Telegram

одна беда, достаточно долго думают, как по мне


Оригинал в Telegram