Опыт запуска локальных моделей на Nvidia CMP 170

Сама 27b полноценная раз в 10 обрезана по сравнению с любой полновесной моделью квен кими или дипсиком и еще раз в 10 сжата квантизацией. И для чего она тебе нужна? Что ты хочешь получить от этого калькулятора?


Оригинал в Telegram

2+2 посчитать


Оригинал в Telegram

Да я не раз уже писал почему - мне нужна локальная модель, что бы работать в замкнутом корпоративном контуре нормально.

Пару сообщений выше писал что столкнулся с задачей, где у каждой из облачной модели стоял “блок”, защита по кибербезопасности, и только с помощью локальной модели смог решить задачу.


Оригинал в Telegram

Тесты не мои, но уровень у Qwen3.8-27B-xhigh соответствует GPT5.6-Luna-max, в принципе для большинства задач это норма. Если куда-то упирается, то подключить frontier модели для поиска решения и планирования. Т.е. это хороший такой “крепкий” исполнитель, при нормальной производительности.


Оригинал в Telegram

Я могу понять когда такие варианты используются при обычных потоковых задачах - напиши код, создай сайт, посчитай задачу, сделай то или это с указанием конкретных условий и жестко прописанным промтом, но там же нет интеллекта совсем, она не сможет никогда даже на шаг подумать и найти решение из многих переменных, потеряет цель. Сам же используешь, неужели не видишь на что способны все эти квазиИИ.
Все тесты сделаны только для продвижения моделей и поддержания рынка. Не могу сказать про Луну, но Гемини Флеш - это жалкое подобие Гемини ПРО и так же мало пригодна в работе, что бы там не писали в твоих тестах китайцы и гугловцы


Оригинал в Telegram

Да, якобы это слабая сторона как раз моделей с малым количеством параметров. Но это только то что я прочитал, сам пока не сталкивался напрямую, такого рода задач пока не было.


Оригинал в Telegram

На свои задачи надо ориентироваться а не на чьи-то рекламные тесты и бенчмарки. Когда даешь задание написать скрипт и получаешь кучу элементарных ошибок и потом сидишь сам все руками правишь, думая, а нахрена она мне вообще нужна чтоб потом сидеть переделывать все, когда эта же модель за 100р сделает все без единой помарки и без лишних уточнений, просто поняв задачу и сам все продумав и разрулив, предложив еще в сто раз лучший грамотный вариант. А так сидишь два часа промты пилишь и потом ждешь два часа пока сделает и еще после сидишь все исправляешь


Оригинал в Telegram

кароч, удаляем к уям все и идем на завод😄


Оригинал в Telegram

Ну опять таки далеко не для всех задач надо сверх умная модель, тот же квен уже исторически больше заточен на программирование с чем он вполне успешно справляется. Да и фантазии ему там не особо много надо


Оригинал в Telegram

ну так я и написал, что есть варианты использования и это оправдано. Но у Димы же цель иметь интеллект , а не как у тебя писать приложение


Оригинал в Telegram

Мне очень нравится Gemini Flash, из-за скорости. Собрал несколько “легких” проектов на работе, там они достаточно простые с одной стороны, но сам так их и не доделал. С этим “флешем” за три дня между делом сделал один проект, и со вторым сильно продвинулся. Вот мозга хватает мне “за глаза”, и скорость решает.

Кстати, параллельно “взломал” программу для видеорегистраторов и “вынула” оттуда пороли от IP камер и видеорегистраторов :joy: (это сейчас смешно, но где-то это уже страшно, и это при том что их всё больше “защищают” от таких действий).


Оригинал в Telegram

А кто то использует гемени флеш через подписку для Гермеса? Или там через антигравити банят


Оригинал в Telegram

Банят, но есть те кто используют


Оригинал в Telegram

Согласен, здесь бывает такое, но я пока не закрываю себе доступ в frontier моделям, но пытаюсь понять что можно “вынуть” из дешевых и доступных, в том числе локальных. Пока только-только начинаю подходить к бизнес-задачам, т.е. там где реально ценность можно в деньги перевести. Думаю к концу года начну получать какие-то “наметки”, главное что бы ничего не похерил из важного, вот тут у меня есть серьезные опасения уже :confused:


Оригинал в Telegram

лям контекста влезет?


Оригинал в Telegram

Пока нет, сейчас неквантованный с моделью аналогом q4, влезает почти 500К.


Оригинал в Telegram

а если 262к контекст, на скок потоков влезает?


Оригинал в Telegram

2


Оригинал в Telegram

Да и не нужен ей такой контекст
Это модель исполнитель для субагентов


Оригинал в Telegram

у меня в клод коде почти каждый чубагнет берет под 300к контекста


Оригинал в Telegram