Gemma 4 12B MTP на RTX 4070 Ti: 110-120 токенов

Для любителей пострадать тут на днях вышла gemma4 12B сегодня появилась MTP версии на 4070ti 12Gb vram получилось 110-120токенов

Параметры запуска:
.\llama-server -m C:/Users/denio/.cache/lm-studio/models/unsloth/gemma-4-12B-it-qat-GGUF/gemma-4-12B-it-qat-UD-Q4_K_XL.gguf --host 192.168.0.102 --port 8080 --spec-draft-model C:/Users/denio/.cache/lm-studio/models/unsloth/gemma-4-12B-it-qat-GGUF/gemma-4-12B-it-Q8_0-MTP.gguf --spec-type draft-mtp --spec-draft-n-max 4 -fitt 1024 --cache-type-k q4_0 --cache-type-v q4_0 -np 1 -fa 1 --alias “gemma-4-12B” -c 131072

С агентами не пробовал пока новую версию но из наблюдейний были проблемы с инструментами в опенкод вчера


Оригинал в Telegram · @deniom3

Сообщение удалено в Telegram.

Ну для агента хз я хочу в опенкод юзать


Оригинал в Telegram · @deniom3

Гемма что бы писала код а облачная модель ставила задачи и проверяла


Оригинал в Telegram · @deniom3

Если проблемы с инструментами есть фикс https://gist.github.com/jscott3201/ad69c4ffbd79f18b11a0f6a94c94fadf через --chat-template передавать


Оригинал в Telegram · @deniom3

Но это походу только для чистой версии от гугл


Оригинал в Telegram · @deniom3

Сообщение удалено в Telegram.

Ну вчера она мне все таки накодила даже не мтп версия но тогда было 50-60 токенов всего


Оригинал в Telegram · @deniom3

Но были проблемы с едит и контекстом


Оригинал в Telegram · @deniom3

А в tool умеет она?


Оригинал в Telegram · @terranqwal0

Может но не супер стабильно… По крайней мере в опен код путается переодически. Квен 35б стабильней хоть и всего 35-40 токенов


Оригинал в Telegram · @deniom3