Обзор фреймворка Lynx и новой модели Qwen 32B

30 подписчиков

12+
12+

3 просмотра

месяц назад

ПожаловатьсяНарушение авторских прав

30 подписчиков

12+
12+

3 просмотра

месяц назад

ПожаловатьсяНарушение авторских прав
12+
12+

3 просмотра

месяц назад

Автоматическое саммари по записи стрима: - При выборе квантизации модели стоит остановиться на Q4_K_M. Переход на Q8 почти не улучшает качество, но требует вдвое больше ресурсов видеокарты. - Новый фреймворк Lynx пытается объединить удобство веб-технологий с нативной производительностью, как React Native, но пока у него почти нет экосистемы и готовых решений. - Китайские модели, как Qwen, часто показывают впечатляющие результаты в бенчмарках. На практике же они могут работать нестабильно и внезапно переключаться на другой язык в середине ответа. - Не стоит проверять языковые модели, заставляя их решать математические задачи. Они не предназначены для точных вычислений и должны для этого вызывать внешние инструменты, а не считать «в уме». Плейлист: https://www.youtube.com/playlist?list=PLPWIEpU1jfB730QucpqL6bK39-LTrV7Yp Стримы про разработку плагина для Obsidian каждый день https://www.twitch.tv/pfrankov 00:00:00 — Вступление 00:04:09 — Какую модель выбрать для 8 ГБ видеопамяти 00:10:44 — Сравнение квантизации: Q4 против Q8 00:20:15 — Обзор кроссплатформенного фреймворка Lynx 00:25:24 — Недостатки React Native 00:30:52 — Как работает Lynx: нативные компоненты 00:40:40 — Скорость инференса: FP16 против q8 00:51:22 — Новая модель Qwen 32B и её бенчмарки 00:54:40 — Почему метрики производительности могут обманывать 00:56:40 — Бессмысленные тесты для языковых моделей 01:03:40 — Планы на следующий стрим

Название:

Обзор фреймворка Lynx и новой модели Qwen 32B

Категория:

Разное