Нейросеть пишет в моём стиле: профиль вместо дообучения
Чтобы нейросеть писала вашим голосом или голосом вашего бренда, её не нужно ничему учить. Не нужно ни датасетов, ни видеокарт, ни ночей ожидания: хватает вечера и одного текстового файла. В ролике я снимаю профиль стиля с живого телеграм-канала Альфа-Банка, пишу по нему новый пост из водянистого исходника и проверяю результат двумя способами: сверкой по признакам и внешним детектором Яндекса. Что показываю по шагам: · почему дообучение здесь не работает: манера зашивается в веса конкретной модели, и при переходе на другую модель работу придётся повторять заново; · почему просьба «перепиши в стиле Альфа-Банка» не помогает: модель знает про автора факты, а не приёмы, из которых сделан голос; · из чего состоит профиль: замеры (их считает скрипт), карта голоса (её пишет модель) и правила генерации, по которым пишется новый текст; · как навык собирает корпус: из 1085 сообщений канала берутся 252 своих текста, 805 картинок без подписи и 28 пересылов отбрасываются; · главная цифра: длинное тире у канала стоит 42 раза на тысячу слов, вилка от 24 до 63, то есть первый «признак нейросети» у живого бренда обязателен; · результат сверки: водянистый исходник даёт 14 отклонений из 31, наивный промпт те же 14 из 31, текст по профилю 2 из 31, при том что живые посты канала дают от 2 до 5 по тому же счёту; · внешний детектор: исходник помечен машинным, текст по профилю человеческим. Оба навыка открыты и ставятся двумя командами прямо в Claude Code: /plugin marketplace add vyacheslav-startsev/claude-plugins /plugin install style-skills@startsev-plugins Исходники навыков: https://github.com/vyacheslav-startsev/claude-plugins Одну вещь в ролике я не сказал, а она нужна. Морфологию (части речи, времена, лицо) скрипт считает через две библиотеки, и их надо поставить отдельно, одной командой: pip install razdel pymorphy3 pymorphy3-dicts-ru Без них ничего не сломается: скрипт посчитает геометрию, лексику, служебные слова и пунктуацию, а в профиле напишет «морфология не посчитана». Но в ролике профиль снят со всеми слоями, так что для повторения шаг за шагом библиотеки лучше поставить сразу. Первый навык снимает профиль с текстов автора, второй пишет по готовому профилю новый текст. Как навыки Claude Code устроены изнутри, разбирал в пятой части серии «Как устроены ИИ-агенты»: https://youtu.be/ifelEZKKX9k Разборы про дообучение, о которых говорю в начале: Хабр, «Создайте свой клон с помощью Fine-tuned LLM»: https://habr.com/ru/articles/757086/ Системный Блокъ, «Как дообучить языковую модель писать в стиле Достоевского»: https://sysblok.ru/courses/kak-doobuchit-jazykovuju-model-pisat-v-stile-dostoevskogo/ Исследование про имитацию стиля, на которое опираюсь во втором блоке: 400 с лишним авторов, 40 тысяч с лишним генераций, вывод про усреднённый тон. Важная оговорка: там проверяли примеры в промпте, а не дообучение. arXiv:2509.14543: https://arxiv.org/abs/2509.14543 Задание: снимите профиль со своих текстов, прогоните сверку на своём посте и напишите в комментариях, сколько отклонений она показала. 0:00 Голос без дообучения: что обещает ролик 0:34 Ложный путь: датасет, видеокарта и ночь обучения 1:35 Проверяем очевидное: просто просим «перепиши в стиле» 2:00 Модель знает про автора факты, а не приёмы 2:31 Что такое профиль стиля: замеры, карта голоса, правила 3:58 Снимаем профиль с канала: 252 поста из 1085 сообщений 5:36 Что внутри профиля: тире 42 раза на тысячу слов 7:18 Пишем новый пост по профилю 8:10 Сверка трёх текстов по одним и тем же признакам 8:42 Числа: 14 из 31, 14 из 31 и 2 из 31 9:20 Почему признаки нейросети ничего не значат 10:30 Где взять навыки 10:49 Задание для вас
Название:
Нейросеть пишет в моём стиле: профиль вместо дообучения
Категория:
Разное