October 04, 10:00

Forwarded from :

Если модель говорит по-русски, это ещё не значит, что вы с ней на одной волне

Каждую нейросеть нужно адаптировать под понимание и общение на конкретном языке. На примере новой открытой нейросети Яндекса Alice AI Foundation, которую обучили с нуля внутри компании, рассказываем, как ИИ прививают знание русского.

Токенизация на русском

LLM читают текст не по словам или буквам, а по токенам — кусочкам текста, из которых складываются промпты, размышления и ответы. Таким фрагментом может быть один символ, целое слово или его часть. Чтобы нейросеть могла нарезать текст на токены, разработчики заранее составляют для неё словарь. Собирают его автоматически: если слово часто встречается в датасете, оно получает собственный токен. 

Но если обучающие материалы были, скажем, на английском, то русские слова при обработке будут дробиться на несколько токенов. И вообще один и тот же текст на разных языках превращается в разное количество токенов. Например, в Claude Opus 5 фраза «Это тестовый текст для подсчёта количества токенов на разных языках» на русском занимает 17 токенов, а на английском — всего 13.

Словарь Alice AI Foundation создавали на текстах, где преобладал русский, поэтому она эффективно его токенизирует. Поэтому обработка запросов упрощается — модели требуется меньше токенов, чтобы получить результат. Она начинает читать и генерировать текст быстрее, а на оплату её работы требуется меньше денег. Заодно в контекстное окно помещается больше текста, и нейросеть дольше сохраняет память о начале переписки.

Обучение на русском

Материалы для обучения влияют и на то, насколько хорошо модель понимает пользователя. Смысл запросов часто зависит от страны, поэтому просто перевести английские тексты недостаточно — модель нужно обучать на русских, чтобы она понимала местные реалии и культурный код. 

При этом, чтобы модель запомнила факт, его нужно пересказать несколько раз в разных формах. Например, строчку «Пётр I основал Петербург в 1703 году» для обучения превращают в реплику экскурсовода, в запись в духе исторической заметки и в вопрос с ответом. 

Тестирование на русском

Результат адаптации под русский язык нужно проверять на специальных тестах, основанных на популярных запросах пользователей. Для Alice AI Foundation в Яндексе разработали собственные тесты на знание истории, права, английского и общих фактов. В последней категории, к примеру, она набрала 86,5 балла против 83,2 китайской DeepSeek-V4-Flash-Base, которая в 3,5 раза больше.

Alice AI Foundation получилась компактной благодаря архитектуре MoE: из 80 млрд параметров для обработки токена задействуются лишь около 3 млрд. Так модель вмещает больше знаний, но требует меньше вычислений — и на многих задачах обходит более крупные открытые нейросети.

Релиз модели заметили и за рубежом, где её включили в число ключевых запусков недели. А подробнее о разработке и обучении Alice AI Foundation можно почитать в техрепорте.

Подписывайтесь 👉 @techno_yandex