Bilibili открывает исходный код Index-Translate: семейство моделей перевода на базе Qwen3.5 для 150 языков

ии перевод Bilibili Llm многоязычность модели pandaily.com

Bilibili выпустила Index-Translate под лицензией Apache-2.0: модели перевода для 150 языков (2B, 9B, 35B-A3B preview), а также варианты для озвучки, контроля слогов и длинных документов.

Команда Index LLM компании Bilibili 30 сентября представила Index-Translate — семейство многоязычных моделей перевода, построенных на базе Qwen3.5 от Alibaba. Текстовые модели охватывают 150 языков, включая китайский и английский, и опубликованы под лицензией Apache-2.0 на Hugging Face и ModelScope в размерах 2B, 9B и 35B-A3B (предварительная версия), вместе с техническим отчетом, кодом на GitHub и онлайн-демо.

Помимо простого перевода, модели следуют инструкциям по терминологии, форматированию и содержанию, которое должно остаться без изменений. В одном из примеров со страницы проекта модель 9B перевела уведомление о игровом обслуживании в формате JSON на корейский язык, сохранив его структуру, звездочки и хештег, которые пользователь просил оставить. Семейство расширяет ту же многоязычную базу в три специализированных ветви. Index-Echo создает переведенные субтитры или озвучку, сохраняющую характеристики голоса исходного диктора; его пакетное решение «речь-в-речь» охватывает перевод с китайского на английский, испанский и японский, а также с английского на китайский, испанский и японский. Index-Homura корректирует перевод под целевое количество слогов, что важно для дубляжа и субтитров. Index-NativeLong, опубликованный под идентификаторами моделей Index-Nailong, переводит целые документы и сохраняет ссылки между ними.

Примеры Bilibili отражают контент ее собственного сообщества. Учитывая фразу из сленга геймеров о желании поиграть в Final Fantasy XIV, модель 9B перевела ее как «Когда появляется зуд FFXIV, просто иди и играй». В фэнтезийном тексте объемом около 32 000 токенов, где имя персонажа могло также читаться как королевский титул, модель для длинных документов сохранила имя последовательно во всем тексте, в то время как та же модель 9B, работая по частям, перешла к другим вариантам.

По собственным тестам команды, предварительная версия 35B-A3B показывает результат 0,8794 по FLORES (COMET-22) и 76,76 по WMT26 judge score, в то время как 9B показывает 0,8789 и 75,35. Некоторые крупные общие модели показывают более высокие результаты по WMT26 в той же таблице, включая DeepSeek-V4.1-Flash с результатом 83,55. При следовании инструкциям в условиях ограниченных ресурсов модель 9B показала лучший результат по инструкциям — 0,7725, и самый низкий процент отклонений от темы — 3,47% — среди всех сравниваемых моделей. Index-Homura-9B попадает в пределах 10% от запрошенного количества слогов в 81,92% случаев по тесту SandGlass команды. Команда также разработала бенчмарки для следования инструкциям, сообщественного сленга и контроля слогов.

Репозиторий также включает расширение для браузера для перевода веб-страниц с локально развернутой моделью и конвейер для озвучивания видео. Bilibili планирует выпустить официальную модель 35B-A3B, опубликовать свои бенчмарки с открытым исходным кодом, добавить языки в Index-Echo и выпустить более крупные модели.

СМОТРИТЕ ТАКЖЕ:Tencent Hunyuan открывает исходный код модели перевода 1.5 · Alibaba открывает веса модели Qwen3.8 MoE · IQuest Research открывает исходный код IQuest-Q1

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: