Falcon-Emirati-7B: чат Falcon и 84,83% на Alyah

6 октября 2026 года Technology Innovation Institute выложила на Hugging Face Falcon-Emirati-7B. Если бот отвечает людям из ОАЭ, литературный арабский (MSA) часто промахивается: слова на месте, а шутка, торг и бытовая фраза уже нет. Эмиратский диалект живёт отдельно от языка новостей и учебника. Модель собрана как раз под этот зазор.

Попробовать её можно в чате Falcon. В ссылке уже подставлен id: Falcon-Emirati-7B.

С нуля её не учили. Основа Falcon-H1-Arabic, вариант на 7 миллиардов параметров. В семье ещё 3B и 34B. В январском анонсе базы у 7B и 34B окно 256 тысяч токенов, у 3B 128 тысяч. В каждом блоке параллельно идут Mamba и внимание трансформера, перед проекцией выходы склеивают. TII остановилась на 7B: нюанс диалекта держится, а учить модель и отвечать ею дешевле, чем на 34B. Трёх миллиардов, пишут они, под культурный слой уже не хватает.

Три источника диалекта

Эмиратский в основном говорят, а не пишут. В сети его меньше, чем литературного арабского и даже других диалектов Залива. Смысл часто не в словах. Пословица, набатийская поэзия, короткая байка. Дословный перевод такое убивает.

Готового рецепта, сколько диалекта мешать с литературным и на каком этапе обучения, не было. Дальше шли прогоны. Меняли долю диалектных данных, этап и баланс живых текстов с синтетикой. Синтетику легко перекормить: модель начинает звучать как генератор, а не как человек. Отдельно смотрели, сколько текстов на литературном арабском про культуру ОАЭ нужно, чтобы речь была не только беглой, но и по делу. Автоматический балл дополняли носители. Их интересовали естественность, тон и уместность, а не только верный пункт в тесте.

Сами тексты собрали в три слоя. Первый: сайты и форумы, где эмиратцы пишут на диалекте сами, без перевода с литературного. Второй: литературный арабский про обычаи, историю, нормы и то, как эмиратцев обычно описывают снаружи. Этот слой не учит модель говорить на диалекте. Он даёт предмет разговора. Третий слой синтетический, но генератору не дали импровизировать «примерно по-заливски». Его держали глоссариями и словарями эмиратской лексики и грамматики. Без этой узды текст грамматически ровный и на слух чужой.

Alyah: 84,83%

Главную цифру сняли на Alyah, الياه, «северная звезда». 1173 вопроса с выбором ответа, собраны вручную у носителей. Семь категорий, от приветствий и этикета до образной речи, наследия и поэзии. Набор лежит отдельно: tiiuae/alyah-emirati-benchmark. Сборку и разбивку по категориям TII вынесла в отдельный пост.

Falcon-Emirati-7B набирает 84,83%. Выше всех арабских и мультиязычных моделей в их сравнении, включая те, что в разы крупнее. На графике модели, дообученные отвечать в диалоге. Семью Falcon-H1-Arabic из таблицы убрали: новая модель собрана поверх неё. Размер сам по себе диалект не покупает. Крупная мультиязычная модель здесь легко проигрывает меньшей, если ту с самого начала учили под арабский. Поэзию, наследие и сам языковой слой всё равно закрывают отдельными данными, а не лишними параметрами.

Ответ на диалекте, не галочка

Выбор из четырёх вариантов не говорит, заговорит ли модель по-эмиратски сама. Те же 1173 вопросов дали открытым текстом. Смысл и диалект считали по отдельности. Разбирала Gemini 3.7 Flash как модель-оценщик (judge). В сравнении пять моделей: Falcon-Emirati-7B, ALLaM-7B-Instruct-preview, gemma-3-27b-it, Jais-2-8B-Chat и Fanar-2-27B-Instruct.

По смыслу впереди Falcon-Emirati-7B. По диалекту отрыв другой. Частичный балл за то, что ответ действительно на эмиратском: 0,52 против 0,05 у ALLaM, 0,03 у gemma-3-27b-it, 0,02 у Jais-2-8B-Chat и около нуля у Fanar-2-27B-Instruct. Строгий зачёт, уже без промежуточной оценки: 0,20 у Falcon-Emirati-7B, 0,02 у ALLaM, 0,01 у gemma-3-27b-it, ноль у Jais и у Fanar. Соседи часто знают ответ и произносят его литературным арабским, даже если вопрос был на диалекте. На эмиратский стабильно переключается одна модель из пяти.

Fanar-2-27B-Instruct ещё и молчит. Пропускает 26,2% вопросов, у остальных меньше 5%. Частичный балл за верность смысла у неё 0,27, худший из пяти. Модель и реже берётся за эмиратский вопрос, и слабее по содержанию.

Картина держится по всем категориям Alyah, от бытового приветствия до поэзии. Ровнее соседи только там, где эмиратский и литературный сильнее пересекаются: приветствия и короткие бытовые формулы. Общая арабская модель может случайно попасть в тон, даже без отдельной учёбы на диалекте.

Тот же Gemini 3.7 Flash ставил ответы парами и не знал, чей какой. С Jais-2-8B-Chat разрыв шире всего в поэзии, 0,69 против 0,31, и в языке и диалекте, 0,62 против 0,38. С ALLaM-7B-Instruct-preview те же две категории: поэзия 0,66 против 0,34, язык и диалект 0,58 против 0,42. С Fanar-2-27B-Instruct Falcon-Emirati-7B забирает каждую категорию. Верх в поэзии, 0,88 против 0,12, и в религиозной и социальной чувствительности, 0,80 против 0,20.

Приветствия снова выбиваются. Jais чуть впереди, 0,54 против 0,46. С ALLaM ничья на 0,50. Fanar и тут позади, 0,30 против 0,70. На странице есть пять живых запросов рядом с Fanar и ALLaM: поздравление к празднику, местная история, поэзия, наследие. Ответы показаны как есть. В них, предупреждает TII, бывают ошибки. Подсветка только метит их модель и не ставит оценку фактам.

283 сценария про ОАЭ

Диалект без местных привычек тоже легко промахивается. Эмиратскую часть ArabCulture-Dialogue прогнали на 283 сценариях, и на диалекте, и на литературном арабском, с разным количеством подсказок о месте. Из трёх реплик надо выбрать культурно уместную. Описание набора в статье ACL 2026.

Falcon-Emirati-7B набирает 85,57%. ALLaM-7B-Instruct-preview 83,39%. Jais-2-8B-Chat 73,79%. Fanar-2-27B-Instruct 71,50%. Это их собственный прогон, на графике так и подписано. Отрыв от ALLaM тут уже небольшой. Знать, какую реплику выбрать в совете, и ответить на диалекте, разные навыки. На культуре ALLaM почти рядом. На диалекте у неё был частичный балл 0,05 против 0,52.

В чат модель уже выложена, id в адресе тот же: chat.falconllm.tii.ae. Редкие обороты и сильно местные отсылки она путает, TII пишет это прямо. Носители сами не всегда согласны, какой ответ верный. Перед официальным текстом или чувствительным диалогом лучше прогнать свои переписки, а не подставлять средний балл Alyah вместо них.

Источники и ссылки


Комментарии загружаются…