Языковые модели ДНК научились находить гены и их строение — даже у видов, которых не видели в обучении

Когда секвенируют геном нового вида, первым делом нужно понять, где в нём гены и как они устроены. Исследователи из AIRI, ВШЭ, Университета «Сириус», Института цитологии и генетики СО РАН и других центров представили GENATATORs — модели, которые делают такую разметку только по последовательности ДНК. Работа выложена 21 июня 2026 года и представлена на конференции ECML PKDD в сентябре.
Что именно исследовали
Разметка генов — это ответ на вопросы: где ген начинается и заканчивается, что он кодирует — белок или некодирующую РНК, из каких частей состоит. Обычно для этого нужны дополнительные данные о том, какие участки генома реально считываются в клетке. «С нуля», по одной последовательности, это получается плохо.
Авторы проверили, помогают ли тут языковые модели ДНК, которые, как и текстовые, учатся на огромных массивах последовательностей.
Как это работает
Языковая модель ДНК читает геном как текст из четырёх букв. Сама по себе, после предобучения, она не «знает», где гены: авторы показали, что её внутренние представления не содержат нужных признаков для точной разметки.
Поэтому модели дообучили на размеченных генах 39 видов млекопитающих и человека. Модель проходит по последовательности и для каждой позиции решает, к какой части гена она относится. Это похоже на корректора, который учится расставлять заголовки и абзацы в тексте без форматирования.
Проверяли несколько архитектур — от компактной модели на 16 миллионов параметров до трансформеров на 120 и 360 миллионов — с окном от 4 тысяч до 250 тысяч букв ДНК.
Что ИИ теперь умеет
- Размечать гены по одной последовательности ДНК: границы, тип транскрипта, внутреннее строение
- Переносить умение на виды, отделённые от обучающих сотнями миллионов лет эволюции, — от растений до дрожжей
- Работать с белок-кодирующими генами и с генами длинных некодирующих РНК
Что показал эксперимент
Втрое больше верно собранных генов. На 20-й хромосоме человека лучшая модель правильно разметила более чем в три раза больше генов, чем инструменты Tiberius и AlphaGenome, — во всех категориях транскриптов.
Другие царства. На растении Arabidopsis thaliana модель заметно обошла Tiberius и AUGUSTUS, на пекарских дрожжах нашла более чем вдвое больше генов, чем AUGUSTUS.
Стандартная метрика. По привычной покомпонентной оценке GENATATORs примерно на 10% лучше аналогичных моделей сегментации.
Модели и рейтинг открыты на Hugging Face.
Что пока не работает
- Даже лучшие модели правильно размечают лишь около 30–40% всех генов человека. Задача далека от решения.
- Сложнее всего определить точные границы гена, особенно нетранслируемых участков.
- Предобученные модели ДНК сами по себе строение генов не улавливают — без дообучения на размеченных данных метод не работает.
- Модели распространяются по некоммерческой лицензии CC BY-NC 4.0.
Почему это важно
Новые геномы расшифровывают быстрее, чем их успевают размечать. Метод, который работает только по последовательности и переносится между видами, ускоряет превращение «сырого» генома в карту, с которой могут работать биологи и медики.
Отдельно ценно честное сравнение: авторы показали, где модели пока проигрывают, и предложили биологически осмысленные метрики вместо удобных.
Можно ли попробовать
Оригинальное исследование
GENATATORs: ab initio Gene Annotation With DNA Language Models
- Авторы
- Aleksei Shmelev, Artem Shadskiy, Yuri Kuratov, Mikhail Burtsev, Olga Kardymon, Veniamin Fishman
- Организация
- AIRI, НИУ ВШЭ, Университет «Сириус», London Institute for Mathematical Sciences, Институт цитологии и генетики СО РАН, Quantori
- Дата
- 21 июня 2026 г.
- Тип
- Препринт
Ещё исследования

ИИ впервые полностью формализовал доказательство Великой теоремы Ферма — и компьютер его проверил
За 11 дней почти без участия людей Claude перевёл доказательство Великой теоремы Ферма на язык Lean, где каждый шаг проверяет машина. Получилось 13 миллионов строк кода и 29 511 теорем. Кевин Баззард назвал это выдающимся достижением.

ИИ научился восстанавливать набранные предложения по сигналам мозга — без операции
Brain2Qwerty v2 от Meta* и французских научных центров восстанавливает набираемые предложения по записи мозга снаружи головы. В среднем ошибочны 39% слов, у лучшего участника половина фраз — с ошибкой не больше чем в одном слове.

ИИ предсказал последствия всех 9 миллиардов возможных «опечаток» в ДНК человека
AlphaGenome Atlas от Google DeepMind — каталог предсказаний для каждой возможной замены одной буквы в геноме человека. Он помогает находить причины редких болезней и уже позволил найти на 22% больше связей генов с признаками в данных UK Biobank.