Корона

Языковые модели ДНК научились находить гены и их строение — даже у видов, которых не видели в обучении

AIRIработа от 21 июня 2026 г.3 мин чтения
Схема: двойная спираль ДНК и под ней разметка гена с выделенными оранжевым экзонами
Схема: редакция «Короны»

Когда секвенируют геном нового вида, первым делом нужно понять, где в нём гены и как они устроены. Исследователи из AIRI, ВШЭ, Университета «Сириус», Института цитологии и генетики СО РАН и других центров представили GENATATORs — модели, которые делают такую разметку только по последовательности ДНК. Работа выложена 21 июня 2026 года и представлена на конференции ECML PKDD в сентябре.

Что именно исследовали

Разметка генов — это ответ на вопросы: где ген начинается и заканчивается, что он кодирует — белок или некодирующую РНК, из каких частей состоит. Обычно для этого нужны дополнительные данные о том, какие участки генома реально считываются в клетке. «С нуля», по одной последовательности, это получается плохо.

Авторы проверили, помогают ли тут языковые модели ДНК, которые, как и текстовые, учатся на огромных массивах последовательностей.

Как это работает

Языковая модель ДНК читает геном как текст из четырёх букв. Сама по себе, после предобучения, она не «знает», где гены: авторы показали, что её внутренние представления не содержат нужных признаков для точной разметки.

Поэтому модели дообучили на размеченных генах 39 видов млекопитающих и человека. Модель проходит по последовательности и для каждой позиции решает, к какой части гена она относится. Это похоже на корректора, который учится расставлять заголовки и абзацы в тексте без форматирования.

Проверяли несколько архитектур — от компактной модели на 16 миллионов параметров до трансформеров на 120 и 360 миллионов — с окном от 4 тысяч до 250 тысяч букв ДНК.

Что ИИ теперь умеет

  • Размечать гены по одной последовательности ДНК: границы, тип транскрипта, внутреннее строение
  • Переносить умение на виды, отделённые от обучающих сотнями миллионов лет эволюции, — от растений до дрожжей
  • Работать с белок-кодирующими генами и с генами длинных некодирующих РНК

Что показал эксперимент

Втрое больше верно собранных генов. На 20-й хромосоме человека лучшая модель правильно разметила более чем в три раза больше генов, чем инструменты Tiberius и AlphaGenome, — во всех категориях транскриптов.

Другие царства. На растении Arabidopsis thaliana модель заметно обошла Tiberius и AUGUSTUS, на пекарских дрожжах нашла более чем вдвое больше генов, чем AUGUSTUS.

Стандартная метрика. По привычной покомпонентной оценке GENATATORs примерно на 10% лучше аналогичных моделей сегментации.

Модели и рейтинг открыты на Hugging Face.

Что пока не работает

  • Даже лучшие модели правильно размечают лишь около 30–40% всех генов человека. Задача далека от решения.
  • Сложнее всего определить точные границы гена, особенно нетранслируемых участков.
  • Предобученные модели ДНК сами по себе строение генов не улавливают — без дообучения на размеченных данных метод не работает.
  • Модели распространяются по некоммерческой лицензии CC BY-NC 4.0.

Почему это важно

Новые геномы расшифровывают быстрее, чем их успевают размечать. Метод, который работает только по последовательности и переносится между видами, ускоряет превращение «сырого» генома в карту, с которой могут работать биологи и медики.

Отдельно ценно честное сравнение: авторы показали, где модели пока проигрывают, и предложили биологически осмысленные метрики вместо удобных.

Можно ли попробовать

Оригинальное исследование

GENATATORs: ab initio Gene Annotation With DNA Language Models

Авторы
Aleksei Shmelev, Artem Shadskiy, Yuri Kuratov, Mikhail Burtsev, Olga Kardymon, Veniamin Fishman
Организация
AIRI, НИУ ВШЭ, Университет «Сириус», London Institute for Mathematical Sciences, Институт цитологии и генетики СО РАН, Quantori
Дата
21 июня 2026 г.
Тип
Препринт
Разбор опубликован 21 сентября, 18:02Поделиться

Ещё исследования

Формула aⁿ + bⁿ ≠ cⁿ над деревом лемм с оранжевой галочкой проверки
Reasoning

ИИ впервые полностью формализовал доказательство Великой теоремы Ферма — и компьютер его проверил

За 11 дней почти без участия людей Claude перевёл доказательство Великой теоремы Ферма на язык Lean, где каждый шаг проверяет машина. Получилось 13 миллионов строк кода и 29 511 теорем. Кевин Баззард назвал это выдающимся достижением.

Anthropic Researchсентябрь 2026 · 2 мин
ИИ впервые полностью формализовал доказательство Великой теоремы Ферма — и компьютер его проверил
Схема: контур головы с датчиками вокруг, пунктир к клавишам с буквами «привет»
AI Science

ИИ научился восстанавливать набранные предложения по сигналам мозга — без операции

Brain2Qwerty v2 от Meta и французских научных центров восстанавливает набираемые предложения по записи мозга снаружи головы. В среднем ошибочны 39% слов, у лучшего участника половина фраз — с ошибкой не больше чем в одном слове.

Meta AI Researchиюнь 2026 · 3 мин
ИИ научился восстанавливать набранные предложения по сигналам мозга — без операции
Тепловая карта: буквы ДНК сверху и оранжевые клетки разной яркости — важность каждой замены
AI Science

ИИ предсказал последствия всех 9 миллиардов возможных «опечаток» в ДНК человека

AlphaGenome Atlas от Google DeepMind — каталог предсказаний для каждой возможной замены одной буквы в геноме человека. Он помогает находить причины редких болезней и уже позволил найти на 22% больше связей генов с признаками в данных UK Biobank.

Google DeepMindсентябрь 2026 · 2 мин
ИИ предсказал последствия всех 9 миллиардов возможных «опечаток» в ДНК человека