Microsoft анонсировал BioEmu-1, новую версию своей системы, которая позволяет глубже понять, как функционируют белки, предоставляя уникальные данные о разнообразии их структур. BioEmu-1 — это генеративная система глубокого обучения, способная предсказывать динамику белков после структурных изменений. Она обрабатывает огромные объемы данных и использует современные методы обучения, создавая тысячи уникальных образцов структур белков каждый час.
Система позволяет оценивать конформации белков с относительными ошибками свободной энергии около 1 ккал/моль, что открывает новые горизонты для эмпирических гипотез и механистических исследований. Это особенно важно для разработки новых лекарств, так как многие из них действуют, изменяя структуру белков для улучшения их функций или предотвращения вреда.
В последние годы достижения в области глубокого обучения значительно упростили предсказание структур белков на основе их аминокислотных последовательностей. Однако, как и в случае с просмотром одного кадра фильма, предсказание одной структуры белка не дает полного представления о его гибкости. Молекулярные динамические (MD) симуляции — это один из методов моделирования различных структур белков, но они требуют значительных вычислительных ресурсов и времени.
BioEmu-1 использует одну графическую процессорную единицу для генерации сотен структур белков каждый час. Исследователи планируют сделать BioEmu-1 открытым исходным кодом, чтобы ученые могли использовать модель для анализа структурных ансамблей. Это позволит значительно повысить вычислительную эффективность по сравнению с традиционными MD-симуляциями и даст возможность получать ранее недоступные инсайты.
BioEmu-1 обучается на трех различных наборах данных: структурах из базы данных AlphaFold, большом наборе MD-симуляций и данных о стабильности сворачивания белков. Это позволяет системе предсказывать множество структур и обобщать данные на неизвестные последовательности белков.
Например, BioEmu-1 может предсказывать структуры белка LapD из бактерии Vibrio cholerae, вызывающей холеру, включая как связанные, так и несвязанные структуры с молекулами c-di-GMP, которые не были частью обучающего набора, но известны экспериментально. Это открывает новые перспективы для понимания функций белков и дальнейших разработок в области лекарств.
В заключение, BioEmu-1 представляет собой значительный шаг вперед в предсказании стабильности белков и их структур, что критически важно для разработки терапевтических приложений. Исследователи уверены, что открытие BioEmu-1 позволит выявить его сильные и слабые стороны, что приведет к дальнейшим улучшениям в будущем.