گنج پنهان شرکت‌های دارویی به کمک هوش مصنوعی آمد

داده‌های محرمانه شرکت‌های دارویی برای تقویت مدل‌های هوش مصنوعی که ساختار پروتئینی می‌سازند، مفیدتر عمل می‌کنند.

یک سامانه هوش مصنوعی که با بیش از ۲۰ هزار ساختار پروتئین متعلق به شرکت‌های دارویی آموزش داده شده، عملکرد بهتری نسبت به مدل‌های مشابه «آلفافولد» دارد که تنها از داده‌های عمومی استفاده کرده‌اند.

به نقل از نیچر، مدل‌های هوش مصنوعی برای پیش‌بینی ساختار پروتئین، مانند آلفافولد (AlphaFold)، در حوزه کشف دارو با یک مشکل اساسی مواجه‌اند: داده‌های کافی در پایگاه‌های اطلاعاتی عمومی وجود ندارد.

به گفته برخی دانشمندان، برای بهبود عملکرد این ابزارهای مبتنی بر هوش مصنوعی، به داده‌های بیشتری نیاز است؛ داده‌هایی که نمونه‌های بیشتری از نحوه تعامل پروتئین‌ها و داروها در اختیار مدل‌ها قرار دهند.

ساختارهای پروتئینی که هزاران مورد از آنها در مخازن اطلاعاتی شرکت‌های داروسازی نگهداری می‌شوند، می‌توانند یکی از منابع امیدوارکننده برای تامین این داده‌ها باشند.

اکنون یک کنسرسیوم متشکل از چند شرکت داروسازی گزارش داده است که استفاده از چنین داده‌هایی برای آموزش مدل‌های هوش مصنوعی در زمینه پیش‌بینی ساختار پروتئین، عملکرد این مدل‌ها را به شکل چشمگیری بهبود می‌دهد.

این گروه از اوپن‌فولد ۳ (OpenFold۳) که یک نسخه متن‌باز از آلفافولد ۳ است، استفاده کرده و مدل جدیدی را با بیش از ۲۰ هزار ساختار پروتئینی اختصاصی آموزش داده است.

این سامانه در مقایسه با مدل‌های مشابهی که تنها با داده‌های عمومی آموزش دیده بودند و همچنین مدل‌هایی که با داده‌های اختصاصی هر یک از شرکت‌ها به ‌صورت جداگانه آموزش داده شده بودند، عملکرد بهتری داشت.

محمد القریشی، زیست‌شناس محاسباتی در دانشگاه کلمبیا در نیویورک که در این پروژه مشارکت داشته است، می‌گوید: وقتی همه این داده‌ها را اضافه می‌کنید، عملکرد مدل به شکل قابل ‌توجهی بهتر می‌شود. به گفته او، این یافته‌ها ضرورت ایجاد مجموعه‌ داده‌های مشابه اما عمومی را بیشتر نشان می‌دهد؛ مجموعه‌هایی که بتوانند به تقویت مدل‌های هوش مصنوعی پیش‌بینی ساختار پروتئین کمک کنند.

یکی از این پروژه‌ها اوپن بایند نام دارد که با حمایت حداکثر هشت میلیون پوند، معادل ۱۰.۸ میلیون دلار، از سوی دولت بریتانیا در حال اجراست. این پروژه ماه گذشته صدها ساختار پروتئینی جدید منتشر کرد و هزاران ساختار دیگر نیز در دست تهیه است.

منبعی دست‌نخورده از داده‌ها

پایگاه داده پروتئین (PDB)، یک مخزن آزاد با بیش از ۲۰۰ هزار ساختار پروتئینی که به ‌صورت تجربی تعیین شده‌اند، پایه اصلی داده‌های آموزشی آلفافولد ۲ بود. این داده‌ها به این ابزار اجازه دادند ساختار پروتئین‌ها را با دقتی شگفت‌انگیز پیش‌بینی کند؛ دستاوردی که در نهایت با اعطای جایزه نوبل شیمی ۲۰۲۴ مورد تقدیر قرار گرفت.

نسخه‌های جدیدتر این مدل، از جمله آلفافود۳، قابلیت پیش‌بینی نحوه تعامل پروتئین‌ها با سایر مولکول‌ها، از جمله داروهای احتمالی، را نیز اضافه کرده‌اند. اما پایگاه داده پروتئین  نمونه‌های نسبتا کمی از ساختارهای پروتئینی تعیین ‌شده به روش تجربی دارد که در تعامل با مولکول‌های شبیه دارو قرار دارند.

پل مورتنسون، معاون شیمی محاسباتی و انفورماتیک در شرکت داروسازی Astex Pharmaceuticals در کمبریج بریتانیا، می‌گوید تعداد این نمونه‌ها احتمالا تنها حدود ۱۰ هزار مورد است.

این کمبود داده برای تلاش‌ها در زمینه کشف دارو یک مشکل جدی محسوب می‌شود.

پژوهش‌ها نشان داده‌اند که دقت آلفافولد ۳ و سایر مدل‌هایی که ساختار پروتئین‌ها در تعامل با یکدیگر را پیش‌بینی می‌کنند، زمانی که باید تعامل میان مولکول‌هایی را پیش‌بینی کنند که تفاوت زیادی با مولکول‌های موجود در داده‌های آموزشی دارند، به ‌شدت افت می‌کند.

دانشمندان می‌گویند برای کاربردی‌تر کردن این ابزارها در کشف دارو، به داده‌های بیشتری نیاز است. به همین دلیل، آنها به سراغ مخازن ساختارهای مولکولی شرکت‌های داروسازی رفته‌اند.

این داده‌ها در جریان برنامه‌های کشف دارو و با استفاده از روش‌هایی مانند بلورنگاری پرتو ایکس و میکروسکوپی الکترونی کرایوژنیک (cryo-EM) تولید می‌شوند.

بسیاری از این ساختارهای پروتئینی هرگز در پایگاه‌های داده عمومی ثبت نشده‌اند، زیرا به پروژه‌های اختصاصی توسعه دارو مربوط می‌شوند.

اندازه دقیق این مخازن اطلاعاتی مشخص نیست، اما برخی تخمین زده‌اند که حجم داده‌های آنها حتی می‌تواند از داده‌های موجود در پایگاه داده پروتئین  نیز بیشتر باشد.

پیش‌بینی‌های بهتر

برای بررسی اینکه آیا این داده‌های اختصاصی می‌توانند برای مدل‌های پیش‌بینی ساختار پروتئین مفید باشند یا نه، شرکت AbbVie، شرکت Astex و چند شرکت دارویی دیگر سال گذشته همکاری‌ را تحت عنوان شبکه زیست‌شناسی ساختاری هوش مصنوعی آغاز کردند.

در این پروژه، پژوهشگران مدل آلفافولد ۳ را که پیش از این تنها با داده‌های پایگاه داده پروتئین  آموزش دیده بود، با استفاده از ۲۰ هزار و ۱۶۷ ساختار اضافی که پروتئین‌های متصل به داروهای احتمالی را نشان می‌دادند، «ریزتنظیم» کردند.

این ساختارها از پنج شرکت دارویی به دست آمدند و به شکلی در اختیار مدل قرار گرفتند که اطلاعات اختصاصی شرکت‌ها همچنان محرمانه باقی بماند. این مطالعه نشان داد داده‌های اضافی موجب بهبود پیش‌بینی‌ها شده‌اند.

در مقابل، نسخه عمومی اوپن‌فولد ۳ تنها برای حدود یک‌ سوم این ساختارها به همین سطح از عملکرد رسید و مدل متن‌باز رقیب آن، یعنی Boltz-۲، نیز عملکردی حدود ۴۰ درصد داشت.

با این حال، در مورد اهداف بسیار دشوار، داده‌های اضافی لزوما کمکی نخواهند کرد. القریشی معتقد است استفاده مجدد از ساختارهای پروتئینی خصوصی شرکت‌ها که اغلب حاصل پروژه‌های قدیمی کشف دارو هستند، تنها یک راهکار موقتی است.

از نظر او، جهش‌های بزرگ‌تر در عملکرد مدل‌های هوش مصنوعی از طریق تولید داده‌های آزمایشگاهی کاملا جدید حاصل خواهد شد.

هدف نهایی پژوهشگران، توسعه مدل‌های هوش مصنوعی قابل تعمیم است که بتوانند تعامل میان داروها و پروتئین‌هایی را پیش‌بینی کنند که تفاوت بسیار زیادی با مولکول‌های موجود در داده‌های آموزشی دارند. داده‌های بیشتر کمک خواهند کرد، اما به‌ تنهایی کافی نیستند.

اخبار مرتبط

منبع: ايسنا
آیا این خبر مفید بود؟

نتیجه بر اساس رای موافق و رای مخالف

ارسال به دیگران :

نظر شما

وب گردی