یک راهنمای کاربردی برای نگاشت SDTM، روشهای اتوماسیون و استانداردسازی دادههای بالینی است.
اتوماسیون SDTM کارآزماییهای بالینی سالهاست که یکی از اهداف اصلی صنعت داروسازی به شمار میرود. اگرچه سیستمهای ثبت الکترونیکی دادهها (EDC) و سایر فناوریها، جمعآوری و مدیریت دادههای بالینی را تسهیل کردهاند، اما تبدیل دادههای خام بالینی به فرمت استاندارد و مورد نیاز SDTM همچنان فرآیندی زمانبر، دستی و عرضهکننده خطاهای متعدد است.
مدل SDTM (مدل زبانه دادههای مطالعه) که توسط سازمان CDISC توسعه یافته است، ساختاری استاندارد برای سازماندهی دادههای کارآزمایی بالینی و آمادهسازی آنها جهت ارائه به سازمانهای رگولاتوری (تنظیمکننده مقررات) فراهم میکند. شرکتهای داروسازی با اتوماتیکسازی نگاشت (Mapping) دادهها به فرمت SDTM میتوانند تلاشهای دستی را کاهش داده، یکپارچگی دادهها را بهبود بخشند و اطمینان حاصل کنند که مجموعهدادهها (Datasets) تمام الزامات قانونی را برآورده میسازند.
در این مقاله، فرآیند پیادهسازی SDTM از جمله روشهای نگاشت، متدهای اتوماسیون و فناوریهای پشتیبان برای تولید مجموعهدادههای منطبق با استاندارد SDTM را بررسی میکنیم.
SDTM چیست؟
اصطلاح SDTM (مخفف Study Data Tabulation Model) یک استاندارد دادهای است که توسط آژانس استانداردهای تبادل دادههای بالینی (CDISC) برای سازماندهی و استانداردسازی دادههای کارآزمایی بالینی ایجاد شده است. این مدل، چارچوبی مشترک برای مدیریت دادههای پژوهشهای پزشکی ارائه داده و از ارسال یکپارچه دادهها جهت بررسیهای قانونی پشتیبانی میکند.
مدل SDTM ساختاری یکسان برای سازماندهی و جدولبندی دادههای بالینی ایجاد کرده و از طریق چارچوب CDISC SDTM، استانداردهای دادهای واحدی را برای شرکتهای داروسازی تعریف میکند. SDTM به عنوان یک فرمت اثباتشده برای انتشار دادههای کارآزمایی بالینی، توصیف شفافی از ساختار، ویژگیها و محتوای هر مجموعهداده را در اختیار ارزیابان سازمان غذا و داروی آمریکا (FDA) قرار میدهد.
این ساختار مشترک امکان تبادل داده بین نرمافزارها و پایگاههای داده مختلف کارآزمایی بالینی را فراهم میسازد. علاوه بر مدیریت دادههای بالینی، استفاده از مدیریت ارتباط با مشتری (CRM) در علوم زیستی نیز به یکی از روندهای اصلی شرکتهای داروسازی تبدیل شده است. پس از گردآوری تمامی دادههای مرتبط با پژوهش، این دادهها باید به فرمت جدولی مشخص و مورد تایید FDA تبدیل شوند.
مزایای اتوماسیون SDTM در کارآزماییهای بالینی چیست؟
اتوماسیون SDTM به شرکتهای داروسازی کمک میکند تا با کاهش تلاشهای دستی در نگاشت، بهبود یکپارچگی دادهها و پشتیبانی از فرآیندهای سریعتر ارائه به رگولاتوری، مدیریت دادههای بالینی را بهینهسازی کنند. با خودکارسازی وظایف تکراری در فرآیند نگاشت SDTM، سازمانها میتوانند کیفیت دادهها را ارتقا داده و خطر خطا را در طول کارآزماییهای بالینی کاهش دهند.
از جمله مزایای کلیدی اتوماسیون SDTM میتوان به موارد زیر اشاره کرد:
در نهایت، اتوماسیون SDTM میتواند ارتباطات بین حامیان مالی مختلف (Sponsors)، مراکز تحقیقاتی و سازمانهای پژوهشی بالینی (CROs) را تسهیل کرده و به هماهنگی و مدیریت بهتر کارآزماییهای بالینی منجر شود.
اتوماسیون SDTM: یک روش نگاشت ترکیبی (Hybrid)
برای نگاشت منابع داده خام به متغیرهای SDTM بر اساس مشخصات و الزامات نگاشت، میتوان از روش دستی، فرآیند ترکیبی (شامل بخشهای نرمافزاری و دستی) یا یک تکنیک کاملاً نرمافزاری استفاده کرد.
در گذشته، الزامات نگاشت در یک فایل Excel یا Word نوشته میشد. سپس در یک فرآیند کاملاً دستی، یک برنامهنویس مشخصات مربوطه را به کدهای سیستم تحلیل آماری (SAS) یا زبان پرسوجوی ساختاریافته (SQL) منتقل میکرد.
در روش ترکیبی (Hybrid)، مشخصات از یک فایل اکسل خوانده شده و وارد یک مجموعهداده میشود؛ سپس این دادهها برای ساخت دینامیک کدها در یک برنامه جهت نگاشت متغیرهای منبع استفاده میشوند. اما هنگام استفاده از روش کاملاً نرمافزاری (مانند SAS Clinical Data Integration)، خود برنامه تمامی الزامات را ذخیره و پردازش کرده و تمام نگاشتها و محاسبات SDTM را تولید میکند.
فرآیند دستی نگاشت دادههای بالینی، زمان استانداردسازی دادهها را افزایش داده و در نتیجه منابع بیشتری را در پروژه مصرف میکند. از این رو، اتوماسیون به دنبال کاهش زمان اضافی برای تولید دادههای باکیفیت و منطبق با CDISC جهت ارائه به FDA است. به همین دلیل، توسعه ابزارهایی که باعث صرفهجویی در منابع صرفشده برای ایجاد SDTM شوند، اهمیت بالایی دارد.
چالشهای اصلی در اتوماتیکسازی ساخت اسکریپتهای SQL چیست؟
خودکارسازی تولید اسکریپتهای SQL برای نگاشت SDTM دشوار است، زیرا مشخصات دادههای کارآزمایی بالینی اغلب شامل قوانین پیچیده، وابستگیها و الزامات تغییر شکل (Transformation) هستند. این مشخصات معمولاً در کتابچههای اکسل نگاشت منبع استاندارد ذخیره میشوند که شامل کاربرگهای جداگانه برای هر دامنه (Domain) SDTM است و باید به دقت به کدهای قابل اجرا ترجمه شوند.
ایجاد یک فایل اکسل استاندارد شاید سختترین بخش این جریان داده باشد، زیرا سناریوهای متعدد باید به درستی توسط کاربر نگاشت شوند. در ادامه امکان ساخت نگاشت SDTM به شکلی که قابلیت تبدیل به اسکریپت قابل اجرا را داشته باشد بررسی میکنیم.
قابلیت ایجاد اسکریپتهای SQL با استفاده از جملات زبان طبیعی (Plain Language) برای کاربرانی که با زبانهای پرسوجو مانند SQL آشنا نیستند، بسیار جذاب است. نگاشت متن به SQL (Text to SQL) یک مسئله تجزیه معنایی (Semantic Parsing) است که به عنوان تبدیل ورودی زبان طبیعی به یک بازنمایی قابل درک برای ماشین تعریف میشود. تجزیه معنایی یک موضوع شناختهشده در پردازش زبان طبیعی (NLP) با تاریخچهای طولانی است.
در نتیجه، تجزیه معنایی توجه فعالانی را جلب کرده که میخواهند فرآیند ایجاد SDTM را کمزمانتر و کارآمدتر کنند. تمام این رویکردها ممکن است در نهایت برای حل یک هدف بزرگتر یعنی ترجمه زبان طبیعی به یک برنامه کاملاً کاربردی یکپارچه شوند. برای حل مسئله تجزیه معنایی، رویکردهای متعددی توسعه یافته است؛ با این حال، دشواری ایجاد کدهای SQL پیچیدهتر از مسائل معمول تجزیه معنایی است. یک پرسوجوی کوتاه به زبان طبیعی ممکن است نیازمند ترکیب چندین جدول یا استفاده از معیارهای فیلتر متعدد باشد؛ به همین دلیل به تکنیکهای مبتنی بر متن (Context-based) بیشتری نیاز است.
توسعه ابزارهایی که باعث صرفهجویی در منابع صرفشده برای ایجاد SDTM شوند، اهمیت بالایی دارد. اگر قصد طراحی پروژهها و ابزارهای مشابه هوشمند را دارید، بررسی هزینههای توسعه هوش مصنوعی میتواند دید روشنی از سرمایهگذاری مورد نیاز به شما بدهد
نقش NLP در تولید پرسوجوهای SQL
مجموعهدادههایی (Datasets) که برای پردازش معنایی جملات زبان طبیعی و تبدیل آنها به پرسوجوهای SQL طراحی شدهاند، شامل سوالات پیچیده برچسبگذاریشده و کدهای SQL معادل آنها هستند. جملات در واقع پرسوجوهایی برای یک حوزه خاص هستند، در حالی که پاسخها از پایگاههای داده موجود استخراج میشوند. در نتیجه، هر پرسش مشخص با یک کد SQL مرتبط میشود؛ کد SQL اجرا شده و پاسخ را از دادههای موجود بازیابی میکند.
امروزه مجموعهدادههای تجزیه معنایی مختلفی برای نگاشت پرسوجوهای SQL در دسترس است که از جنبههای گوناگون با هم تفاوت دارند. به عنوان مثال، مجموعهدادههای اخیر مانند WikiSQL و Spider، فرادامنهای (Cross-domain) و مستقل از متن هستند. علاوه بر این، آنها شامل سوالات بسیار زیاد و پرسوجوهای گستردهای هستند. از آنجایی که اندازه مجموعهداده برای ارزیابی موفق مدل حیاتی است، میتوان از سوالات پیچیده غیرمنتظره در مجموعههای آزمایشی برای سنجش قدرت تعمیمدهی (Generalization) مدل استفاده کرد.
این مجموعهدادهها از نظر پیچیدگی متفاوت هستند؛ برخی از پرسوجوهای پایه SQL پشتیبانی میکنند و برخی دیگر عملیات پیشرفتهتری مانند الحاق جداول (Joins) و پرسوجوهای توفراتو (Nested Queries) را شامل میشوند. این پیچیدگی نشاندهنده چالشهای استفاده از NLP برای تولید خودکار SQL در جریانهای کاری دادههای بالینی است، جایی که درک دقیق زمینه و متن مورد نیاز است.
در نتیجه، مسئله تجزیه معنایی همچنان توجه کسانی را که به دنبال بهینهسازی فرآیند SDTM هستند جلب میکند. برای رفع این چالش، رویکردهای مختلفی توسعه یافته است؛ اما باید توجه داشت که ساخت ساختار SQL در دادههای بالینی به مراتب پیچیدهتر از مسائل سنتی NLP است.
اتوماسیون نگاشت SDTM با تولید کد مبتنی بر قانون (Rule-based)
اتوماسیون نگاشت SDTM از طریق تولید کد مبتنی بر قانون، شامل تبدیل متغیرهای منبع خام به متغیرهای SDTM با استفاده از قوانین از پیش تعریفشده، توابع و منطق مبتنی بر متاداده (Metadata-driven logic) است. این رویکرد معمولاً به مراحل زیر متکی است:
مزیت استفاده از توابع این است که الزامات اکسل را بهطور مستقیم نگاشت میکند، که این امر منجر به تعارضات کمتر و سرعت توسعه بالاتر میشود. با این رویکرد، تولید ۵۰ تا ۷۰ درصد از متغیرها برای دامنههای مختلف SDTM امکانپذیر خواهد بود.
برای جمعآوری تمامی محاسبات و مشتقات (Derivations) مربوط به سایر متغیرهای خروجی، به پسپردارش (Post-processing) مجموعهداده SDTM نیاز است. متادادههای ارائهشده باید حاوی تمامی اطلاعات مهم درباره متغیر منبع، فرمت و متغیر جدید باشند تا بتوان از آنها برای اعتبارسنجی (Validation) نگاشتها استفاده کرد.


دیدگاهتان را بنویسید