OPTIMIZATION OF QSAR MODELS FOR PREDICTION OF BIOLOGICAL ACTIVITY MOLECULES USING MACHINE LEARNING METHODS

Molecular modeling plays a central role in modern computational chemistry, particularly in the early stages of drug discovery, where researchers must rapidly and reliably predict the biological activity of large sets of potential candidates. Quantitative Structure–Activity Relationship (QSAR) models...

Повний опис

Збережено в:
Бібліографічні деталі
Дата:2026
Автори: Maslov, Danilo, Golub, Oleksandr
Формат: Стаття
Мова:Англійська
Опубліковано: V.I.Vernadsky Institute of General and Inorganic Chemistry 2026
Онлайн доступ:https://ucj.org.ua/index.php/journal/article/view/772
Теги: Додати тег
Немає тегів, Будьте першим, хто поставить тег для цього запису!
Назва журналу:Ukrainian Chemistry Journal
Завантажити файл: Pdf

Репозитарії

Ukrainian Chemistry Journal
_version_ 1871466214252871680
author Maslov, Danilo
Golub, Oleksandr
author_facet Maslov, Danilo
Golub, Oleksandr
author_institution_txt_mv [ { "author": "Danilo Maslov", "institution": "Національний університет \"Києво-Могилянська академія\", вул. Сковороди 2, 04070 Київ" }, { "author": "Oleksandr Golub", "institution": "Національний університет \"Києво-Могилянська академія\", вул. Сковороди 2, 04070 Київ" } ]
author_sort Maslov, Danilo
baseUrl_str https://ucj.org.ua/index.php/journal/oai
collection OJS
datestamp_date 2026-07-22T08:23:57Z
description Molecular modeling plays a central role in modern computational chemistry, particularly in the early stages of drug discovery, where researchers must rapidly and reliably predict the biological activity of large sets of potential candidates. Quantitative Structure–Activity Relationship (QSAR) models are widely used for this purpose; however, their true predictive performance is often overestimated due to improper data splitting strategies. A key challenge arises when test sets contain molecular scaffolds absent from the training data, resulting in models that appear accurate under random splits but fail to generalize to unseen chemical space. This study investigates optimization stra­tegies for QSAR modeling while explicitly accounting for molecular diversity. A dataset of 3,782 molecules with 3,291 computed descriptors and pChEMBL anesthetic activity values (5.01–8.52) for receptor TRPV1 was analy­zed. The dataset contained 733 unique scaffolds, and 72 occurred exclusively in the test set under random 80/20 splitting, revea­ling substantial information leakage. Three splitting strategies were compared: standard K-Fold (R² = 0.54), scaffold-based Group K-Fold (R² = 0.31), and stratified scaffold-­aware splitting (R² = 0.646–0.7201), the latter demonstrating the most realistic and stable performance. Multiple machine-learning approaches were evaluated, with Gradient Boosting achieving the best baseline accuracy. Optimization techniques included descriptor-level data augmentation (σ = 0.02), descriptor weighting by duplicating the most important features, and combined methods. The best model  (R² = 0.7201, MAE = 0.41) was obtained by integrating augmentation with triple duplication of top-ranking descriptors. Several commonly used approaches—Morgan fingerprints, deep neural networks, PCA—yielded significantly weaker performance, highlighting the superior informativeness of physicochemical descriptors for this dataset. The resulting model demonstrates practical utility for early-stage virtual screening and prio­ritization of candidate molecules, providing a reliable tool for guiding medicinal che­mistry decisions.
doi_str_mv 10.33609/2708-129X.92.3.2026.27-32
first_indexed 2026-05-02T01:00:17Z
format Article
fulltext 27 УДК: 004.94:615.07 doi: 10.33609/2708-129X.92.3.2026.27-32 ОПТИМІЗАЦІЯ QSAR-МОДЕЛЕЙ ДЛЯ ПЕРЕДБАЧЕННЯ БІОЛОГІЧНОЇ АКТИВНОСТІ МОЛЕКУЛ МЕТОДАМИ МАШИННОГО НАВЧАННЯ Д. В. Маслов https://orcid.org/0009-0002-1376-1450 О. А. Голуб https://orcid.org/0000-0003-1823-2523 Національний університет «Києво-Могилянська академія», Україна Вул. Сковороди 2, 04070 Київ, Україна e-mail: dv.maslov@ukma.edu.ua Молекулярне моделювання є важливим інструментом сучасної обчислювальної хі- мії, яке широко використовують на ранніх етапах розроблення лікарських засобів для передбачення біологічної активності потенційних кандидатів. Дослідження проведено на датасеті з 3782 молекул, описаних 3291 молекулярним дескриптором і значення- ми активності pChEMBL у діапазоні 5,01–8,52, який містив 733 унікальні молекулярні структури. Порівняння різних підходів до розділення вибірки показало перевагу стра- тифікованого scaffold-орієнтованого розподілу, який забезпечив реалістичну оцінку якості моделей із R² до 0,72 при MAE = 0,41. Отримано оптимізовану QSAR-модель, яка є придатною для раннього віртуального скринінгу і яку можна використовувати для пріоритизації сполук у процесі розроблення знеболювальних препаратів, спрямо- ваних на рецептор TRPV1. Ключові слова: QSAR-моделювання, машинне навчання, TRPV1, молекулярні дескриптори. ВСТУП. Молекулярне моделювання за- ймає провідне місце серед сучасних напря- мів обчислювальної хімії. При розробленні нових фармацевтичних засобів дослідники стикаються з необхідністю швидко та ефек- тивно передбачувати біологічну активність великої кількості потенційних кандидатів. Для цього широко використовують моделі кількісних співвідношень структура-ак- тивність (QSAR – Quantitative Structure- Activity Relationship). Традиційні QSAR-моделі базуються на розрахунку молекулярних дескрипторів, які характеризують структурні та фізико- хімічні властивості молекул. Однак якість таких моделей часто переоцінюють через неправильне розділення даних на трену- вальний та тестовий набори [1]. Основна проблема, яку розглянуто у цій роботі, що слідує з парадигми машин- ного навчання [2], полягає в наступному: якщо тестовий набір містить молекулярні 28 ISSN 2708-129X. Укр. хім. журн., 2026 ОПТИМІЗАЦІЯ QSAR-МОДЕЛЕЙ ДЛЯ ПЕРЕДБАЧЕННЯ БІОЛОГІЧНОЇ АКТИВНОСТІ МОЛЕКУЛ МЕТОДАМИ МАШИННОГО НАВЧАННЯФІЗИЧНА ХІМІЯ структури (scaffolds), яких немає у трену- вальному наборі, то модель не зможе адек- ватно передбачувати їхню активність, на- віть якщо показує високу точність на зви- чайному випадковому розділенні. Мета дослідження – розробити та проте- стувати методи оптимізації QSAR-моделей для потенційних знеболювальних препара- тів за концентраціями інгібітування (IC50) рецептора болю TRPV1 [3] з урахуванням молекулярної різноманітності набору ха- рактеристичних даних – датасету. ЕКСПЕРИМЕНТ І ОБГОВОРЕННЯ РЕ- ЗУЛЬТАТІВ. Дослідження проводили на да- тасеті (наборі даних) із 3782 молекул (взяті з бази даних ChEMBL – Chemical European Molecular Biology Laboratory) з обчислени- ми за допомогою бібліотек (RDKit, Mordred, Morgan fingerprints) 3291 молекулярними дескрипторами. Цільовою змінною була інгібувальна активність до TRPV1 (від’єм- ний десятковий логарифм IC50 – pChEMBL Value), яка варіювалася від 5.01 до 8.52. За допомогою випадкової вибірки дата- сет було розділено на тренувальну (80%) та тестову (20%) вибірки [4]. Одержали дата- сет, ключовою особливістю якого є наяв- ність 733 унікальних молекулярних струк- тур (scaffolds), при цьому 72 з’явилися лише у тестовому наборі при звичайному випад- ковому розділенні, що свідчить про зна- чний потенціал для втрати інформації [2]. Зокрема для оцінки втрати інформацій- ного потенціалу було порівняно три підхо- ди до розділення датасету [5]: 1. Звичайний K-Fold (крос-валідація), або випадкове розділення між набо- рами без урахування молекулярних структур. У  результаті отримали ко- ефіцієнт детермінації R² = 0.54, яке є оптимістичною оцінкою через втрату інформації про структури. 2. Груповий K-Fold (Group K-Fold), або розділення так, щоб усі молекули з однаковою (схожою) молекулярною структурою потрапляли лише в один набір. У результаті маємо R² = 0.31, що показує реальну складність завдання на невидимих структурах. 3. Стратифіковане розділення (Stratified Split) 80/20, яке застосовували у цьому дослідженні з урахуванням розподілу активності та молекулярних струк- тур. У результаті обчислень отримали R²  =  0.646-0.720 залежно від методу моделювання, що показує оптималь- ність підходу. У ході роботи було протестовано декіль- ка моделей машинного навчання, зокрема: випадковий ліс (Random Forest, 500 дерев), градієнтне підсилення (Gradient Boosting, GB; 300 дерев, швидкість навчання (learning rate) = 0.05) та нейронні мережі (Neural Networks) із малими та середніми архітек- турами. Для представлення молекулярних струк- тур використовували морганівські відбит- ки (Morgan fingerprints), а також застосу- вали метод головних компонент (Principal Component Analysis, PCA) для зменшення розмірності дескрипторного простору. Градієнтне підсилення показало найкра- щі результати і було обрано для подальших оптимізацій. Для збільшення передбачуваної сили моделі було застосовано наступні методи оптимізації [6]: 1. Розширення тренувального набору (Data augmentation – Aug) у 2 та в 3 рази шляхом додавання до значень 29https://ucj.org.ua Д. В. Маслов, О. А. Голуб УХЖ № 3 / ТОМ 92 дескрипторів малих випадкових збу- рень (σ=0.02), яке моделює природну варіативність в експериментальних даних. 2. Подвоєння та потроєння важливих молекулярних дескрипторів на основі їхньої важливості, розрахованої з ба- зової моделі, що надає моделі більший внесок (сигнал) від важливих ознак. 3. Комбінування попередніх методів із застосуванням їх водночас. У ході обчислень було знайдено топ-20 найважливіших дескрипторів, які визнача- ють близько 26% від загальної важливості. На чолі списку є наступні: n10FaRing_2D та n10FaRing_3D (індекси для 10-членних аро- матичних кілець), BCUTpe-1l та BCUTse-1l (BCUT-дескриптори, що характеризують розподіл електронної густини), fr_NH1 (частота первинних амінів), MolLogP (ліпо- фільність). Позначення дескрипторів взяті з відповідних бібліотек. Саме ці дескрип- тори відображають ключові структурні та фізико-хімічні властивості, які впливають на IC50 для TRPV1. Але таке число дескрипторів, навіть най- важливіших, не дозволяє отримати реаль- ну картину. Тому відбір дескрипторів для подальшої оптимізації здійснювали на ос- нові їхньої важливості (feature importance), визначеної за допомогою базової моделі. Було протестовано різні розміри підмно- жин (20, 50, 100, 150, 200, 250 дескрипто- рів). Встановлено, що менші набори при- зводять до втрати інформативності, тоді як збільшення їхньої кількості понад 100 не додає прецизійності, а спричиняє роз- мивання внеску найбільш значущих ознак. Таким чином, вибір топ-100 дескрипторів є емпірично обґрунтованим компромісом між точністю та стабільністю моделі. Таблиця Порівняння результатів обчислень різними методами оптимізації Table. Comparison of calculation results using different optimization methods. Метод R² MAE* RMSE** Покращення Базова GB 0.7080 0.425 0.560 – GB + Aug 0.7112 0.421 0.555 +0.45% GB + Aug + Подвоєння 0.7126 0.418 0.553 +0.66% GB + Aug + Потроєння 0.7201 0.410 0.547 +1.71% * MAE – Mean Absolute Error (середня абсолютна похибка); ** RMSE – Root Mean Squared Error (середньоквадратична похибка). Як видно з таблиці, найкращий резуль- тат було отримано при поєднанні Data augmentation із потроєнням топ-100 де- скрипторів, вибраних за результатами ма- шинного навчання. 30 ISSN 2708-129X. Укр. хім. журн., 2026 ОПТИМІЗАЦІЯ QSAR-МОДЕЛЕЙ ДЛЯ ПЕРЕДБАЧЕННЯ БІОЛОГІЧНОЇ АКТИВНОСТІ МОЛЕКУЛ МЕТОДАМИ МАШИННОГО НАВЧАННЯФІЗИЧНА ХІМІЯ ВИСНОВКИ. Таким чином модель ма- шинного навчання, яка дозволяє досяг- нути значення коефіцієнта детермінації R² = 0.7201, можна вважати придатною для скринінгу молекул на ранніх етапах роз- роблення лікарських засобів [7]. Значен- ня MAE = 0.41 свідчить, що в середньому передбачена активність відрізняється від експериментальної всього на ±0.41 лога- рифмічної одиниці. Така точність є при- йнятною для QSAR-моделей і її можна ви- користовувати у поєднанні з хімічною ін- туїцією, застосуванням інструментів ШІ та додатковими методами валідації, зокрема молекулярним докінгом або експеримен- тальними випробуваннями [8–10]. Критично важливим є правильне розді- лення даних, зокрема Group K-Fold пока- зав, що реальна якість моделі на невидимих структурах є значно нижчою, ніж оціночні значення. Окрім цього, вельми ефективною є Data augmentation або розширення дата- сету в 2–3 рази шляхом додавання малих збурень, що поліпшує узагальнюваність моделей. Важливо відзначити, що комбіновані ме- тоди перевершують окремі, але найбільше поліпшення (R²=0.7201, +1.71%) досягнуто за одночасного застосування обох методів (Aug та потроєння топ-100 дескрипторів). Також слід підкреслити, що не всі під- ходи є універсальними. Зокрема, викори- стання морганівських відбитків, глибоких нейронних мереж (Deep Neural Networks), а також попереднє оброблення даних за допомогою методу головних компонент (Principal Component Analysis, PCA) не призвели до покращення якості моделей для зазначеного датасету. Це підкреслює важливість емпіричного тестування різних підходів, а також необ- хідність адаптації вибору дескрипторів і моделей до конкретної задачі та властивос- тей набору даних. Таким чином розроблена модель з R² = 0.7201 є практично корисною для роз- ширеного скринінгу молекулярних бібліо тек на ранніх етапах розроблення нових лікарських засобів. ДЕТАЛІЗАЦІЯ ВКЛАДУ АВТОРІВ У ПІДГОТОВКУ РУКОПИСУ. Автори роботи зробили рівнозначний внесок у розроблен- ня концепції та дизайну дослідження, збір, систематизацію, аналіз та інтерпретацію отриманих даних. Автори брали рівнове- лику участь у підготовці, редагуванні та до- опрацюванні статті. Усі автори ознайоми- лися з результатами дослідження та схва- лили остаточну версію статті. КОНФЛІКТ ІНТЕРЕСІВ. Автори заявля- ють про відсутність конфлікту інтересів. ПОДЯКА. Цю роботу було підтримано грантом від Міжнародного фонду Саймон- са [SFI-PD-Ukraine-00014577, O.G.] (This work was supported by a grant from the Simons Foundation International [SFI-PD-Ukraine-00014577, O.G.]). Державний реєстраційний номер: 0121U100174. 31https://ucj.org.ua Д. В. Маслов, О. А. Голуб УХЖ № 3 / ТОМ 92 OPTIMIZATION OF QSAR MODELS FOR PREDICTION OF BIOLOGICAL ACTIVITY MOLECULES USING MACHINE LEARNING METHODS. D. V. Maslov https://orcid.org/0009-0002-1376-1450 O. A. Golub https://orcid.org/0000-0003-1823-2523 National University “Kyiv-Mohyla Academy”, Ukraine 2 Skovoroda st., 04070 Kyiv, Ukraine e-mail: dv.maslov@ukma.edu.ua Molecular modeling plays a central role in modern computational chemistry, particular- ly in the early stages of drug discovery, where researchers must rapidly and reliably predict the biological activity of large sets of potential candidates. Quantitative Structure–Activity Relationship (QSAR) models are widely used for this purpose; however, their true predictive performance is often overestimated due to im- proper data splitting strategies. A key challenge arises when test sets contain molecular scaf- folds absent from the training data, resulting in models that appear accurate under random splits but fail to generalize to unseen chemical space. This study investigates optimization stra tegies for QSAR modeling while explicitly accounting for molecular diversity. A dataset of 3,782 molecules with 3,291 computed de- scriptors and pChEMBL anesthetic activity values (5.01–8.52) for receptor TRPV1 was analyzed. The dataset contained 733 unique scaffolds, and 72 occurred exclusively in the test set under random 80/20 splitting, revea ling substantial information leakage. Three splitting strategies were compared: standard K-Fold  (R² = 0.54), scaffold-based Group K-Fold (R² = 0.31), and stratified scaffold- aware splitting (R² = 0.646–0.7201), the latter demonstrating the most realistic and stable performance. Multiple machine-learning approaches were evaluated, with Gradient Boosting achiev- ing the best baseline accuracy. Optimization techniques included descriptor-level data augmentation (σ = 0.02), descriptor weight- ing by duplicating the most important fea- tures, and combined methods. The best model (R² = 0.7201, MAE = 0.41) was obtained by in- tegrating augmentation with triple duplication of top-ranking descriptors. Several commonly used approaches—Morgan fingerprints, deep neural networks, PCA—yielded significantly weaker performance, highlighting the superior informativeness of physicochemical descrip- tors for this dataset. The resulting model demonstrates practi- cal utility for early-stage virtual screening and prioritization of candidate molecules, provid- ing a reliable tool for guiding medicinal che mistry decisions. Keywords: QSAR modeling; machine learning; TRPV1; molecular descriptors. ЛІТЕРАТУРА 1. Golbraikh A., Tropsha A. Beware of q²!. Jour- nal of Molecular Graphics and Modelling. 2002. 20(4). 269–276. doi: https://doi.org/10.1016/S1093-3263(01)00123-1. 2. Yang K., Swanson K., Jin W. et al. Analyzing learned molecular representations for proper- ty prediction. Journal of Chemical Informa- tion and Modeling. 2019. 59(8). 3370–3388. doi: https://doi.org/10.1021/acs.jcim.9b00237. 32 ISSN 2708-129X. Укр. хім. журн., 2026 ОПТИМІЗАЦІЯ QSAR-МОДЕЛЕЙ ДЛЯ ПЕРЕДБАЧЕННЯ БІОЛОГІЧНОЇ АКТИВНОСТІ МОЛЕКУЛ МЕТОДАМИ МАШИННОГО НАВЧАННЯФІЗИЧНА ХІМІЯ 3. Caterina M. J., Schumacher M. A., Tomi- naga  M., Rosen T. A., Levine J. D., Julius D. The capsaicin receptor: a heat-activated ion channel in the pain pathway. Nature. 1997. 389(6653). 816–824. doi: https://doi.org/10.1038/39807. 4. Hastie T., Tibshirani R., Friedman J. The ele ments of statistical learning: data mining, in- ference, and prediction. 2nd ed. New York: Springer. 2009. doi: https://doi.org/10.1007/978-0-387-84858-7. 5. Petrov K. P., Bender A. An open-source imple- mentation of scaffold identification. ChemRxiv (preprint). 2024. doi: https://doi.org/10.26434/chemrxiv-2024- 84r9x. 6. Lange J. J., Strickfaden S., Klein R., Hinselmann G. Comparative analysis of chemical descrip- tors by machine learning. Molecular Pharma- ceutics. 2024. 21(5). 1874–1888. doi: https:// doi.org/10.1021/acs.molpharmaceut.4c00080. 7. Tropsha A. Best practices for QSAR model de- velopment, validation, and exploitation. Mo- lecular Informatics. 2010. 29(6–7): 476–488. doi: https://doi.org/10.1002/minf.201000061. 8. Cherkasov A., Muratov E. N., Fourches D. et al. QSAR modeling: where have you been? Where are you going to? Journal of Medicinal Chemistry. 2014. 57(12). 4977–5010. doi: https://doi.org/10.1021/jm4004285. 9. Roy K., Kar S., Das R. N. A primer on QSAR/ QSPR modeling. Springer. 2015. doi: https://doi.org/10.1007/978-3-319-17281-1. 10. Gramatica P. On the development and valida- tion of QSAR models. Methods in Molecular Biology. 2013. 930: 499–526. doi: https://doi. org/10.1007/978-1-62703-059-5_21. REFERENCES 1. Golbraikh A., Tropsha A. Beware of q²!. Jour- nal of Molecular Graphics and Modelling. 2002. 20(4): P. 269–276. doi: https://doi.org/10.1016/S1093-3263(01)00123-1. 2. Yang K., Swanson K., Jin W. et al. Analyzing learned molecular representations for proper- ty prediction. Journal of Chemical Informa- tion and Modeling. 2019. 59(8): P. 3370–3388. doi: https://doi.org/10.1021/acs.jcim.9b00237. 3. Caterina M. J., Schumacher M. A., Tomina ga  M., Rosen T. A., Levine J. D., Julius D. The capsaicin receptor: a heat-activated ion channel in the pain pathway. Nature. 1997. 389(6653): P. 816–824. doi: https://doi.org/10.1038/39807. 4. Hastie T., Tibshirani R., Friedman J. The ele ments of statistical learning: data mining, in- ference, and prediction. 2nd ed. New York: Springer. 2009. doi: https://doi.org/10.1007/978-0-387-84858-7. 5. Petrov K. P., Bender A. An open-source imple- mentation of scaffold identification. ChemRxiv (preprint). 2024. doi: https://doi.org/10.26434/ chemrxiv-2024-84r9x. 6. Lange J. J., Strickfaden S., Klein R., Hinselmann G. Comparative analysis of chemical descrip- tors by machine learning. Molecular Pharma- ceutics. 2024. 21(5): P. 1874–1888. doi: https:// doi.org/10.1021/acs.molpharmaceut.4c00080. 7. Tropsha A. Best practices for QSAR model de- velopment, validation, and exploitation. Mo- lecular Informatics. 2010. 29(6–7): 476–488. doi: https://doi.org/10.1002/minf.201000061. 8. Cherkasov A., Muratov E. N., Fourches D. et al. QSAR modeling: where have you been? Where are you going to? Journal of Medicinal Chemistry. 2014. 57(12): P. 4977–5010. doi: https://doi.org/10.1021/jm4004285. 9. Roy K., Kar S., Das R. N. A primer on QSAR/ QSPR modeling. Springer. 2015. doi: https://doi.org/10.1007/978-3-319-17281-1. 10. Gramatica P. On the development and valida- tion of QSAR models. Methods in Molecular Biology. 2013. 930: P. 499–526. doi: https://doi. org/10.1007/978-1-62703-059-5_21. Стаття надійшла: 25.03.2026. Статтю прийнято до друку: 11.04.2026. Статтю опубліковано: 30.04.2026.
id oai:ojs2.1444248.nisspano.web.hosting-test.net:article-772
institution Ukrainian Chemistry Journal
keywords_txt_mv keywords
language English
last_indexed 2026-07-23T01:14:22Z
publishDate 2026
publisher V.I.Vernadsky Institute of General and Inorganic Chemistry
record_format ojs
resource_txt_mv ucjorgua/d9/1f47b6a3bf2d7ec9c8963c7eb32990d9.pdf
spelling oai:ojs2.1444248.nisspano.web.hosting-test.net:article-7722026-07-22T08:23:57Z OPTIMIZATION OF QSAR MODELS FOR PREDICTION OF BIOLOGICAL ACTIVITY MOLECULES USING MACHINE LEARNING METHODS Maslov, Danilo Golub, Oleksandr QSAR modeling; machine learning; TRPV1; molecular descriptors. Molecular modeling plays a central role in modern computational chemistry, particularly in the early stages of drug discovery, where researchers must rapidly and reliably predict the biological activity of large sets of potential candidates. Quantitative Structure–Activity Relationship (QSAR) models are widely used for this purpose; however, their true predictive performance is often overestimated due to improper data splitting strategies. A key challenge arises when test sets contain molecular scaffolds absent from the training data, resulting in models that appear accurate under random splits but fail to generalize to unseen chemical space. This study investigates optimization stra­tegies for QSAR modeling while explicitly accounting for molecular diversity. A dataset of 3,782 molecules with 3,291 computed descriptors and pChEMBL anesthetic activity values (5.01–8.52) for receptor TRPV1 was analy­zed. The dataset contained 733 unique scaffolds, and 72 occurred exclusively in the test set under random 80/20 splitting, revea­ling substantial information leakage. Three splitting strategies were compared: standard K-Fold (R² = 0.54), scaffold-based Group K-Fold (R² = 0.31), and stratified scaffold-­aware splitting (R² = 0.646–0.7201), the latter demonstrating the most realistic and stable performance. Multiple machine-learning approaches were evaluated, with Gradient Boosting achieving the best baseline accuracy. Optimization techniques included descriptor-level data augmentation (σ = 0.02), descriptor weighting by duplicating the most important features, and combined methods. The best model  (R² = 0.7201, MAE = 0.41) was obtained by integrating augmentation with triple duplication of top-ranking descriptors. Several commonly used approaches—Morgan fingerprints, deep neural networks, PCA—yielded significantly weaker performance, highlighting the superior informativeness of physicochemical descriptors for this dataset. The resulting model demonstrates practical utility for early-stage virtual screening and prio­ritization of candidate molecules, providing a reliable tool for guiding medicinal che­mistry decisions. V.I.Vernadsky Institute of General and Inorganic Chemistry 2026-04-30 Article Article Physical chemistry Физическая xимия Фізична xімія application/pdf https://ucj.org.ua/index.php/journal/article/view/772 10.33609/2708-129X.92.3.2026.27-32 Ukrainian Chemistry Journal; Vol. 92 No. 3 (2026): Ukrainian Chemistry Journal; 27-32 Украинский химический журнал; ##issue.vol## 92 ##issue.no## 3 (2026): Ukrainian Chemistry Journal; 27-32 Український хімічний журнал; Том 92 № 3 (2026): Ukrainian Chemistry Journal; 27-32 2708-129X 2708-1281 en https://ucj.org.ua/index.php/journal/article/view/772/405 Copyright (c) 2026 Danilo Maslov, Oleksandr Golub https://creativecommons.org/licenses/by-nc/4.0
spellingShingle Maslov, Danilo
Golub, Oleksandr
OPTIMIZATION OF QSAR MODELS FOR PREDICTION OF BIOLOGICAL ACTIVITY MOLECULES USING MACHINE LEARNING METHODS
title OPTIMIZATION OF QSAR MODELS FOR PREDICTION OF BIOLOGICAL ACTIVITY MOLECULES USING MACHINE LEARNING METHODS
title_full OPTIMIZATION OF QSAR MODELS FOR PREDICTION OF BIOLOGICAL ACTIVITY MOLECULES USING MACHINE LEARNING METHODS
title_fullStr OPTIMIZATION OF QSAR MODELS FOR PREDICTION OF BIOLOGICAL ACTIVITY MOLECULES USING MACHINE LEARNING METHODS
title_full_unstemmed OPTIMIZATION OF QSAR MODELS FOR PREDICTION OF BIOLOGICAL ACTIVITY MOLECULES USING MACHINE LEARNING METHODS
title_short OPTIMIZATION OF QSAR MODELS FOR PREDICTION OF BIOLOGICAL ACTIVITY MOLECULES USING MACHINE LEARNING METHODS
title_sort optimization of qsar models for prediction of biological activity molecules using machine learning methods
topic_facet QSAR modeling
machine learning
TRPV1
molecular descriptors.
url https://ucj.org.ua/index.php/journal/article/view/772
work_keys_str_mv AT maslovdanilo optimizationofqsarmodelsforpredictionofbiologicalactivitymoleculesusingmachinelearningmethods
AT goluboleksandr optimizationofqsarmodelsforpredictionofbiologicalactivitymoleculesusingmachinelearningmethods