OPTIMIZATION OF QSAR MODELS FOR PREDICTION OF BIOLOGICAL ACTIVITY MOLECULES USING MACHINE LEARNING METHODS
Molecular modeling plays a central role in modern computational chemistry, particularly in the early stages of drug discovery, where researchers must rapidly and reliably predict the biological activity of large sets of potential candidates. Quantitative Structure–Activity Relationship (QSAR) models...
Збережено в:
| Дата: | 2026 |
|---|---|
| Автори: | , |
| Формат: | Стаття |
| Мова: | Англійська |
| Опубліковано: |
V.I.Vernadsky Institute of General and Inorganic Chemistry
2026
|
| Онлайн доступ: | https://ucj.org.ua/index.php/journal/article/view/772 |
| Теги: |
Додати тег
Немає тегів, Будьте першим, хто поставить тег для цього запису!
|
| Назва журналу: | Ukrainian Chemistry Journal |
| Завантажити файл: | |
Репозитарії
Ukrainian Chemistry Journal| _version_ | 1871466214252871680 |
|---|---|
| author | Maslov, Danilo Golub, Oleksandr |
| author_facet | Maslov, Danilo Golub, Oleksandr |
| author_institution_txt_mv | [
{
"author": "Danilo Maslov",
"institution": "Національний університет \"Києво-Могилянська академія\", вул. Сковороди 2, 04070 Київ"
},
{
"author": "Oleksandr Golub",
"institution": "Національний університет \"Києво-Могилянська академія\", вул. Сковороди 2, 04070 Київ"
}
] |
| author_sort | Maslov, Danilo |
| baseUrl_str | https://ucj.org.ua/index.php/journal/oai |
| collection | OJS |
| datestamp_date | 2026-07-22T08:23:57Z |
| description | Molecular modeling plays a central role in modern computational chemistry, particularly in the early stages of drug discovery, where researchers must rapidly and reliably predict the biological activity of large sets of potential candidates. Quantitative Structure–Activity Relationship (QSAR) models are widely used for this purpose; however, their true predictive performance is often overestimated due to improper data splitting strategies. A key challenge arises when test sets contain molecular scaffolds absent from the training data, resulting in models that appear accurate under random splits but fail to generalize to unseen chemical space.
This study investigates optimization strategies for QSAR modeling while explicitly accounting for molecular diversity. A dataset of 3,782 molecules with 3,291 computed descriptors and pChEMBL anesthetic activity values (5.01–8.52) for receptor TRPV1 was analyzed. The dataset contained 733 unique scaffolds, and 72 occurred exclusively in the test set under random 80/20 splitting, revealing substantial information leakage. Three splitting strategies were compared: standard K-Fold (R² = 0.54), scaffold-based Group K-Fold (R² = 0.31), and stratified scaffold-aware splitting (R² = 0.646–0.7201), the latter demonstrating the most realistic and stable performance.
Multiple machine-learning approaches were evaluated, with Gradient Boosting achieving the best baseline accuracy. Optimization techniques included descriptor-level data augmentation (σ = 0.02), descriptor weighting by duplicating the most important features, and combined methods. The best model  (R² = 0.7201, MAE = 0.41) was obtained by integrating augmentation with triple duplication of top-ranking descriptors. Several commonly used approaches—Morgan fingerprints, deep neural networks, PCA—yielded significantly weaker performance, highlighting the superior informativeness of physicochemical descriptors for this dataset.
The resulting model demonstrates practical utility for early-stage virtual screening and prioritization of candidate molecules, providing a reliable tool for guiding medicinal chemistry decisions. |
| doi_str_mv | 10.33609/2708-129X.92.3.2026.27-32 |
| first_indexed | 2026-05-02T01:00:17Z |
| format | Article |
| fulltext |
27
УДК: 004.94:615.07 doi: 10.33609/2708-129X.92.3.2026.27-32
ОПТИМІЗАЦІЯ QSAR-МОДЕЛЕЙ ДЛЯ ПЕРЕДБАЧЕННЯ
БІОЛОГІЧНОЇ АКТИВНОСТІ МОЛЕКУЛ МЕТОДАМИ
МАШИННОГО НАВЧАННЯ
Д. В. Маслов https://orcid.org/0009-0002-1376-1450
О. А. Голуб https://orcid.org/0000-0003-1823-2523
Національний університет «Києво-Могилянська академія», Україна
Вул. Сковороди 2, 04070 Київ, Україна
e-mail: dv.maslov@ukma.edu.ua
Молекулярне моделювання є важливим інструментом сучасної обчислювальної хі-
мії, яке широко використовують на ранніх етапах розроблення лікарських засобів для
передбачення біологічної активності потенційних кандидатів. Дослідження проведено
на датасеті з 3782 молекул, описаних 3291 молекулярним дескриптором і значення-
ми активності pChEMBL у діапазоні 5,01–8,52, який містив 733 унікальні молекулярні
структури. Порівняння різних підходів до розділення вибірки показало перевагу стра-
тифікованого scaffold-орієнтованого розподілу, який забезпечив реалістичну оцінку
якості моделей із R² до 0,72 при MAE = 0,41. Отримано оптимізовану QSAR-модель,
яка є придатною для раннього віртуального скринінгу і яку можна використовувати
для пріоритизації сполук у процесі розроблення знеболювальних препаратів, спрямо-
ваних на рецептор TRPV1.
Ключові слова: QSAR-моделювання, машинне навчання, TRPV1, молекулярні
дескриптори.
ВСТУП. Молекулярне моделювання за-
ймає провідне місце серед сучасних напря-
мів обчислювальної хімії. При розробленні
нових фармацевтичних засобів дослідники
стикаються з необхідністю швидко та ефек-
тивно передбачувати біологічну активність
великої кількості потенційних кандидатів.
Для цього широко використовують моделі
кількісних співвідношень структура-ак-
тивність (QSAR – Quantitative Structure-
Activity Relationship).
Традиційні QSAR-моделі базуються на
розрахунку молекулярних дескрипторів,
які характеризують структурні та фізико-
хімічні властивості молекул. Однак якість
таких моделей часто переоцінюють через
неправильне розділення даних на трену-
вальний та тестовий набори [1].
Основна проблема, яку розглянуто у
цій роботі, що слідує з парадигми машин-
ного навчання [2], полягає в наступному:
якщо тестовий набір містить молекулярні
28 ISSN 2708-129X. Укр. хім. журн., 2026
ОПТИМІЗАЦІЯ QSAR-МОДЕЛЕЙ ДЛЯ ПЕРЕДБАЧЕННЯ БІОЛОГІЧНОЇ АКТИВНОСТІ МОЛЕКУЛ
МЕТОДАМИ МАШИННОГО НАВЧАННЯФІЗИЧНА ХІМІЯ
структури (scaffolds), яких немає у трену-
вальному наборі, то модель не зможе адек-
ватно передбачувати їхню активність, на-
віть якщо показує високу точність на зви-
чайному випадковому розділенні.
Мета дослідження – розробити та проте-
стувати методи оптимізації QSAR-моделей
для потенційних знеболювальних препара-
тів за концентраціями інгібітування (IC50)
рецептора болю TRPV1 [3] з урахуванням
молекулярної різноманітності набору ха-
рактеристичних даних – датасету.
ЕКСПЕРИМЕНТ І ОБГОВОРЕННЯ РЕ-
ЗУЛЬТАТІВ. Дослідження проводили на да-
тасеті (наборі даних) із 3782 молекул (взяті
з бази даних ChEMBL – Chemical European
Molecular Biology Laboratory) з обчислени-
ми за допомогою бібліотек (RDKit, Mordred,
Morgan fingerprints) 3291 молекулярними
дескрипторами. Цільовою змінною була
інгібувальна активність до TRPV1 (від’єм-
ний десятковий логарифм IC50 – pChEMBL
Value), яка варіювалася від 5.01 до 8.52.
За допомогою випадкової вибірки дата-
сет було розділено на тренувальну (80%) та
тестову (20%) вибірки [4]. Одержали дата-
сет, ключовою особливістю якого є наяв-
ність 733 унікальних молекулярних струк-
тур (scaffolds), при цьому 72 з’явилися лише
у тестовому наборі при звичайному випад-
ковому розділенні, що свідчить про зна-
чний потенціал для втрати інформації [2].
Зокрема для оцінки втрати інформацій-
ного потенціалу було порівняно три підхо-
ди до розділення датасету [5]:
1. Звичайний K-Fold (крос-валідація),
або випадкове розділення між набо-
рами без урахування молекулярних
структур. У результаті отримали ко-
ефіцієнт детермінації R² = 0.54, яке є
оптимістичною оцінкою через втрату
інформації про структури.
2. Груповий K-Fold (Group K-Fold), або
розділення так, щоб усі молекули з
однаковою (схожою) молекулярною
структурою потрапляли лише в один
набір. У результаті маємо R² = 0.31, що
показує реальну складність завдання
на невидимих структурах.
3. Стратифіковане розділення (Stratified
Split) 80/20, яке застосовували у цьому
дослідженні з урахуванням розподілу
активності та молекулярних струк-
тур. У результаті обчислень отримали
R² = 0.646-0.720 залежно від методу
моделювання, що показує оптималь-
ність підходу.
У ході роботи було протестовано декіль-
ка моделей машинного навчання, зокрема:
випадковий ліс (Random Forest, 500 дерев),
градієнтне підсилення (Gradient Boosting,
GB; 300 дерев, швидкість навчання (learning
rate) = 0.05) та нейронні мережі (Neural
Networks) із малими та середніми архітек-
турами.
Для представлення молекулярних струк-
тур використовували морганівські відбит-
ки (Morgan fingerprints), а також застосу-
вали метод головних компонент (Principal
Component Analysis, PCA) для зменшення
розмірності дескрипторного простору.
Градієнтне підсилення показало найкра-
щі результати і було обрано для подальших
оптимізацій.
Для збільшення передбачуваної сили
моделі було застосовано наступні методи
оптимізації [6]:
1. Розширення тренувального набору
(Data augmentation – Aug) у 2 та в
3 рази шляхом додавання до значень
29https://ucj.org.ua
Д. В. Маслов, О. А. Голуб УХЖ № 3 / ТОМ 92
дескрипторів малих випадкових збу-
рень (σ=0.02), яке моделює природну
варіативність в експериментальних
даних.
2. Подвоєння та потроєння важливих
молекулярних дескрипторів на основі
їхньої важливості, розрахованої з ба-
зової моделі, що надає моделі більший
внесок (сигнал) від важливих ознак.
3. Комбінування попередніх методів із
застосуванням їх водночас.
У ході обчислень було знайдено топ-20
найважливіших дескрипторів, які визнача-
ють близько 26% від загальної важливості.
На чолі списку є наступні: n10FaRing_2D та
n10FaRing_3D (індекси для 10-членних аро-
матичних кілець), BCUTpe-1l та BCUTse-1l
(BCUT-дескриптори, що характеризують
розподіл електронної густини), fr_NH1
(частота первинних амінів), MolLogP (ліпо-
фільність). Позначення дескрипторів взяті
з відповідних бібліотек. Саме ці дескрип-
тори відображають ключові структурні та
фізико-хімічні властивості, які впливають
на IC50 для TRPV1.
Але таке число дескрипторів, навіть най-
важливіших, не дозволяє отримати реаль-
ну картину. Тому відбір дескрипторів для
подальшої оптимізації здійснювали на ос-
нові їхньої важливості (feature importance),
визначеної за допомогою базової моделі.
Було протестовано різні розміри підмно-
жин (20, 50, 100, 150, 200, 250 дескрипто-
рів). Встановлено, що менші набори при-
зводять до втрати інформативності, тоді
як збільшення їхньої кількості понад 100
не додає прецизійності, а спричиняє роз-
мивання внеску найбільш значущих ознак.
Таким чином, вибір топ-100 дескрипторів
є емпірично обґрунтованим компромісом
між точністю та стабільністю моделі.
Таблиця
Порівняння результатів обчислень різними методами оптимізації
Table.
Comparison of calculation results using different optimization methods.
Метод R² MAE* RMSE** Покращення
Базова GB 0.7080 0.425 0.560 –
GB + Aug 0.7112 0.421 0.555 +0.45%
GB + Aug + Подвоєння 0.7126 0.418 0.553 +0.66%
GB + Aug + Потроєння 0.7201 0.410 0.547 +1.71%
* MAE – Mean Absolute Error (середня абсолютна похибка);
** RMSE – Root Mean Squared Error (середньоквадратична похибка).
Як видно з таблиці, найкращий резуль-
тат було отримано при поєднанні Data
augmentation із потроєнням топ-100 де-
скрипторів, вибраних за результатами ма-
шинного навчання.
30 ISSN 2708-129X. Укр. хім. журн., 2026
ОПТИМІЗАЦІЯ QSAR-МОДЕЛЕЙ ДЛЯ ПЕРЕДБАЧЕННЯ БІОЛОГІЧНОЇ АКТИВНОСТІ МОЛЕКУЛ
МЕТОДАМИ МАШИННОГО НАВЧАННЯФІЗИЧНА ХІМІЯ
ВИСНОВКИ. Таким чином модель ма-
шинного навчання, яка дозволяє досяг-
нути значення коефіцієнта детермінації
R² = 0.7201, можна вважати придатною для
скринінгу молекул на ранніх етапах роз-
роблення лікарських засобів [7]. Значен-
ня MAE = 0.41 свідчить, що в середньому
передбачена активність відрізняється від
експериментальної всього на ±0.41 лога-
рифмічної одиниці. Така точність є при-
йнятною для QSAR-моделей і її можна ви-
користовувати у поєднанні з хімічною ін-
туїцією, застосуванням інструментів ШІ та
додатковими методами валідації, зокрема
молекулярним докінгом або експеримен-
тальними випробуваннями [8–10].
Критично важливим є правильне розді-
лення даних, зокрема Group K-Fold пока-
зав, що реальна якість моделі на невидимих
структурах є значно нижчою, ніж оціночні
значення. Окрім цього, вельми ефективною
є Data augmentation або розширення дата-
сету в 2–3 рази шляхом додавання малих
збурень, що поліпшує узагальнюваність
моделей.
Важливо відзначити, що комбіновані ме-
тоди перевершують окремі, але найбільше
поліпшення (R²=0.7201, +1.71%) досягнуто
за одночасного застосування обох методів
(Aug та потроєння топ-100 дескрипторів).
Також слід підкреслити, що не всі під-
ходи є універсальними. Зокрема, викори-
стання морганівських відбитків, глибоких
нейронних мереж (Deep Neural Networks),
а також попереднє оброблення даних за
допомогою методу головних компонент
(Principal Component Analysis, PCA) не
призвели до покращення якості моделей
для зазначеного датасету.
Це підкреслює важливість емпіричного
тестування різних підходів, а також необ-
хідність адаптації вибору дескрипторів і
моделей до конкретної задачі та властивос-
тей набору даних.
Таким чином розроблена модель з
R² = 0.7201 є практично корисною для роз-
ширеного скринінгу молекулярних бібліо
тек на ранніх етапах розроблення нових
лікарських засобів.
ДЕТАЛІЗАЦІЯ ВКЛАДУ АВТОРІВ У
ПІДГОТОВКУ РУКОПИСУ. Автори роботи
зробили рівнозначний внесок у розроблен-
ня концепції та дизайну дослідження, збір,
систематизацію, аналіз та інтерпретацію
отриманих даних. Автори брали рівнове-
лику участь у підготовці, редагуванні та до-
опрацюванні статті. Усі автори ознайоми-
лися з результатами дослідження та схва-
лили остаточну версію статті.
КОНФЛІКТ ІНТЕРЕСІВ. Автори заявля-
ють про відсутність конфлікту інтересів.
ПОДЯКА.
Цю роботу було підтримано грантом
від Міжнародного фонду Саймон-
са [SFI-PD-Ukraine-00014577, O.G.]
(This work was supported by a grant from
the Simons Foundation International
[SFI-PD-Ukraine-00014577, O.G.]).
Державний реєстраційний номер:
0121U100174.
31https://ucj.org.ua
Д. В. Маслов, О. А. Голуб УХЖ № 3 / ТОМ 92
OPTIMIZATION OF QSAR MODELS FOR
PREDICTION OF BIOLOGICAL ACTIVITY
MOLECULES USING MACHINE
LEARNING METHODS.
D. V. Maslov
https://orcid.org/0009-0002-1376-1450
O. A. Golub
https://orcid.org/0000-0003-1823-2523
National University “Kyiv-Mohyla Academy”,
Ukraine
2 Skovoroda st., 04070 Kyiv, Ukraine
e-mail: dv.maslov@ukma.edu.ua
Molecular modeling plays a central role in
modern computational chemistry, particular-
ly in the early stages of drug discovery, where
researchers must rapidly and reliably predict
the biological activity of large sets of potential
candidates. Quantitative Structure–Activity
Relationship (QSAR) models are widely used
for this purpose; however, their true predictive
performance is often overestimated due to im-
proper data splitting strategies. A key challenge
arises when test sets contain molecular scaf-
folds absent from the training data, resulting
in models that appear accurate under random
splits but fail to generalize to unseen chemical
space.
This study investigates optimization stra
tegies for QSAR modeling while explicitly
accounting for molecular diversity. A dataset
of 3,782 molecules with 3,291 computed de-
scriptors and pChEMBL anesthetic activity
values (5.01–8.52) for receptor TRPV1 was
analyzed. The dataset contained 733 unique
scaffolds, and 72 occurred exclusively in the
test set under random 80/20 splitting, revea
ling substantial information leakage. Three
splitting strategies were compared: standard
K-Fold (R² = 0.54), scaffold-based Group
K-Fold (R² = 0.31), and stratified scaffold-
aware splitting (R² = 0.646–0.7201), the latter
demonstrating the most realistic and stable
performance.
Multiple machine-learning approaches were
evaluated, with Gradient Boosting achiev-
ing the best baseline accuracy. Optimization
techniques included descriptor-level data
augmentation (σ = 0.02), descriptor weight-
ing by duplicating the most important fea-
tures, and combined methods. The best model
(R² = 0.7201, MAE = 0.41) was obtained by in-
tegrating augmentation with triple duplication
of top-ranking descriptors. Several commonly
used approaches—Morgan fingerprints, deep
neural networks, PCA—yielded significantly
weaker performance, highlighting the superior
informativeness of physicochemical descrip-
tors for this dataset.
The resulting model demonstrates practi-
cal utility for early-stage virtual screening and
prioritization of candidate molecules, provid-
ing a reliable tool for guiding medicinal che
mistry decisions.
Keywords: QSAR modeling; machine
learning; TRPV1; molecular descriptors.
ЛІТЕРАТУРА
1. Golbraikh A., Tropsha A. Beware of q²!. Jour-
nal of Molecular Graphics and Modelling.
2002. 20(4). 269–276. doi:
https://doi.org/10.1016/S1093-3263(01)00123-1.
2. Yang K., Swanson K., Jin W. et al. Analyzing
learned molecular representations for proper-
ty prediction. Journal of Chemical Informa-
tion and Modeling. 2019. 59(8). 3370–3388.
doi: https://doi.org/10.1021/acs.jcim.9b00237.
32 ISSN 2708-129X. Укр. хім. журн., 2026
ОПТИМІЗАЦІЯ QSAR-МОДЕЛЕЙ ДЛЯ ПЕРЕДБАЧЕННЯ БІОЛОГІЧНОЇ АКТИВНОСТІ МОЛЕКУЛ
МЕТОДАМИ МАШИННОГО НАВЧАННЯФІЗИЧНА ХІМІЯ
3. Caterina M. J., Schumacher M. A., Tomi-
naga M., Rosen T. A., Levine J. D., Julius D.
The capsaicin receptor: a heat-activated ion
channel in the pain pathway. Nature. 1997.
389(6653). 816–824.
doi: https://doi.org/10.1038/39807.
4. Hastie T., Tibshirani R., Friedman J. The ele
ments of statistical learning: data mining, in-
ference, and prediction. 2nd ed. New York:
Springer. 2009. doi:
https://doi.org/10.1007/978-0-387-84858-7.
5. Petrov K. P., Bender A. An open-source imple-
mentation of scaffold identification. ChemRxiv
(preprint). 2024.
doi: https://doi.org/10.26434/chemrxiv-2024-
84r9x.
6. Lange J. J., Strickfaden S., Klein R., Hinselmann
G. Comparative analysis of chemical descrip-
tors by machine learning. Molecular Pharma-
ceutics. 2024. 21(5). 1874–1888. doi: https://
doi.org/10.1021/acs.molpharmaceut.4c00080.
7. Tropsha A. Best practices for QSAR model de-
velopment, validation, and exploitation. Mo-
lecular Informatics. 2010. 29(6–7): 476–488.
doi: https://doi.org/10.1002/minf.201000061.
8. Cherkasov A., Muratov E. N., Fourches D. et
al. QSAR modeling: where have you been?
Where are you going to? Journal of Medicinal
Chemistry. 2014. 57(12). 4977–5010.
doi: https://doi.org/10.1021/jm4004285.
9. Roy K., Kar S., Das R. N. A primer on QSAR/
QSPR modeling. Springer. 2015.
doi: https://doi.org/10.1007/978-3-319-17281-1.
10. Gramatica P. On the development and valida-
tion of QSAR models. Methods in Molecular
Biology. 2013. 930: 499–526. doi: https://doi.
org/10.1007/978-1-62703-059-5_21.
REFERENCES
1. Golbraikh A., Tropsha A. Beware of q²!. Jour-
nal of Molecular Graphics and Modelling.
2002. 20(4): P. 269–276. doi:
https://doi.org/10.1016/S1093-3263(01)00123-1.
2. Yang K., Swanson K., Jin W. et al. Analyzing
learned molecular representations for proper-
ty prediction. Journal of Chemical Informa-
tion and Modeling. 2019. 59(8): P. 3370–3388.
doi: https://doi.org/10.1021/acs.jcim.9b00237.
3. Caterina M. J., Schumacher M. A., Tomina
ga M., Rosen T. A., Levine J. D., Julius D.
The capsaicin receptor: a heat-activated ion
channel in the pain pathway. Nature. 1997.
389(6653): P. 816–824. doi:
https://doi.org/10.1038/39807.
4. Hastie T., Tibshirani R., Friedman J. The ele
ments of statistical learning: data mining, in-
ference, and prediction. 2nd ed. New York:
Springer. 2009.
doi: https://doi.org/10.1007/978-0-387-84858-7.
5. Petrov K. P., Bender A. An open-source imple-
mentation of scaffold identification. ChemRxiv
(preprint). 2024. doi: https://doi.org/10.26434/
chemrxiv-2024-84r9x.
6. Lange J. J., Strickfaden S., Klein R., Hinselmann
G. Comparative analysis of chemical descrip-
tors by machine learning. Molecular Pharma-
ceutics. 2024. 21(5): P. 1874–1888. doi: https://
doi.org/10.1021/acs.molpharmaceut.4c00080.
7. Tropsha A. Best practices for QSAR model de-
velopment, validation, and exploitation. Mo-
lecular Informatics. 2010. 29(6–7): 476–488.
doi: https://doi.org/10.1002/minf.201000061.
8. Cherkasov A., Muratov E. N., Fourches D. et
al. QSAR modeling: where have you been?
Where are you going to? Journal of Medicinal
Chemistry. 2014. 57(12): P. 4977–5010.
doi: https://doi.org/10.1021/jm4004285.
9. Roy K., Kar S., Das R. N. A primer on QSAR/
QSPR modeling. Springer. 2015.
doi: https://doi.org/10.1007/978-3-319-17281-1.
10. Gramatica P. On the development and valida-
tion of QSAR models. Methods in Molecular
Biology. 2013. 930: P. 499–526. doi: https://doi.
org/10.1007/978-1-62703-059-5_21.
Стаття надійшла: 25.03.2026.
Статтю прийнято до друку: 11.04.2026.
Статтю опубліковано: 30.04.2026.
|
| id | oai:ojs2.1444248.nisspano.web.hosting-test.net:article-772 |
| institution | Ukrainian Chemistry Journal |
| keywords_txt_mv | keywords |
| language | English |
| last_indexed | 2026-07-23T01:14:22Z |
| publishDate | 2026 |
| publisher | V.I.Vernadsky Institute of General and Inorganic Chemistry |
| record_format | ojs |
| resource_txt_mv | ucjorgua/d9/1f47b6a3bf2d7ec9c8963c7eb32990d9.pdf |
| spelling | oai:ojs2.1444248.nisspano.web.hosting-test.net:article-7722026-07-22T08:23:57Z OPTIMIZATION OF QSAR MODELS FOR PREDICTION OF BIOLOGICAL ACTIVITY MOLECULES USING MACHINE LEARNING METHODS Maslov, Danilo Golub, Oleksandr QSAR modeling; machine learning; TRPV1; molecular descriptors. Molecular modeling plays a central role in modern computational chemistry, particularly in the early stages of drug discovery, where researchers must rapidly and reliably predict the biological activity of large sets of potential candidates. Quantitative Structure–Activity Relationship (QSAR) models are widely used for this purpose; however, their true predictive performance is often overestimated due to improper data splitting strategies. A key challenge arises when test sets contain molecular scaffolds absent from the training data, resulting in models that appear accurate under random splits but fail to generalize to unseen chemical space. This study investigates optimization strategies for QSAR modeling while explicitly accounting for molecular diversity. A dataset of 3,782 molecules with 3,291 computed descriptors and pChEMBL anesthetic activity values (5.01–8.52) for receptor TRPV1 was analyzed. The dataset contained 733 unique scaffolds, and 72 occurred exclusively in the test set under random 80/20 splitting, revealing substantial information leakage. Three splitting strategies were compared: standard K-Fold (R² = 0.54), scaffold-based Group K-Fold (R² = 0.31), and stratified scaffold-aware splitting (R² = 0.646–0.7201), the latter demonstrating the most realistic and stable performance. Multiple machine-learning approaches were evaluated, with Gradient Boosting achieving the best baseline accuracy. Optimization techniques included descriptor-level data augmentation (σ = 0.02), descriptor weighting by duplicating the most important features, and combined methods. The best model  (R² = 0.7201, MAE = 0.41) was obtained by integrating augmentation with triple duplication of top-ranking descriptors. Several commonly used approaches—Morgan fingerprints, deep neural networks, PCA—yielded significantly weaker performance, highlighting the superior informativeness of physicochemical descriptors for this dataset. The resulting model demonstrates practical utility for early-stage virtual screening and prioritization of candidate molecules, providing a reliable tool for guiding medicinal chemistry decisions. V.I.Vernadsky Institute of General and Inorganic Chemistry 2026-04-30 Article Article Physical chemistry Физическая xимия Фізична xімія application/pdf https://ucj.org.ua/index.php/journal/article/view/772 10.33609/2708-129X.92.3.2026.27-32 Ukrainian Chemistry Journal; Vol. 92 No. 3 (2026): Ukrainian Chemistry Journal; 27-32 Украинский химический журнал; ##issue.vol## 92 ##issue.no## 3 (2026): Ukrainian Chemistry Journal; 27-32 Український хімічний журнал; Том 92 № 3 (2026): Ukrainian Chemistry Journal; 27-32 2708-129X 2708-1281 en https://ucj.org.ua/index.php/journal/article/view/772/405 Copyright (c) 2026 Danilo Maslov, Oleksandr Golub https://creativecommons.org/licenses/by-nc/4.0 |
| spellingShingle | Maslov, Danilo Golub, Oleksandr OPTIMIZATION OF QSAR MODELS FOR PREDICTION OF BIOLOGICAL ACTIVITY MOLECULES USING MACHINE LEARNING METHODS |
| title | OPTIMIZATION OF QSAR MODELS FOR PREDICTION OF BIOLOGICAL ACTIVITY MOLECULES USING MACHINE LEARNING METHODS |
| title_full | OPTIMIZATION OF QSAR MODELS FOR PREDICTION OF BIOLOGICAL ACTIVITY MOLECULES USING MACHINE LEARNING METHODS |
| title_fullStr | OPTIMIZATION OF QSAR MODELS FOR PREDICTION OF BIOLOGICAL ACTIVITY MOLECULES USING MACHINE LEARNING METHODS |
| title_full_unstemmed | OPTIMIZATION OF QSAR MODELS FOR PREDICTION OF BIOLOGICAL ACTIVITY MOLECULES USING MACHINE LEARNING METHODS |
| title_short | OPTIMIZATION OF QSAR MODELS FOR PREDICTION OF BIOLOGICAL ACTIVITY MOLECULES USING MACHINE LEARNING METHODS |
| title_sort | optimization of qsar models for prediction of biological activity molecules using machine learning methods |
| topic_facet | QSAR modeling machine learning TRPV1 molecular descriptors. |
| url | https://ucj.org.ua/index.php/journal/article/view/772 |
| work_keys_str_mv | AT maslovdanilo optimizationofqsarmodelsforpredictionofbiologicalactivitymoleculesusingmachinelearningmethods AT goluboleksandr optimizationofqsarmodelsforpredictionofbiologicalactivitymoleculesusingmachinelearningmethods |