A sensitivity analysis of data imputation in daily PM10 prediction

DOI: https://doi.org/10.3846/mla.2026.26975

Abstract

Reliable daily prediction of particulate matter (PM10) depends not only on model structure and predictor selection, but also on how missing data are treated during preprocessing. In air-quality applications, gaps are common in both ground-based monitoring records and satellite-derived predictors due to instrument downtime, quality screening, and cloud contamination. Despite this, data imputation is often treated as a purely technical step. The study presents a sensitivity analysis of data imputation strategies and their impact on daily PM10 prediction using a Random Forest (RF) framework over Lithuania for the period 2019–2024. Using a consistent spatiotemporal dataset integrating ground observations, meteorological variables, satellite-derived atmospheric composition, and temporal features, multiple gap-filling approaches were evaluated under identical model configurations and temporal data splits. The examined imputation methods include inverse distance weighting (IDW), Gaussian process regression (GPR), station mean and median, and Multivariate Imputation by Chained Equations (MICE). Model performance was assessed using the coefficient of determination (R²), root mean square error (RMSE), and mean absolute error (MAE). Results indicate that spatially informed imputation IDW consistently achieved the highest reconstruction accuracy under moderate missingness, while GPR became competitive under extreme data loss. Using the selected IDW-completed dataset, the RF model achieved predictive performance (Test: R² = 0.615, RMSE = 6.37 µg/m³, MAE = 4.78 µg/m³).

Article in English.

Trūkstamų duomenų užpildymo įtakos analizė prognozuojant paros PM10 koncentracijas

Santrauka

Patikima paros kietųjų dalelių (PM₁₀) koncentracijos prognozė priklauso ne tik nuo modelio struktūros ir prognozuojamųjų kintamųjų parinkimo, bet ir nuo to, kaip duomenų paruošimo etape tvarkomi trūkstami duomenys. Oro kokybės tyrimuose duomenų spragos dažnai susidaro tiek antžeminių matavimų įrašuose, tiek iš palydovinių duomenų išvestuose kintamuosiuose dėl prietaisų veikimo sutrikimų, kokybės filtravimo procedūrų ar debesuotumo poveikio. Nepaisant to, trūkstamų duomenų užpildymas dažnai laikomas tik techniniu duomenų apdorojimo žingsniu. Šiame tyrime pateikiama trūkstamų duomenų užpildymo metodų jautrumo analizė ir jų įtaka paros PM₁₀ koncentracijos prognozėms vertinti, taikant atsitiktinių miškų (angl. Random Forest, RF) metodą Lietuvos teritorijoje 2019–2024 m. laikotarpiu. Naudojant nuoseklų erdvinių ir laiko duomenų rinkinį, integruojantį antžeminius stebėjimus, meteorologinius kintamuosius, iš palydovinių duomenų gautus atmosferos sudėties rodiklius bei laiko požymius, buvo vertinami keli trūkstamų duomenų užpildymo metodai, taikant vienodas modelio konfigūracijas ir identišką duomenų skaidą laiko atžvilgiu. Analizuoti metodai apėmė atvirkštinio atstumo svorių metodą (IDW), Gauso procesų regresiją (GPR), stoties vidurkio ir medianos metodus bei daugiamates grandinines lygtis (MICE). Modelių tikslumas vertintas pagal determinacijos koeficientą (R²), vidutinę kvadratinę paklaidą (RMSE) ir vidutinę absoliučiąją paklaidą (MAE). Tyrimo rezultatai parodė, kad, taikant IDW metodą, kai yra vidutinis trūkstamas duomenų kiekis, gaunamas didžiausias atkūrimo tikslumas, o esant itin dideliems duomenų praradimams gerų rezultatų pasiekta GPR metodu. Taikant IDW metodą su papildytu duomenų rinkiniu ir RF modeliu pasiektos šios prognozavimo tikslumo rodiklių imtys: R² = 0,615, RMSE = 6,37 µg/m³ ir MAE = 4,78 µg/m³.

Reikšminiai žodžiai: PM₁₀ prognozavimas, duomenų priskyrimas, atsitiktinių miškų metodas, oro kokybės modeliavimas, erdvinė ir laiko analizė.

Keywords:

PM₁₀ prediction, data imputation, random forest, air quality modelling, spatiotemporal analysis
Published in Issue
September 30, 2026
Abstract Views
14

How to Cite

Fahim, M. A. S., & Sužiedelytė Visockienė, J. (2026). A sensitivity analysis of data imputation in daily PM10 prediction. Mokslas – Lietuvos ateitis / Science – Future of Lithuania, 18. https://doi.org/10.3846/mla.2026.26975

Share

References

Azifah Mohd Pauzi, N., Bee Wah, Y., Mohd Deni, S., & Khatijah Nor Abdul Rahim, S. (2021). Comparison of single and MICE imputation methods for missing values: A simulation study. Pertanika Journal of Science & Technology, 29(2), 979–998. https://doi.org/10.47836/pjst.29.2.15

Bai, L., Wang, J., Ma, X., & Lu, H. (2018). Air pollution forecasts: An overview. International Journal of Environmental Research and Public Health, 15(4), Article 780. https://doi.org/10.3390/ijerph15040780

Baruah, A., Bousiotis, D., Damayanti, S., Bigi, A., Ghermandi, G., Ghaffarpasand, O., Harrison, R. M., & Pope, F. D. (2024). A novel spatiotemporal prediction approach to fill air pollution data gaps using mobile sensors, machine learning and citizen science techniques. Npj Climate and Atmospheric Science, 7, Article 310. https://doi.org/10.1038/s41612-024-00859-z

Bernacki, J., & Scherer, R. (2025). A comprehensive review of data-driven techniques for air pollution concentration forecasting. Sensors, 25(19), Article 6044. https://doi.org/10.3390/s25196044

Chen, M., Zhu, H., Chen, Y., & Wang, Y. (2022). A novel missing data imputation approach for time series air quality data based on logistic regression. Atmosphere, 13(7), Article 1044. https://doi.org/10.3390/atmos13071044

Chhabra, P. (2024). The effect of different meteorological factors on the concentrations of air pollutants. EarthArXiv. https://doi.org/10.31223/X5F98K

Deligiorgi, D., Philippopoulos, K., Deligiorgi, D., & Philippopoulos, K. (2011). Spatial interpolation methodologies in urban air pollution modeling: Application for the eater Area of Metropolitan Athens, Greece. In F. Nejadkoorki, Advanced air pollution. IntechOpen. https://doi.org/10.5772/17734

Díaz-González, L., Trujillo-Uribe, I., Pérez-Sansalvador, J. C., & Lakouari, N. (2025). Handling missing air quality data using bidirectional recurrent imputation for time series and random forest: A case study in Mexico City. AI 2025, 6(9), Article 208. https://doi.org/10.3390/ai6090208

Earth Engine Data Catalog. (n.d.). Datasets tagged tropomi in Earth Engine. Retrieved January 15, 2026, from https://developers.google.com/earth-engine/datasets/tags/tropomi

European Environment Agency. (n.d.). Retrieved February 1, 2026, from https://www.eea.europa.eu/en

Fahim, M. A. S., & Visockienė, J. S. (2026). An assessment of the multi-input spatiotemporal RF–XGBoost hybrid framework for PM10 estimation in Lithuania. Sustainability 2026, 18(4), Article 2022. https://doi.org/10.3390/su18042022

Hua, V., Nguyen, T., Dao, M. S., Nguyen, H. D., & Nguyen, B. T. (2024). The impact of data imputation on air quality prediction problem. PLOS One, 19(9), Article e0306303. https://doi.org/10.1371/journal.pone.0306303

Johnson, H. (2018). PM2.5 pollution and temperature inversions: A case study in St. Louis, MO. Iowa State University Digital Repository. https://doi.org/10.31274/cc-20240624-1133

Karami, S., Ghassabi, Z., Khoddam, N., & Habibi, M. (2025). Investigating meteorological factors influencing pollutant concentrations and copernicus atmosphere monitoring service (CAMS) model forecasts in the Tehran Metropolis. Atmosphere, 16(3), Article 264. https://doi.org/10.3390/atmos16030264

Karapetyan, I., & Galoyan, E. (2025). Air pollution dynamics in Yerevan (DS 299 Capstone in data science project report). https://cse.aua.am/wp-content/uploads/2025/06/Air_pollution-1.pdf

Meteo.lt – Lithuanian Hydrometeorological Service. (n.d.). Retrieved February 2, 2026, from https://www.meteo.lt/

Panaite, F. A., Rus, C., Leba, M., Ionica, A. C., & Windisch, M. (2024). Enhancing air-quality predictions on university campuses: A machine-learning approach to PM2.5 forecasting at the University of Petroșani. Sustainability, 16(17), Article 7854. https://doi.org/10.3390/su16177854

TROPOMI: TROPOspheric Monitoring Instrument. (n.d.). Retrieved February 3, 2026, from https://www.tropomi.eu/

Willmott, C. J., & Matsuura, K. (2005). Advantages of the mean absolute error (MAE) over the root mean square error (RMSE) in assessing average model performance. Climate Research, 30(1), 79–82. https://doi.org/10.3354/cr030079

Wong, D. W., Yuan, L., & Perlin, S. A. (2004). Comparison of spatial interpolation methods for the estimation of air quality data. Journal of Exposure Science & Environmental Epidemiology, 14, 404–415. https://doi.org/10.1038/sj.jea.7500338

Zaman, N. A. F. K., Kanniah, K. D., Kaskaoutis, D. G., & Latif, M. T. (2021). Evaluation of machine learning models for estimating PM2.5 concentrations across Malaysia. Applied Sciences, 11(16), Article 7326. https://doi.org/10.3390/app11167326

Zhao, F., Liang, Z., Zhang, Q., Seng, D., & Chen, X. (2021). Research on PM2.5 spatiotemporal forecasting model based on LSTM neural network. Computational Intelligence and Neuroscience, 2021(1), Article 1616806. https://doi.org/10.1155/2021/1616806

View article in other formats

CrossMark check

CrossMark logo

Published

2026-09-30

Issue

Section

Environmental Engineering / Aplinkos inžinerija

How to Cite

Fahim, M. A. S., & Sužiedelytė Visockienė, J. (2026). A sensitivity analysis of data imputation in daily PM10 prediction. Mokslas – Lietuvos ateitis / Science – Future of Lithuania, 18. https://doi.org/10.3846/mla.2026.26975

Share