A sensitivity analysis of data imputation in daily PM10 prediction
DOI: https://doi.org/10.3846/mla.2026.26975Abstract
Reliable daily prediction of particulate matter (PM10) depends not only on model structure and predictor selection, but also on how missing data are treated during preprocessing. In air-quality applications, gaps are common in both ground-based monitoring records and satellite-derived predictors due to instrument downtime, quality screening, and cloud contamination. Despite this, data imputation is often treated as a purely technical step. The study presents a sensitivity analysis of data imputation strategies and their impact on daily PM10 prediction using a Random Forest (RF) framework over Lithuania for the period 2019–2024. Using a consistent spatiotemporal dataset integrating ground observations, meteorological variables, satellite-derived atmospheric composition, and temporal features, multiple gap-filling approaches were evaluated under identical model configurations and temporal data splits. The examined imputation methods include inverse distance weighting (IDW), Gaussian process regression (GPR), station mean and median, and Multivariate Imputation by Chained Equations (MICE). Model performance was assessed using the coefficient of determination (R²), root mean square error (RMSE), and mean absolute error (MAE). Results indicate that spatially informed imputation IDW consistently achieved the highest reconstruction accuracy under moderate missingness, while GPR became competitive under extreme data loss. Using the selected IDW-completed dataset, the RF model achieved predictive performance (Test: R² = 0.615, RMSE = 6.37 µg/m³, MAE = 4.78 µg/m³).
Article in English.
Trūkstamų duomenų užpildymo įtakos analizė prognozuojant paros PM10 koncentracijas
Santrauka
Patikima paros kietųjų dalelių (PM₁₀) koncentracijos prognozė priklauso ne tik nuo modelio struktūros ir prognozuojamųjų kintamųjų parinkimo, bet ir nuo to, kaip duomenų paruošimo etape tvarkomi trūkstami duomenys. Oro kokybės tyrimuose duomenų spragos dažnai susidaro tiek antžeminių matavimų įrašuose, tiek iš palydovinių duomenų išvestuose kintamuosiuose dėl prietaisų veikimo sutrikimų, kokybės filtravimo procedūrų ar debesuotumo poveikio. Nepaisant to, trūkstamų duomenų užpildymas dažnai laikomas tik techniniu duomenų apdorojimo žingsniu. Šiame tyrime pateikiama trūkstamų duomenų užpildymo metodų jautrumo analizė ir jų įtaka paros PM₁₀ koncentracijos prognozėms vertinti, taikant atsitiktinių miškų (angl. Random Forest, RF) metodą Lietuvos teritorijoje 2019–2024 m. laikotarpiu. Naudojant nuoseklų erdvinių ir laiko duomenų rinkinį, integruojantį antžeminius stebėjimus, meteorologinius kintamuosius, iš palydovinių duomenų gautus atmosferos sudėties rodiklius bei laiko požymius, buvo vertinami keli trūkstamų duomenų užpildymo metodai, taikant vienodas modelio konfigūracijas ir identišką duomenų skaidą laiko atžvilgiu. Analizuoti metodai apėmė atvirkštinio atstumo svorių metodą (IDW), Gauso procesų regresiją (GPR), stoties vidurkio ir medianos metodus bei daugiamates grandinines lygtis (MICE). Modelių tikslumas vertintas pagal determinacijos koeficientą (R²), vidutinę kvadratinę paklaidą (RMSE) ir vidutinę absoliučiąją paklaidą (MAE). Tyrimo rezultatai parodė, kad, taikant IDW metodą, kai yra vidutinis trūkstamas duomenų kiekis, gaunamas didžiausias atkūrimo tikslumas, o esant itin dideliems duomenų praradimams gerų rezultatų pasiekta GPR metodu. Taikant IDW metodą su papildytu duomenų rinkiniu ir RF modeliu pasiektos šios prognozavimo tikslumo rodiklių imtys: R² = 0,615, RMSE = 6,37 µg/m³ ir MAE = 4,78 µg/m³.
Reikšminiai žodžiai: PM₁₀ prognozavimas, duomenų priskyrimas, atsitiktinių miškų metodas, oro kokybės modeliavimas, erdvinė ir laiko analizė.
Keywords:
PM₁₀ prediction, data imputation, random forest, air quality modelling, spatiotemporal analysisHow to Cite
Share
License
Copyright (c) 2026 The Author(s). Published by Vilnius Gediminas Technical University.

This work is licensed under a Creative Commons Attribution 4.0 International License.
References
Azifah Mohd Pauzi, N., Bee Wah, Y., Mohd Deni, S., & Khatijah Nor Abdul Rahim, S. (2021). Comparison of single and MICE imputation methods for missing values: A simulation study. Pertanika Journal of Science & Technology, 29(2), 979–998. https://doi.org/10.47836/pjst.29.2.15
Bai, L., Wang, J., Ma, X., & Lu, H. (2018). Air pollution forecasts: An overview. International Journal of Environmental Research and Public Health, 15(4), Article 780. https://doi.org/10.3390/ijerph15040780
Baruah, A., Bousiotis, D., Damayanti, S., Bigi, A., Ghermandi, G., Ghaffarpasand, O., Harrison, R. M., & Pope, F. D. (2024). A novel spatiotemporal prediction approach to fill air pollution data gaps using mobile sensors, machine learning and citizen science techniques. Npj Climate and Atmospheric Science, 7, Article 310. https://doi.org/10.1038/s41612-024-00859-z
Bernacki, J., & Scherer, R. (2025). A comprehensive review of data-driven techniques for air pollution concentration forecasting. Sensors, 25(19), Article 6044. https://doi.org/10.3390/s25196044
Chen, M., Zhu, H., Chen, Y., & Wang, Y. (2022). A novel missing data imputation approach for time series air quality data based on logistic regression. Atmosphere, 13(7), Article 1044. https://doi.org/10.3390/atmos13071044
Chhabra, P. (2024). The effect of different meteorological factors on the concentrations of air pollutants. EarthArXiv. https://doi.org/10.31223/X5F98K
Deligiorgi, D., Philippopoulos, K., Deligiorgi, D., & Philippopoulos, K. (2011). Spatial interpolation methodologies in urban air pollution modeling: Application for the eater Area of Metropolitan Athens, Greece. In F. Nejadkoorki, Advanced air pollution. IntechOpen. https://doi.org/10.5772/17734
Díaz-González, L., Trujillo-Uribe, I., Pérez-Sansalvador, J. C., & Lakouari, N. (2025). Handling missing air quality data using bidirectional recurrent imputation for time series and random forest: A case study in Mexico City. AI 2025, 6(9), Article 208. https://doi.org/10.3390/ai6090208
Earth Engine Data Catalog. (n.d.). Datasets tagged tropomi in Earth Engine. Retrieved January 15, 2026, from https://developers.google.com/earth-engine/datasets/tags/tropomi
European Environment Agency. (n.d.). Retrieved February 1, 2026, from https://www.eea.europa.eu/en
Fahim, M. A. S., & Visockienė, J. S. (2026). An assessment of the multi-input spatiotemporal RF–XGBoost hybrid framework for PM10 estimation in Lithuania. Sustainability 2026, 18(4), Article 2022. https://doi.org/10.3390/su18042022
Hua, V., Nguyen, T., Dao, M. S., Nguyen, H. D., & Nguyen, B. T. (2024). The impact of data imputation on air quality prediction problem. PLOS One, 19(9), Article e0306303. https://doi.org/10.1371/journal.pone.0306303
Johnson, H. (2018). PM2.5 pollution and temperature inversions: A case study in St. Louis, MO. Iowa State University Digital Repository. https://doi.org/10.31274/cc-20240624-1133
Karami, S., Ghassabi, Z., Khoddam, N., & Habibi, M. (2025). Investigating meteorological factors influencing pollutant concentrations and copernicus atmosphere monitoring service (CAMS) model forecasts in the Tehran Metropolis. Atmosphere, 16(3), Article 264. https://doi.org/10.3390/atmos16030264
Karapetyan, I., & Galoyan, E. (2025). Air pollution dynamics in Yerevan (DS 299 Capstone in data science project report). https://cse.aua.am/wp-content/uploads/2025/06/Air_pollution-1.pdf
Meteo.lt – Lithuanian Hydrometeorological Service. (n.d.). Retrieved February 2, 2026, from https://www.meteo.lt/
Panaite, F. A., Rus, C., Leba, M., Ionica, A. C., & Windisch, M. (2024). Enhancing air-quality predictions on university campuses: A machine-learning approach to PM2.5 forecasting at the University of Petroșani. Sustainability, 16(17), Article 7854. https://doi.org/10.3390/su16177854
TROPOMI: TROPOspheric Monitoring Instrument. (n.d.). Retrieved February 3, 2026, from https://www.tropomi.eu/
Willmott, C. J., & Matsuura, K. (2005). Advantages of the mean absolute error (MAE) over the root mean square error (RMSE) in assessing average model performance. Climate Research, 30(1), 79–82. https://doi.org/10.3354/cr030079
Wong, D. W., Yuan, L., & Perlin, S. A. (2004). Comparison of spatial interpolation methods for the estimation of air quality data. Journal of Exposure Science & Environmental Epidemiology, 14, 404–415. https://doi.org/10.1038/sj.jea.7500338
Zaman, N. A. F. K., Kanniah, K. D., Kaskaoutis, D. G., & Latif, M. T. (2021). Evaluation of machine learning models for estimating PM2.5 concentrations across Malaysia. Applied Sciences, 11(16), Article 7326. https://doi.org/10.3390/app11167326
Zhao, F., Liang, Z., Zhang, Q., Seng, D., & Chen, X. (2021). Research on PM2.5 spatiotemporal forecasting model based on LSTM neural network. Computational Intelligence and Neuroscience, 2021(1), Article 1616806. https://doi.org/10.1155/2021/1616806
View article in other formats
Published
Issue
Section
Copyright
Copyright (c) 2026 The Author(s). Published by Vilnius Gediminas Technical University.
License

This work is licensed under a Creative Commons Attribution 4.0 International License.