Adjustment of peak flows in water courses without gauging from S-HYPE data. A comparison between observed and modelled flow in Sweden
(2026) In TVVR 5000 VVRM05 20261Division of Water Resources Engineering
- Abstract
- Extreme meteorological events are projected to increase in both frequency and intensity as climate change progresses, placing greater demands on accurate hydrological modelling for flood risk assessment and infrastructure design. In Sweden, the process-based S-HYPE model is widely used to simulate streamflow across approximately 26340 catchments, but like many regional rainfall-runoff models it systematically underestimates peak flows during extreme events, which poses a structural risk when designing culverts, retention basins, and urban drainage systems in ungauged catchments.
This study develops and evaluates a regression-based post-processing framework to quantify and correct this bias for small-to-medium Swedish watercourses with... (More) - Extreme meteorological events are projected to increase in both frequency and intensity as climate change progresses, placing greater demands on accurate hydrological modelling for flood risk assessment and infrastructure design. In Sweden, the process-based S-HYPE model is widely used to simulate streamflow across approximately 26340 catchments, but like many regional rainfall-runoff models it systematically underestimates peak flows during extreme events, which poses a structural risk when designing culverts, retention basins, and urban drainage systems in ungauged catchments.
This study develops and evaluates a regression-based post-processing framework to quantify and correct this bias for small-to-medium Swedish watercourses with 100-year return period flows below 1000 $m^3/s$. Daily observed and S-HYPE-simulated streamflow data from 2010 to 2025 were compiled from an nationwide network of active gauging stations. Annual maximum daily flows were extracted and subjected to flood frequency analysis. The Generalized Extreme Value distribution fitted via L-moments (GEV-Lmom) was identified as the best framework, outperforming the Gumbel, Log-Normal, and Log-Pearson type III distributions across Anderson–Darling and Probability Plot Correlation Coefficient goodness-of-fit tests.
Baseline comparison confirmed that unadjusted S-HYPE outputs underestimate peak flows by a mean bias of $-7.3\%$, despite maintaining strong spatial--temporal correlation ($R^2 = 0.964$). To correct this systematic underestimation while preserving the model's ranking performance, three correction configurations, Full, Reduced, and Flow--only, were evaluated using Multiple Linear Regression (MLR) and Random Forest (RF) algorithms across return periods from 2 to 100 years. Feature selection via permutation testing isolated five statistically significant physiographic predictors for the Reduced configuration: modelled flow, catchment area, upstream area, regulation fraction, and agricultural land--use fraction.
Both MLR and RF successfully reduced the baseline bias, reducing absolute peak flow errors to below $+1.4\%$ across all configurations. The RF model consistently achieved higher predictive accuracy ($R^2 = 0.990$) with tighter error distributions across all return periods, reflecting its capacity to capture non-linear catchment interactions. The log-linear MLR formulation, while slightly less accurate, produced an explicit and transferable scaling equation well suited for operational application at ungauged sites. The framework demonstrates that integrating statistical post-processing with physical catchment descriptors provides a scalable tool for improving extreme peak flow estimation across ungauged Swedish basins and while some uncertainties remain a future study could include a Peaks Over Threshold and a hold-out validation to improve on the results. (Less) - Popular Abstract (Swedish)
- Kraftiga regn och snösmältning kan leda till översvämningar med allvarliga konsekvenser
för bebyggelse, infrastruktur och miljö. För att kunna dimensionera broar, trummor och
dagvattensystem på ett säkert sätt behöver ingenjörer veta hur stora flödena kan bli, inte bara under ett vanligt år, utan även under extrema händelser som statistiskt sett inträffar vart 50:e eller 100:e år.
I Sverige används den hydrologiska modellen S-HYPE, utvecklad av SMHI, för att
beräkna vattenflöden i landets vattendrag. Modellen täcker hela Sverige och delar av
Norge och Finland, och simulerar dagliga flöden i tusentals delområden. Den är ett
viktigt verktyg för vattenförvaltning och samhällsplanering, särskilt i vattendrag där det saknas mätstationer... (More) - Kraftiga regn och snösmältning kan leda till översvämningar med allvarliga konsekvenser
för bebyggelse, infrastruktur och miljö. För att kunna dimensionera broar, trummor och
dagvattensystem på ett säkert sätt behöver ingenjörer veta hur stora flödena kan bli, inte bara under ett vanligt år, utan även under extrema händelser som statistiskt sett inträffar vart 50:e eller 100:e år.
I Sverige används den hydrologiska modellen S-HYPE, utvecklad av SMHI, för att
beräkna vattenflöden i landets vattendrag. Modellen täcker hela Sverige och delar av
Norge och Finland, och simulerar dagliga flöden i tusentals delområden. Den är ett
viktigt verktyg för vattenförvaltning och samhällsplanering, särskilt i vattendrag där det saknas mätstationer och där inga direkta flödesmätningar finns tillgängliga.
Problemet är att S-HYPE, liksom många liknande modeller, tenderar att underskatta
de allra högsta flödestopparna. Modellen beräknar vattenrörelser med hjälp av genomsnittliga värden för stora avrinningsområden, vilket gör att korta men intensiva flödestoppar jämnas ut. Konsekvensen blir att infrastruktur dimensionerad enbart utifrån modellens rådata riskerar att vara underdimensionerad och därmed sårbar vid extrema väderhändelser, som förväntas att bli vanligare i ett förändrat klimat.
I det här examensarbetet har en statistisk korrigeringsmetod utvecklats för att rätta
till denna systematiska underskattning. Genom att jämföra S-HYPE:s simulerade flöden
med faktiska mätningar vid ett stort antal mätstationer runt om i Sverige, för perioden
2010–2025, kartlades hur stor underskattningen är och vilka faktorer som styr den. Resultaten visade att modellen i genomsnitt underskattar flödestopparna med 7,3 procent,
vilket är en relativt liten men konsekvent avvikelse som slår igenom vid beräkning av
extremflöden. För att korrigera detta testades två olika statistiska metoder: multipel linjär regression (MLR) och Random Forest (RF), som är en typ av maskininlärning. Båda metoderna tränades på data från mätstationerna och fick lära sig hur egenskaper hos avrinningsområdet, såsom area, andel jordbruksmark och grad av reglering, påverkar hur stor underskattningen är.
De fem viktigaste faktorerna för att förklara och korrigera avvikelsen visade sig vara:
det modellerade flödet, avrinningsområdets area, den totala uppströms arean, regleringsfraktionen samt andelen jordbruksmark. Med dessa faktorer som indata kunde båda metoderna minska felet till under 1,4 procent, en dramatisk förbättring jämfört med det okrigerade utgångsvärdet.
RF-modellen presterade något bättre och gav jämnare resultat med färre extrema avvikelser. Men den linjära regressionsmodellen har en stor praktisk fördel: den ger en
tydlig, matematisk formel som enkelt kan användas av ingenjörer i deras dagliga arbete,
utan tillgång till avancerade datorverktyg.
Resultaten visar att det med relativt enkla medel går att förbättra uppskattningarna
av extrema flöden avsevärt, även i vattendrag utan egna mätstationer. Det är ett viktigt
steg mot säkrare och mer klimatanpassad infrastruktur i Sverige. (Less)
Please use this url to cite or link to this publication:
https://lup.lub.lu.se/student-papers/record/9247666
- author
- Johnsson, Jacob LU
- supervisor
- organization
- course
- VVRM05 20261
- year
- 2026
- type
- H2 - Master's Degree (Two Years)
- subject
- keywords
- S-HYPE, Peak flow estimation, Flood frequency analysis, Random Forest, Multiple Linear Regression, Bias correction
- publication/series
- TVVR 5000
- report number
- TVVR26/5019
- ISSN
- 1101-9824
- language
- English
- additional info
- Examiner: Linus Zhang
- id
- 9247666
- date added to LUP
- 2026-09-02 08:39:13
- date last changed
- 2026-09-02 08:39:13
@misc{9247666,
abstract = {{Extreme meteorological events are projected to increase in both frequency and intensity as climate change progresses, placing greater demands on accurate hydrological modelling for flood risk assessment and infrastructure design. In Sweden, the process-based S-HYPE model is widely used to simulate streamflow across approximately 26340 catchments, but like many regional rainfall-runoff models it systematically underestimates peak flows during extreme events, which poses a structural risk when designing culverts, retention basins, and urban drainage systems in ungauged catchments.
This study develops and evaluates a regression-based post-processing framework to quantify and correct this bias for small-to-medium Swedish watercourses with 100-year return period flows below 1000 $m^3/s$. Daily observed and S-HYPE-simulated streamflow data from 2010 to 2025 were compiled from an nationwide network of active gauging stations. Annual maximum daily flows were extracted and subjected to flood frequency analysis. The Generalized Extreme Value distribution fitted via L-moments (GEV-Lmom) was identified as the best framework, outperforming the Gumbel, Log-Normal, and Log-Pearson type III distributions across Anderson–Darling and Probability Plot Correlation Coefficient goodness-of-fit tests.
Baseline comparison confirmed that unadjusted S-HYPE outputs underestimate peak flows by a mean bias of $-7.3\%$, despite maintaining strong spatial--temporal correlation ($R^2 = 0.964$). To correct this systematic underestimation while preserving the model's ranking performance, three correction configurations, Full, Reduced, and Flow--only, were evaluated using Multiple Linear Regression (MLR) and Random Forest (RF) algorithms across return periods from 2 to 100 years. Feature selection via permutation testing isolated five statistically significant physiographic predictors for the Reduced configuration: modelled flow, catchment area, upstream area, regulation fraction, and agricultural land--use fraction.
Both MLR and RF successfully reduced the baseline bias, reducing absolute peak flow errors to below $+1.4\%$ across all configurations. The RF model consistently achieved higher predictive accuracy ($R^2 = 0.990$) with tighter error distributions across all return periods, reflecting its capacity to capture non-linear catchment interactions. The log-linear MLR formulation, while slightly less accurate, produced an explicit and transferable scaling equation well suited for operational application at ungauged sites. The framework demonstrates that integrating statistical post-processing with physical catchment descriptors provides a scalable tool for improving extreme peak flow estimation across ungauged Swedish basins and while some uncertainties remain a future study could include a Peaks Over Threshold and a hold-out validation to improve on the results.}},
author = {{Johnsson, Jacob}},
issn = {{1101-9824}},
language = {{eng}},
note = {{Student Paper}},
series = {{TVVR 5000}},
title = {{Adjustment of peak flows in water courses without gauging from S-HYPE data. A comparison between observed and modelled flow in Sweden}},
year = {{2026}},
}