Evaluating Protein Selection in Critical Care Proteomics: A Unified Validation Framework for ARDS in Sepsis
(2026) In Master's Theses in Mathematical Sciences FMSM01 20261Mathematical Statistics
- Abstract
- Identifying proteomic patterns associated with acute respiratory distress syndrome (ARDS) in sepsis patients is a central challenge in critical care research. Standard univariate approaches may miss non-linear associations and higher-order interactions that reflect the true complexity of the syndrome, yet systematic evaluation of alternative methods is lacking. This thesis introduces a unified evaluation framework for protein selection methods, combining simulation
validation on synthetic data with planted signals of known type, classifier validation on held-out patient data, and pathway enrichment analysis. The framework is applied to a cohort of 512 adult sepsis patients from the SWECRIT multicentre Swedish ICU registry, of whom 73... (More) - Identifying proteomic patterns associated with acute respiratory distress syndrome (ARDS) in sepsis patients is a central challenge in critical care research. Standard univariate approaches may miss non-linear associations and higher-order interactions that reflect the true complexity of the syndrome, yet systematic evaluation of alternative methods is lacking. This thesis introduces a unified evaluation framework for protein selection methods, combining simulation
validation on synthetic data with planted signals of known type, classifier validation on held-out patient data, and pathway enrichment analysis. The framework is applied to a cohort of 512 adult sepsis patients from the SWECRIT multicentre Swedish ICU registry, of whom 73 developed moderate or severe ARDS, using proteomic measurements from the SomaScan 11K Assay.
Three selection methods are evaluated: Welch’s t-test, mutual information with permutationbased significance, and random forest feature importance via SHAP values. The t-test is restricted by construction to mean-shift regulation, but identifies a small set of stable proteins associated with mitochondrial electron transport. Mutual information can in principle detect arbitrary univariate signals, but is power-limited at the cohort sample size and recovers few proteins at moderate effect sizes; nevertheless, its top-ranked proteins yield the strongest biological enrichment signal, with ketone body metabolism as the most robustly supported pathway. RF+SHAP also targets arbitrary univariate signals and produces the strongest classifier performance, with mean AUC up to 0.667 and consistent improvement over random selection, but lacks a principled mechanism for FDR control. No method recovers pure pairwise interaction signals, confirming that all approaches operate at the univariate level. The divergence between classifier and enrichment performance across methods demonstrates that complementary validation strategies are necessary to fully characterise a selection method. (Less) - Abstract (Swedish)
- Att identifiera proteinmönster associerade med lungsyndromet acute respiratory distress syndrome (ARDS) hos patienter med underliggande sepsis är en central utmaning inom intensivvårdsforskning. Konventionella univariata metoder riskerar att missa icke-linjära associationer och högre ordningens interaktioner som speglar syndromets sanna komplexitet, och systematisk utvärdering av alternativa metoder saknas. Detta examensarbete introducerar ett enhetligt utvärderingsramverk för proteinselektionsmetoder, som kombinerar simuleringsvalidering på syntetiska data med planterade signaler av känd typ, klassificeringsvalidering på hållen testdata, samt vägberikning som biologisk validering. Ramverket tillämpas på en kohort bestående av 512 vuxna... (More)
- Att identifiera proteinmönster associerade med lungsyndromet acute respiratory distress syndrome (ARDS) hos patienter med underliggande sepsis är en central utmaning inom intensivvårdsforskning. Konventionella univariata metoder riskerar att missa icke-linjära associationer och högre ordningens interaktioner som speglar syndromets sanna komplexitet, och systematisk utvärdering av alternativa metoder saknas. Detta examensarbete introducerar ett enhetligt utvärderingsramverk för proteinselektionsmetoder, som kombinerar simuleringsvalidering på syntetiska data med planterade signaler av känd typ, klassificeringsvalidering på hållen testdata, samt vägberikning som biologisk validering. Ramverket tillämpas på en kohort bestående av 512 vuxna sepsispatienter från SWECRIT-registret, ett flercenterstudie vid svenska intensivvårdsavdelningar, varav 73 utvecklade måttlig eller svår ARDS. Proteinuttryck mättes med SomaScan 11K-plattformen.
Tre selektionsmetoder utvärderas: Welchs t-test, ömsesidig information med permutationsbaserat signifikanstest, samt random forest-baserad variabelvikt via SHAP-värden. t-test är per konstruktion begränsat till medelvärdesförskjutningar, men identifierar en liten uppsättning stabila proteiner kopplade till mitokondriell elektrontransport. Ömsesidig information kan i princip detektera godtyckliga univariata signaler, men är styrkebegränsad vid den aktuella kohortstorleken och återfinner få proteiner vid måttliga effektstorlekar; trots detta ger dess topprankade proteiner den starkaste biologiska berikningssignalen, med ketonkroppsmetabolism som det mest robusta resultatet. RF+SHAP riktar sig också mot godtyckliga univariata signaler och uppvisar den starkaste klassificeringsförmågan, med ett medel-AUC upp till 0.667 och konsekvent förbättring jämfört med slumpmässig selektion, men saknar en principiell mekanism för FDR-kontroll. Ingen metod återfinner rena parvisa interaktionssignaler, vilket bekräftar att samtliga utvärderade metoder opererar på univariat nivå. Divergensen mellan klassificerings- och berikningsresultat över metoder visar att komplementära valideringsstrategier är nödvändiga för att fullständigt karakterisera en selektionsmetod. (Less) - Popular Abstract (Swedish)
- Matematiken bakom morgondagens medicin
Tänk om vi en dag kunde läsa av vad som händer i kroppen på molekylnivå och utifrån det förstå hur sjukdomar som ARDS uppstår och kan behandlas. Det är drömscenariot för forskningen om livshotande tillstånd som ännu saknar riktade behandlingar. Men vägen dit går genom matematiken.
Vi närmar oss tre år sedan covid-19-pandemin, och även om minnena av karantän och distansundervisning börjar blekna får vi inte glömma det som drabbade så många: lungtillståndet ARDS, akut andningssvikt. ARDS var den vanligaste dödsorsaken hos covid-patienter, och tillståndet drabbar än idag över tre miljoner människor globalt varje år, med en dödlighet på 30--40 procent. Trots decennier av forskning finns ingen riktad... (More) - Matematiken bakom morgondagens medicin
Tänk om vi en dag kunde läsa av vad som händer i kroppen på molekylnivå och utifrån det förstå hur sjukdomar som ARDS uppstår och kan behandlas. Det är drömscenariot för forskningen om livshotande tillstånd som ännu saknar riktade behandlingar. Men vägen dit går genom matematiken.
Vi närmar oss tre år sedan covid-19-pandemin, och även om minnena av karantän och distansundervisning börjar blekna får vi inte glömma det som drabbade så många: lungtillståndet ARDS, akut andningssvikt. ARDS var den vanligaste dödsorsaken hos covid-patienter, och tillståndet drabbar än idag över tre miljoner människor globalt varje år, med en dödlighet på 30--40 procent. Trots decennier av forskning finns ingen riktad behandling. Vården kan ge stöd, men inte bota.
Idag kan vi mäta över 10\,000 proteiner från ett enda blodprov, något som var helt otänkbart för 20 år sedan. Till skillnad från DNA, som är relativt oförändrat genom livet, är proteinerna en ögonblicksbild av vad kroppen håller på med just nu. Detta är vad fältet proteomik handlar om, och förhoppningen är att det ska kunna avslöja vilka molekylära mönster som ligger bakom sjukdomar som ARDS.
Men att hitta de avgörande proteinerna bland tiotusen är som att leta efter en nål i en höstack. Vi har analyserat proteinprofilen hos 512 sepsispatienter från intensivvårdsavdelningar i Skåne, varav 73 utvecklade ARDS, och frågat oss vilka proteiner som faktiskt skiljer grupperna åt.
Varför löser då inte AI bara problemet? Med 512 patienter och 10\,000 variabler är risken stor att en modell hittar mönster som inte finns på riktigt. Hela vårt arbete handlar om att navigera det problemet på ett rigoröst sätt.
Vi har jämfört flera analysmetoder, både klassiska statistiska metoder och modernare maskininlärning, och visat att ingen enskild metod löser hela problemet. Varje metod har sina styrkor och blinda fläckar, men tillsammans bidrar de med olika ledtrådar. En av de stora frågorna är om man kan hitta kombinationer av proteiner som tillsammans avslöjar sjukdomen, även när inget enskilt protein gör det. Det är matematiskt svårare men biologiskt mer realistiskt, eftersom proteiner sällan arbetar ensamma utan i komplexa nätverk.
En central del av vårt arbete är ett ramverk för att rättvist utvärdera olika metoder. Det är en utmaning i sig: när man söker efter okända samband finns det inget facit att jämföra mot, så hur vet man att en metod faktiskt hittar rätt? Vi adresserar detta genom att kombinera simulerade data med kända svar, klassificering av verkliga patienter, och biologisk tolkning av resultaten. Ramverket är generellt och kan användas för att utvärdera vilken proteinurvalsmetod som helst.
Frågan kvarstår: finns det en förklaring gömd i den komplexa proteinvärlden? Våra resultat tyder på att det gör det. Vägen dit kräver större patientkohorter, smartare metoder och tålamod, men varje steg framåt tar oss närmare en bättre förståelse för vad som driver tillståndet, och därmed bättre behandlingsmöjligheter. (Less)
Please use this url to cite or link to this publication:
https://lup.lub.lu.se/student-papers/record/9242210
- author
- Mattsson, Love LU and Fredriksson, Lisa LU
- supervisor
- organization
- course
- FMSM01 20261
- year
- 2026
- type
- H3 - Professional qualifications (4 Years - )
- subject
- keywords
- ARDS, Sepsis, Differential Expression Analysis, Mutual Information, Random Forest, SHAP-values, feature selection
- publication/series
- Master's Theses in Mathematical Sciences
- report number
- LUTFMS-3558-2026
- ISSN
- 1404-6342
- other publication id
- 2026:E61
- language
- English
- id
- 9242210
- date added to LUP
- 2026-06-22 13:04:45
- date last changed
- 2026-06-22 13:04:45
@misc{9242210,
abstract = {{Identifying proteomic patterns associated with acute respiratory distress syndrome (ARDS) in sepsis patients is a central challenge in critical care research. Standard univariate approaches may miss non-linear associations and higher-order interactions that reflect the true complexity of the syndrome, yet systematic evaluation of alternative methods is lacking. This thesis introduces a unified evaluation framework for protein selection methods, combining simulation
validation on synthetic data with planted signals of known type, classifier validation on held-out patient data, and pathway enrichment analysis. The framework is applied to a cohort of 512 adult sepsis patients from the SWECRIT multicentre Swedish ICU registry, of whom 73 developed moderate or severe ARDS, using proteomic measurements from the SomaScan 11K Assay.
Three selection methods are evaluated: Welch’s t-test, mutual information with permutationbased significance, and random forest feature importance via SHAP values. The t-test is restricted by construction to mean-shift regulation, but identifies a small set of stable proteins associated with mitochondrial electron transport. Mutual information can in principle detect arbitrary univariate signals, but is power-limited at the cohort sample size and recovers few proteins at moderate effect sizes; nevertheless, its top-ranked proteins yield the strongest biological enrichment signal, with ketone body metabolism as the most robustly supported pathway. RF+SHAP also targets arbitrary univariate signals and produces the strongest classifier performance, with mean AUC up to 0.667 and consistent improvement over random selection, but lacks a principled mechanism for FDR control. No method recovers pure pairwise interaction signals, confirming that all approaches operate at the univariate level. The divergence between classifier and enrichment performance across methods demonstrates that complementary validation strategies are necessary to fully characterise a selection method.}},
author = {{Mattsson, Love and Fredriksson, Lisa}},
issn = {{1404-6342}},
language = {{eng}},
note = {{Student Paper}},
series = {{Master's Theses in Mathematical Sciences}},
title = {{Evaluating Protein Selection in Critical Care Proteomics: A Unified Validation Framework for ARDS in Sepsis}},
year = {{2026}},
}