Složka Identifications: Raw soubory vytvářené při zpracování MS/MS dat v NIST26
- Foto: Mass Spec Interpretation Services/James Little: Identifications Folder: Raw Files Created in MS/MS NIST26
- Video: Mass Spec Interpretation Services/James Little: Identifications Folder: Raw Files Created in MS/MS NIST26
Když NIST26 zpracovává LC-MS/MS data v okně Chromatogram Window, výsledný seznam identifikovaných sloučenin představuje pouze jednu část celého procesu. Za výsledky zobrazenými v softwaru stojí celá skupina mezisouborů obsahujících chromatografické záznamy, extrahovaná MS/MS spektra, výsledky vyhledávání, informace o izotopech, modely píků a vazby mezi chromatografickými prvky a spektry. V nedávno zveřejněném návodu se James Little z Mass Spec Interpretation Services zaměřil na to, co tyto soubory představují, jak souvisejí s novým zpracováním dat v NIST26 založeným na XIC a jaké další informace mohou analytikům nabídnout.
Výchozím bodem je složka Identifications, která se vytvoří při zpracování LC-MS/MS souboru v okně Chromatogram Window v NIST26. Namísto jediného výsledkového souboru software generuje skupinu mezivýstupů souvisejících s dekonvolucí MS/MS a vyhledáváním v knihovně. Tato data se následně využívají k vytvoření informací, které jsou uživateli prezentovány v okně Chromatogram Window. Materiál se rovněž zabývá otázkou, zda by některé z těchto výstupů mohly mít využití i mimo samotný identifikační workflow, například jako vstup pro vícerozměrnou analýzu nebo porovnávání vzorků.
Přístup ke zpracování LC-MS/MS založený na XIC
Postup popsaný v prezentaci je založen na extrahovaných iontových chromatogramech (XIC). Namísto toho, aby bylo každé MS/MS spektrum považováno za samostatný identifikační výsledek, NIST26 propojuje spektrální informace s chromatografickým chováním.
Nejprve jsou extrahovány chromatografické informace z dat MS1, spektra jsou seskupeny podle retenčního času, přiřazují se MS/MS spektra k píkům v XIC a následně jsou tyto informace využity k ověření nebo zpřesnění identifikací. Schémata na stranách 8–15 materiálu znázorňují celý proces jako vícekrokový postup, nikoli jako jednoduchou posloupnost „MS/MS spektrum → shoda s knihovnou → identifikace“.
Tento rozdíl je důležitý, protože chromatografická dimenze poskytuje další podpůrné informace. Kandidátní identifikace může být hodnocena nejen podle shody MS/MS spektra s knihovnou, ale také podle toho, zda se příslušný prekurzor chová v chromatogramu konzistentně, zda odpovídá jeho izotopový profil a zda je MS/MS spektrum správně přiřazeno k příslušnému chromatografickému píku.
Paralelní zpracování vytváří více mezisouborů
Jedním z důvodů, proč složka Identifications obsahuje tolik souborů, je skutečnost, že NIST26 rozděluje surový mzML dataset do několika částí pro paralelní zpracování. Každá z těchto částí vytváří vlastní mezivýstupy.
Prezentace popisuje několik důležitých typů souborů. Soubory .tic obsahují informace o celkovém iontovém chromatogramu založeném na intenzitě MS1 v závislosti na retenčním čase a využívají se například pro detekci píků, zarovnání retenčních časů a vymezení oken XIC. Soubory .mgf obsahují MS/MS spektra po detekci píků ve formátu Mascot Generic Format a slouží jako vstup pro vyhledávání v knihovně. Soubory .tsv obsahují tabulkové výsledky vyhledávání, včetně kandidátních identifikací, příslušných skóre a informací o prekurzorech.
Tyto mezisoubory tak odpovídají jednotlivým úrovním zpracování dat: chromatografickým informacím z MS1, spektrálním informacím z MS2, výsledkům vyhledávání v knihovně a následnému vzájemnému ověření těchto vrstev.
Od tisíců spekter k finálním identifikacím
Materiál uvádí názorný příklad toho, jak výrazně se může dataset během zpracování zredukovat.
V popsaném příkladu obsahoval původní mzML soubor 3 380 spekter, která byla rozdělena do čtyř částí pro zpracování. Z těchto dat bylo pro vyhledávání v knihovně extrahováno 216 tandemových MS/MS spekter. Nakonec se do výsledků zobrazovaných nebo zahrnutých do reportu dostalo 158 MS2 vyhledávání. Podle poznámky Jamese Littla trvalo zpracování těchto 158 spekter přibližně 11 sekund.
Tento příklad ukazuje, že výsledná tabulka představuje pouze vybranou část spektrálních informací původně obsažených v souboru. Mezivýstupy přitom uchovávají informace o tom, jakým způsobem byl tento výběr vytvořen.
Co obsahují „check“ soubory?
Jedním z hlavních sdělení prezentace je, že soubory neformálně označované jako „check“ soubory nejsou pouze dočasným balastem. Z koncepčního hlediska tvoří mezivrstvu důkazů mezi původním vyhledáváním MS/MS spekter v knihovně a finální identifikací.
Podle workflow uvedeného v materiálu mohou tyto soubory obsahovat XIC záznamy pro jednotlivé prekurzorové ionty, izotopové záznamy, modely píků, vazby na retenční časy, vztahy mezi ionty vznikajícími ve zdroji a informace o seskupování, které určují, která MS/MS spektra náležejí ke kterým chromatografickým píkům.
Workflow tak může využívat chromatografické informace k potvrzení nebo zamítnutí kandidátních identifikací, zpřesnění přiřazení prekurzorů a rozlišení relevantních MS/MS spekter od signálů pozadí. Prezentace tento přístup porovnává s tradičnějším workflow, ve kterém může shoda MS/MS spektra s knihovnou v podstatě představovat konec identifikačního procesu. V přístupu NIST26 založeném na XIC je posloupnost spíše následující: MS/MS vyhledávání → kandidátní identifikace → ověření pomocí XIC → zpřesnění a nové seřazení výsledků.
Chromatografické informace přidávají další úroveň jistoty
Praktická hodnota tohoto dodatečného zpracování spočívá v kombinaci informací, které by jinak byly hodnoceny odděleně.
MS/MS spektrum může vykazovat přesvědčivou shodu s knihovnou, NIST26 však může navíc ověřit, zda prekurzor vytváří souvislý chromatografický pík, zda se očekávané izotopové signály objevují společně a zda jsou vztahy mezi retenčními časy konzistentní. Interní datové soubory mohou rovněž pomoci sledovat fragmenty vznikající ve zdroji, které by jinak mohly být nesprávně interpretovány jako samostatné sloučeniny.
Závěrečný snímek materiálu shrnuje tyto soubory jako hlavní vrstvu podpůrných informací nového přístupu NIST, která obsahuje chromatografické informace, izotopové chování, konzistenci retenčních časů a vztahy mezi ionty vznikajícími ve zdroji. Podle prezentace tato data pomáhají opravovat nesprávná přiřazení prekurzorů, rozpoznávat fragmenty vznikající ve zdroji a zvyšovat celkovou spolehlivost MS/MS identifikace.
Lze výstupy využít i mimo identifikaci sloučenin?
Další zajímavou otázkou nastolenou v prezentaci je, zda by bylo možné informace generované během zpracování v NIST26 znovu využít pro další analytické úlohy.
Výstupní soubor .tsv obvykle obsahuje jeden řádek pro každý detekovaný chromatografický prvek a může zahrnovat retenční čas, m/z prekurzoru, plochu píku nebo intenzitu, skóre shody s knihovnou, název sloučeniny, sumární vzorec a případně také informace o aduktu.
Materiál naznačuje, že tento typ tabulkového výstupu by mohl představovat vhodný výchozí bod pro vytvoření matice příznaků (feature matrix) pro následné analýzy, jako jsou:
- analýza hlavních komponent (PCA),
- hierarchické shlukování,
- porovnávání „dobrých“ a „špatných“ vzorků,
- detekce odlehlých hodnot,
- a hledání markerů.
Je však důležité zdůraznit, že tato část materiálu je prezentována jako průzkum možného využití, nikoli jako formálně demonstrovaný workflow NIST26. James Little uvádí, že k analýze vztahů mezi vytvořenými soubory a posouzení jejich potenciálního využití byl použit ChatGPT.
Proč NIST26 vytváří tolik souborů?
Velké množství mezisouborů je ve výsledku důsledkem dvou hlavních vlastností strategie zpracování: paralelizace a víceúrovňové analýzy.
Surová data jsou rozdělena do několika částí, aby se urychlilo jejich zpracování, zatímco samostatné datové výstupy vznikají pro chromatografické zpracování MS1, spektrální vyhledávání MS2 a následné vzájemné ověření výsledků. Workflow tak zachovává podpůrné informace z několika kroků analýzy, místo aby je okamžitě sloučil do jediné finální tabulky výsledků.
Výsledkem je složka, která může na první pohled působit zbytečně složitě, ve skutečnosti však odráží samotnou architekturu analýzy. Jak materiál zdůrazňuje, mezisoubory nejsou pouze zbytky po zpracování dat; dokumentují způsob, jakým byly chromatografické a hmotnostně spektrometrické informace zkombinovány při tvorbě finální identifikace.
Více než jen vyhledávání v knihovně
Hlavním sdělením prezentace je, že nový LC-MS/MS workflow v NIST26 jde za hranice klasického porovnávání spekter s knihovnou. Začleněním chování XIC, izotopových informací, vztahů mezi píky, konzistence retenčních časů a MS/MS dat může software při hodnocení identifikace využívat více nezávislých zdrojů informací.
Pro analytiky znamená porozumění obsahu složky Identifications lepší přehled o tom, jak jsou finální výsledky vytvářeny. Zároveň se otevírá možnost kontrolovat mezikroky zpracování při řešení problematických nebo sporných identifikací a případně znovu využít některé tabulkové výstupy na úrovni jednotlivých chromatografických prvků pro širší porovnávání vzorků.
Rostoucí význam těchto mezidat zároveň odráží širší posun v LC-MS/MS analýze: spolehlivá identifikace je stále méně založena na jediném skóre nebo jediném spektru a stále více na kombinované interpretaci chromatografických, spektrálních a kontextových informací.




