1 Posudek doktorské disertační práce Mgr. Zdenky Otýpkové, Vliv velikosti ploch pro sběr dat na analýzy diverzity vegetace Vlastní práce představuje český text na 22 stranách, obsahující zejména literární úvod do problematiky (kapitola 2), základní popis společné metodiky sběru dat (většina výsledků totiž vychází z jednoho rozsáhlého souboru dat) a také hlavní výsledky práce (kapitola 7). Ty ovšem jsou nebo budou představeny odborné veřejnosti v podobě standardních článků, dva v anglickém jazyce již vyšly v Journal of Vegetation Science a třetí, také anglicky psaný, pravděpodobně vyjde v brzké budoucnosti. Tyto tři články, spolu se dvěma dalšími rukopisy v češtině, jsou pak přílohou celé práce a na ně také zaměřím pozornost. Předtím bych ale rád poznamenal, že na shrnutí výsledků v kapitole 7 si cením, že autorka je formulovala nezávisle na obsahu abstraktů vlastních článků. Přesto mi ale chybí syntéza porovnávající dílčí výsledky. U práce, ve které všechny její části tak úzce souvisí, je to myslím škoda. Na kapitole 7 je také vidět spěch při jejím sepisování, některé formulace jsou nešťastně "těsnopisné" (např. hned první věta "Vegetace v Evropě byla zapisována na různých velikostech, které nebyly dlouhou dobu metodicky stanoveny"). První článek (vyšel v JVS) představuje kompilaci znalostí o užívaných velikostech záznamových ploch u již existujících fytocenologických snímků, jak v celoevropském, tak v česko-moravském měřítku. Obsah článku mi, musím se přiznat, nepřišel nijak zvlášť atraktivní, je to spíše pohled zpět - na to, co bylo ­ a jediné praktické doporučení pro uživatele dat ze snímkových databází je, že se mají vyhnout záznamům z příliš malých ploch. Zajímavější mi přišla závěrečná část diskuse, přehledně ukazující, že jsou často odlišné vegetační typy vázány na odlišnou prostorovou škálu a v terénu se spolu prostorově prolínají. Autoři v článku také navrhují standardizovat velikosti záznamových ploch pro různé typy vegetace, a to víceméně převzetím nejoblíbenějších hodnot v novější historii fytocenologie. S ohledem na ostatní, pozdější práce, mi to přijde trochu škoda, vždyť výsledky například z rukopisu Otýpková & Klimeš by ke vhodným velikostem ploch pro fytocenologickou syntézu měly co říci, byť jen pro některé typy vegetace. Ve druhém článku, dosud ve stádiu rukopisu, představují autoři výsledky zkoumání změn druhové vyrovnanosti a beta-diversity při změně velikosti záznamových ploch. Na konci úvodu si autoři stěžují na nedostatek studií na toto téma a čtenář tak získá pocit, že předkládaný článek tento neutěšený stav napraví. Nicméně z vlastních výsledků a diskuse se zdá, že se to autorům ne tak úplně podařilo. Autoři přispěli další studií, ve které se potvrdil již známý pattern poklesu beta-diversity s rostoucí velikostí ploch, naproti tomu v případě změn druhové vyrovnanosti získali autoři výsledky spíše protiřečící dosavadním a nejsou zjevně schopni tento nesoulad v diskusi konsolidovat. Objevují se zde vedle sebe názory sahající od "obecný pattern neexistuje, protože závisí na vlastnostech vegetace", přes "bude třeba ještě dalších studií, abychom pattern pochopili", až k postoji "možná vyrovnanost klesá s plochou v rozsahu menších velikostí, než jsme užívali my, a pak opět vzrůstá, jak to popisují naše data". V tomto článku mám také určité pochybnosti o správnosti statistického hodnocení: ˇ Vnořené uspořádání ploch v rámci jedné série jistě není špatný design, protože redukuje stochastický vliv prostorové variability vegetace, ale vzájemná závislost (spřízněnost) ploch téže série musí být v analýzách zohledněna, nemají-li být odhady signifikance přílišně optimistické. V regresních analýzách bych doporučoval kromě pevného efektu velikosti plochy přidat ještě náhodný faktor 2 identity série, případně vzájemnou korelaci uvnitř sérií modelovat, jak to umožňují některé implementace metody lineárních modelů se smíšenými efekty. ˇ Ještě problematičtější se mi zdá analýza se Soerensenovými nepodobnostmi. Kombinace parametrické analýzy variance s neparametrickými odhady intervalů spolehlivosti upozorňuje na to, že zde něco nehraje. Mohla by autorka vysvětlit, co v příslušném ANOVA modelu sloužilo jako nezávislá pozorování? Nepodobnosti mezi jednotlivými páry ploch by to být neměly, protože ty nejsou vzájemně nezávislé. O tom, co autoři článku vlastně dělali a proč to tak dělali, mohu na základě dostupného textu jen spekulovat, myslím ale, že i ANOVA (nebo spíše lineární regrese, jako u ostatních analýz) zde měla vycházet z bootstrap přístupu. Třetí článek se zabývá vlivem velikosti ploch na výsledky ordinačních metod. Text má všechny atributy moderní studie ­ s jasně formulovanými otázkami, správně sebranými daty a s výsledky, které mohu mít významný dopad na rozhodování čtenářů v rámci jejich vlastních studií. Mám ale neodbytný pocit, že by to vše mohlo být jinak. Zdůrazňuji hned na začátku, že je to jenom moje skeptická hypotéza, kterou ­ vzhledem k nedostupnosti primárních dat ­ nemohu ani vyvrátit, ani podpořit. Jednoduše řečeno ­ hlavní závěry článku, odkazující na podobnosti či odlišnosti vlivu velikosti ploch mezi tzv. homogenními a heterogenními daty, mohou být pouze důsledkem poněkud nešťastného rozhodnutí, kdy byly pro homogenní data použity lineární ordinační metody, zatímco pro heterogenní data metody unimodální. Jak si je jistě autorka vědoma, tyto dva postupy se mimo jiné liší tím, že unimodální analýzy posuzují jen rozdíly v relativním zastoupení jednotlivých druhů, zatímco lineární zaznamenají i rozdíly v absolutní abundanci. Proto nepřekvapí, že jsou ordinace založené na homogenních ordinálních datech tak odlišné od odpovídajících analýz binarizovaných dat, zatímco u heterogenních dat se DCA analýzy tak moc neliší a párová odlišnost (mezi výsledky z binárních a ordinálních dat) se spíše zmenšuje s rostoucí velikostí ploch, nejspíše proto, že s ní roste i ekvitabilita (viz předchozí článek). Pokud by ­ teoreticky ­ byly všechny druhy v plochách zastoupeny se stejnou abundancí, výsledky z DCA (ale ne z PCA!) by byly shodné pro binární i ordinální škálu. Navíc jsou lineární metody docela nevhodné pro binární (presenčně-absenční data), bez ohledu na to, jak velká či malá je jejich heterogenita. Moc by mne tedy zajímalo, zda autorka zkoušela provádět i v případě více homogenních dat analýzu buď s unimodální metodou (DCA, resp. CCA) nebo alespoň s více porovnatelnou lineární analýzou, ve které by zvolila kromě centrování přes druhy také standardizaci přes vzorky s užitím sample norm. Jedině tak lze nabýt jistotu, že rozdíl mezi homogenními a heterogenními datovými soubory lze opravdu přičíst na vrub právě jejich (ne)homogenitě. Podobně jako u předchozího článku i zde poznamenávám, že test průkaznosti pravděpodobně nebyl proveden správně: spřízněnost vzorků z jedné serie (do sebe hierarchicky umístěných) ­ byť se vždy srovnávaly jen dvojice velikostí ­ by měla být zohledněna buď permutací vzorků různé velikosti uvnitř každé série nebo použitím identifikátorů série jako kovariát. Čtvrtý rukopis je v češtině a domnívám se (více než u rukopisu následujícího), že je to škoda. Vliv změny velikosti ploch na klasifikaci a výběr diagnostických druhů je informace podstatná a, jak jsem již naznačil v souvislosti s prvním článkem, může vést k lepšímu porozumnění tomu, že ani vegetační typologie není jedna, nýbrž se proměňuje s prostorovou škálou (podobně jako diversita). Tento článek má podle mého názoru velký potenciál, i když potřebuje ještě dost editační práce: u Obr. 2 a 3 3 chybí vysvětlení, že dolní panel odpovídá binárním datům; smysl čísel v Tab. 1 není zjevný, viz má otázka níže. V diskusi bych doporučoval používat množné číslo při odkazu na velikost plochy ­ formulace "změna diagnostických druhů s velikostí plochy" vyvolává u nefytocenologa dojem, že se diagnostické druhy dají stanovit pro jednotlivé plochy. K tomuto článku bych se rád zeptal, cože to je v Tabulce 1 za čísla. V popisu tabulky si přečtu, že je to stabilita shluků, ale nedozvím se (ani v Metodice), co si pod tím číslem představit, tj. jak bych ho spočítal pro svá data. Navíc je zde i v Metodice trochu setřen rozdíl mezi touto stabilitou a signifikancí odvozenou z randomizačního testu. Autorka píše "průkaznost jsme testovali na hladině 10%" a v popisce Tab. 1 píše "statisticky průkazné hodnoty (p>0,1) jsou vyznačeny tučně." Překládám si to správně, že hodnoty stability, které byly větší než 0.1 odpovídaly shlukům, které byly stabilní na hladině signifikance p menší než 0.1, nebo je to všechno jinak? Pátý článek se zabývá změnou hodnot faktorů prostředí, odhadovaných na základě Ellenbergových indikačních hodnot pro jednotlivé druhy, s velikostí ploch. Musím bohužel konstatovat, že v této studii autorka žádné zajímavé výsledky nezískala a že je to podle mne dáno nedostatky metodického přístupu. V situaci, kdy autorka neurčovala hodnoty faktorů prostředím také jiným, nezávislým způsobem, by ani v případě, že by jí vyšla systematická změna odhadu s měnící se plochou, nebyla schopna o příčinách nic rozumného říct. Pro tento typ studie považuji kalibraci za nezbytnou a podobně nutné mi přijde znát hodnoty faktorů (ať již nezávisle měřené nebo určené z Ellenbergových indexů) na menší prostorové škále nejen pro část větší plochy, ale pro plochu celou. Tedy například (v zjednodušeném provedení) bych pro porovnání výpovědi z ploch 1, 4 a 16 m2 u travinné vegetace měl znát vegetační složení na plochách o velikosti 1 m2 pro celý čtverec 4x4 metry, ne jen pro jednu z jeho 16 možných ploch. Jinak nebudu schopen při hodnocení od sebe oddělit odchylku (bias) odhadu od vlivu jeho systematické změny s rostoucí velikostí plochy. Pokud jde o základní metodiku sběru dat, ze kterých těží články 2 až 5, ještě bych se rád autorky zeptal na jednu věc: při sběru dat z jedné velikostní série (tj. z pěti překrývajících se ploch různé velikosti) jste začínala plochou nejmenší a postupně její hranu zvětšovala nebo jste postupovala opačně? Myslíte, že byste mohla dospět k odlišným datům (a případně i závěrům), pokud byste postupovala při záznamu "opačným směrem"? Mám-li shrnout svůj dojem z posuzované disertační práce, nemohu popřít, že se pět předkládaných odborných sdělení liší svou kvalitou. Nicméně to, že některé studie jsou podařené více a některé méně, některé jsou více inovativní a jiné zase přinášejí méně atraktivní, přesto ale užitečnou kompilaci znalostí, platí téměř u všech publikujících badatelů. Proto považuji tuto disertační práci za dostatečně prokazující autorčinu schopnost badatelské práce a samostatného řešení odborných problémů a práci proto doporučuji k obhajobě. V Českých Budějovicích, 3. prosince 2006 Doc. RNDr. Petr Šmilauer, Ph.D.