MASARYKOVA UNIVERZITA PŘÍRODOVĚDECKÁ FAKULTA RECETOX Diplomová práce BRNO 2023 HANA MLČOCHOVA M A S A R Y K O V A U N I V E R Z I T A PŘÍRODOVĚDECKÁ FAKULTA RECETOX Modelování vlivu podmínek prostředí na biologická společenstva s využitím metod strojového učení D i p l o m o v á p r á c e Hana Mlčochova Vedoucí práce: RNDr. Danka Haruštiaková, Ph.D. Brno 2023 Bibliografický záznam Autor: Bc. Hana Mlčochova Přírodovědecká fakulta, Masarykova univerzita RECETOX Název práce: Modelování vlivu podmínek prostředí na biologická společenstva s využitím metod strojového učení Studijní program: Matematická biologie a biomedicína Studijní obor: Epidemiologie a modelování Vedoucí práce: PvNDr. Danka Haruštiaková, Ph.D. Akademický rok: 2022/2023 Počet stran: viii + 101 Klíčová slova: Strojové učení; Biologická společenstva; Klasifikace; Regrese; Náhodné lesy; Neuronové sítě; Metoda podpůrných vektorů; Bayesův klasifikátor Bibliographie Entry Author: Be. Hana Mlčochova Faculty of Science, Masaryk University RECETOX Title of Thesis: Modeling the effect of environmental conditions on biological communities using machine learning methods Degree Programme: Computational biology and biomedicine Field of Study: Epidemiology and modeling Supervisor: RNDr. Danka Haruštiaková, Ph.D. Academic Year: 2022/2023 Number of Pages: Keywords: viii + 101 Machine Learning; Biological Communities; Classification; Regression; Random Forests; Artificial Neural Networks; Support Vector Machine; Naive Bayes Classifier Abstrakt Tato diplomová práce se věnuje využití metod strojového učení při hledání vztahů mezi biologickými společenstvy a podmínkami prostředí, ve kterém tato společenstva žijí. K tomu byla využita data z monitoringu ptačích společenstev liniových porostů jihozápadního Slovenska. S pomocí vybraných metrik byly porovnány modely lineární a logistické regrese s modely náhodného lesa, neuronové sítě, metody podpůrných vektorů a Bayesova klasifikátoru použitými pro modelování počtu druhů, hodnot Shannonova indexu biodiverzity ptačích společenstev a přítomnosti indikačních druhů kosa černého (Turdus merula), sýkory koňadry (Parus major) a bažanta obecného (Phasianus colchicus) na větrolamech jihozápadního Slovenska. Interpretace těchto modelů byla provedena s využitím permutační významnosti proměnných, významnosti proměnných získané pomocí SHAP metody a grafů akumulovaných lokálních efektů. V souladu s literaturou byl nalezen pozitivní vztah diverzity ptačích společenstev se šířkou vetrolamu, významné proměnné při modelování přítomnosti indikačních druhů rovněž odpovídaly charakteristikám vybraných ptačích druhů. Tradičně používané modely byly až na jednu výjimku při modelování horší než metody strojového učení, jako nejvhodnější se ukázaly modely neuronové sítě a metody podpůrných vektorů, mírně preferovanější by však mohla být spíše neuronová síť. Práce poukázala také na důležitost vývoje nových nástrojů, které by pomohly s interpretací výsledků, a to zejména u jinak zcela neinterpretovatelných metod strojového učení. Abstract This diploma thesis focuses on the use of machine learning techniques to discover relationships between biological communities and the environmental conditions in which they live. For this, data from the monitoring of bird communities of windbreaks in southwestern Slovakia were used. Various machine learning methods including random forest, artificial neural network, support vector machine and Bayesian classifier were compared with linear and logistic regression models using selected metrics. These methods were used to model bird species richness, Shannon's biodiversity index of bird communities and the presence of three indicator species: common blackbird (Turdus merula), great tit (Parus major) and common pheasant (Phasianus colchicus) in the windbreaks of southwestern Slovakia. The interpretation of these models was performed using permutation feature importance, SHAP feature importance and accumulated local effects plots. Consistent with the literature, a positive relationship between the diversity of the bird community and the width of the windbreak was found, and the most important features in modeling the presence of indicator species were also consistent with species' characteristics. The machine learning methods were found to be, with one exception, more effective than traditionally used models, with artificial neural network and support vector machine models being the most suitable. However, artificial neural network may be slightly preferable. The thesis also pointed out the importance of developing new tools to help with interpretation of results, especially for machine learning methods that are otherwise entirely uninterpretable. IUI UN I S C I MASARYKOVA U N I V E R Z I T A P Ř Í R O D O V Ě D E C K Á FAKULTA K O T L Á Ř S K Á 2 , 6 1 1 37 BRNO I Č : 0 0 2 1 6 2 2 4 D I Č : CZ 0 0 2 1 6 2 2 4 Z A D A N Í D I P L O M O V É P R Á C E Akademický rok: 2022/2023 Ústav: RECETOX S t u d e n t k a : Bc. Hana Mlčochova P r o g r a m : Matematická biologie a biomedicína Specializace: Epidemiologie a modelování Ředitel ústavu PřF M U Vám ve smyslu Studijního a zkušebního řádu M U určuje diplomovou práci s názvem: Název práce: Modelování vlivu podmínek prostředí na biologická společenstva s využitím metod strojového učení. Název p r á c e a n g l i c k y : Modeling the effect of environmental conditions on biological communities using machine learning methods. J a z y k závěrečné práce: čeština Oficiální zadání: Data o biologických společenstvech se často vyznačují neobvyklým rozložením, nelinearitou, chybějícími hodnotami apod. Navíc jsou tato data často objemná a proto se při jejich zpracování uplatňují pokročilejší statistické metody. V posledních letech se často setkáváme s různými metodami strojového učení při řešení vztahů mezi organizmy a prostředím. Jde zejména o metody regrese a klasifikace. Často používanými nástroji jsou obecné a zobecněné lineární a aditivní modely (GLM, GAM), velice pozoruhodnými metodami jsou techniky náhodných lesů (random forest). V rámci diplomové práce se student seznámí s matematickými modely, které bude možné využít pro modelování vlivu prostředí na biologická společenstva. Základním zdrojem dat pro analýzy a matematické modelování budou data z monitoringu společenstev vegetačních porostů, který se vykonával v minulosti. Kromě dat o společenstvech jsou k dispozici i data o vlastnostech prostředí jejich výskytu. Student na základě těchto dat vypracuje model vlivu podmínek prostředí na biologická společenstva s využitím metod strojového učení. Student v průběhu řešení diplomové práce: 1. nastuduje problematiku matematických modelů vhodných k modelování vztahů podmínek prostředí a biologických společenstev, 2. vypracuje rešerši možných modelů, 3. vybere vhodnou metodu a aplikuje ji na reálná data z monitoringu biologických společenstev, 4. vyhodnotí výsledky a interpretuje zjištěné vztahy mezi podmínkami prostředí a biologickým společenstvem. S T R A N A 1 Z 2 Literatura: LANTZ, Brett. Machine learning with R : discover how to build machine learning algorithms, prepare data, and dig deep into data prediction techniques with R. Second edition. Birmingham: Packt Publishing, 2015. xiii, 426. ISBN 9781784393908. BORCARD, Daniel, Francois GILLET a Pierre L E G E N D R E . Numerical ecology with R. New York: Springer, 2 0 1 1 . xi, 306. ISBN 9781441979759. KOMPRDOVÁ, Klára. Rozhodovací stromy a lesy. první. Brno: akademické nakladatelství C E R M , 2012. 98 s. ISBN 978-80-7204-785-7. G A R D E N E R , Mark. Statistics forecologists using R and Excel: data collection, exploration, analysis and presentation. Second edition. Exeter: Pelagic Publishing, 2017. x, 404. ISBN 9781784271404. V e d o u c í práce: RNDr. Danka Haruštiaková, Ph.D. D a t u m zadání práce: 1 2 . 1 . 2 0 2 2 V B r n ě d n e : 17. 2. 2023 Zadání bylo schváleno prostřednictvím IS MU. Bc. Hana Mlčochova, 1 1 . 2 . 2022 RNDr. Danka Haruštiaková, Ph.D., 14. 2. 2022 RNDr. Tomáš Pavlík, Ph.D., 15. 2. 2022 S T R A N A 2 Z 2 Poděkování Na tomto místě bych chtěla poděkovat své vedoucí diplomové práce, RNDr. Dance Haruštiakové, Ph.D., za vstřícný individuální přístup, podnětné rady, nápady a připomínky a zejména čas, který mi během psaní této práce věnovala. Velké poděkování patří rovněž mé rodině, která mě během celého mého studia podporovala, všem vyučujícím, kteří nebrali výuku pouze jako nutnou povinnost a snažili se studentům předat i svůj zápal pro danou problematiku, i přátelům a spolužákům za sdílení studentských radostí i strastí. Prohlášení Prohlašuji, že jsem svoji diplomovou práci vypracovala samostatně pod vedením vedoucí práce s využitím informačních zdrojů, které jsou v práci citovány. Brno 14. května 2023 Hana Mlčochova Obsah Úvod 3 1 Biologická společenstva 6 1.1 Data biologických společenstev 6 1.2 Charakteristika společenstva 7 1.2.1 Indexy biodiverzity 7 1.2.2 Indikační druhy 8 2 Metody analýzy ekologických dat 9 2.1 Řešené úlohy 9 2.2 Klasické metody 10 2.2.1 Lineární regresní modely 10 2.2.2 Zobecněné lineární modely 10 2.3 Metody strojového učení 11 2.3.1 Limitace přístupu 11 2.3.2 Metody založené na vytváření stromů 12 2.3.3 Neuronové sítě 13 2.3.4 Metoda podpůrných vektorů 15 2.3.5 Naivní Bayesův klasifikátor 16 3 Metodika 17 3.1 Datový soubor 17 3.2 Tvorba modelů 17 3.2.1 Výběr modelované proměnné 18 3.2.2 Předvýběr proměnných prostředí 18 3.2.3 Rozdělení datového souboru 19 3.2.4 Selekce vysvětlujících proměnných 19 3.2.5 Transformace dat 19 3.2.6 Výběr modelu při použití klasických metod 20 3.2.7 Nastavení hyperparametrů modelů strojového učení 20 3.2.8 Interpretace a srovnání modelů 22 3.3 Použitý software a implementace 23 4 Výsledky 26 4.1 Sumarizace datového souboru 26 -1- 4.1.1 Závislé proměnné 26 4.1.2 Problematické rysy datového souboru 27 4.2 Závislost počtu druhů a indexu diverzity ptačího společenstva na podmínkách prostředí 28 4.2.1 Počet druhů 28 4.2.2 Shannonův index diverzity ptačího společenstva 32 4.3 Závislost výskytu indikačních ptačích druhů na podmínkách prostředí . . . . 36 4.3.1 Výskyt kosa černého 36 4.3.2 Výskyt sýkory koňadry 39 4.3.3 Výskyt bažanta obecného 42 5 Diskuze 45 5.1 Zhodnocení výsledků modelování 45 5.2 Některé limitace zvoleného postupu tvorby modelů 47 5.3 Návrhy pro navazující práce 48 Závěr 49 Seznam zkratek 51 Seznam obrázků 52 Seznam tabulek 54 Seznam použité literatury 55 Přílohy 62 Úvod „AU models are wrong, but some are useful. " George Box Zpracování dat ekologických studií zaměřených na hledání vztahů mezi prostředím a biologickými společenstvy, které se v tomto prostředí vyskytují, je mnohdy problematické. Příroda je totiž velmi komplexní systém, který snad nikdy nebude možné popsat naprosto dokonalým modelem. Často jsou navíc porušeny předpoklady tradičně používaných metod modelování, což naši snahu najít a pochopit hledané vztahy dále komplikuje. Sestavení vhodného modelu, který by pomohl pochopit souvislosti mezi prostředím a v něm se vyskytujícími společenstvy, by však mohlo ulehčit například modelování biodiverzity sledovaných lokalit, hodnocení vhodnosti dané lokality pro výskyt určitého druhu, predikci rozmístění daného druhu (například v souvislosti s klimatickou změnou) či hodnocení chystaných kompenzačních opatření při plánování zásahů do krajiny. Biologická společenstva jsou též příhodným ukazatelem stavu prostředí, ve kterém se vyskytují, a někdy je možné s jejich pomocí rekonstruovat některé historické události, které se v dané lokalitě mohly přihodit. Například při silném znečištění vodního toku v minulosti bude obnova zdejšího společenstva trvat relativně dlouhou dobu oproti navrácení čistoty vody na přijatelnou míru. Ačkoli počátky strojového učení (angl. machine learning) lze najít již v padesátých letech minulého století, k jeho širšímu využívání dochází v souladu s rozvojem výpočetní techniky spíše až v posledních letech. Jejich výhodou oproti klasickým metodám jsou méně striktní požadavky na data. Je tedy možné s jejich pomocí modelovat mnohorozměrná data s nelineárními vztahy, interakcemi i chybějícími hodnotami [Thessen, 2016]. Nabízí se tedy otázka využití těchto metod při zpracování ekologických dat a případného rozšíření standardního vzdělání vědců zabývajících se touto oblastí přírodních věd. S ohledem na zaměření této práce lze na tomto místě uvést podobné studie věnující se vztahům mezi ptačími společenstvy a prostředím, ve kterém se nacházejí, s využitím některé z metod strojového učení. Při hledání vlivu prostředí na druhovou pestrost ptačích společenstev autoři některých studií využili například regresní stromy [O'Connor a kol., 1996, Goetz a kol., 2007], náhodné lesy [Eldegard a kol, 2014, Goetz a kol., 2014, Wu a Liang, 2018, Kosicki, 2020], neuronové sítě [Monteil a kol., 2005, Gil-Tena a kol., 2011, Wu a Liang, 2018] či metodu podpůrných vektorů [Wu a Liang, 2018]. Autoři se zde kromě snahy o pochopení vztahu mezi prostředím a počtem druhů v ptačím společenstvu (biodiverzitou) zabývali například -3- Úvod 4 také otázkou vlivu klimatické změny [Gil-Tena a kol., 2011, Goetz a kol., 2014], intenzivního zemědělského využívání krajiny [Goetz a kol., 2014], či zaváděním opatření snažících se o zachování biodiverzity [Gil-Tena a kol., 2011, Eldegard a kol., 2014]. Otázkou zmírnění vlivu intenzivního zemědělství pomocí dvou různých strategií se zaobírali také autoři studie sledující výskyt některých ohrožených ptačích druhů v Sasku, kteří při zpracování dat využili náhodné lesy [Jungandreas a kol., 2022]. Při tvorbě modelů využitelných pro predikci efektu změny využití krajiny na výskyt ptačích druhů zase někteří autoři využili bayesovský přístup k modelování [Hepinstall a Sáder, 1997]. Tento přístup (konkrétněji bayesovskou sít) využili i autoři studie zabývající se zhodnocením opatření zavedených na ochranu motáka lužního ve střední Itálii [Ferrarini a kol., 2023]. Autoři studie z Íránu pak použili metodu podpůrných vektorů při identifikaci skupin vodních ptáků, jejichž habitat vyžaduje zvýšenou pozornost a ochranu [Maleki a kol., 2020]. S pomocí některé z metod strojového učení se autoři některých studií rozhodli taktéž zhodnotit nové přístupy k získávání dat o prostředí, jako jsou různé letecké a satelitní snímky či třírozměrné modely vegetace získané pomocí laserového skenování (Light Detection andRanging), které mohou být výhodnější oproti nákladnému a časově náročnému terénnímu výzkumu. Některé z těchto studií využívají regresní stromy [Goetz a kol., 2007] či náhodné lesy [Eldegard a kol., 2014]. Metody strojového učení byly také použity například při ohodnocení nově vytvořeného indexu biodiverzity vytvořeného za pomoci environmentálních proměnných získaných prostřednictvím dat ze satelitních snímků, který by bylo možné použít při predikci druhového bohatství společenstev [Wu a Liang, 2018]. Prostřednictvím kombinace neuronové sítě pro výběr důležitých proměnných získaných ze satelitních snímků i dat o migraci ptáků s následným modelováním metodou podpůrných vektorů se zase autoři další studie pokusili vytvořit metodu vhodnou pro mapování výskytu husy indické [Su a kol., 2018]. Při mapování výskytu kolihy s využitím satelitních snímků zase jiní autoři použili bayesovské modelování [Aspinall a Veitch, 1993]. Důležitá je rovněž otázka porovnání jednotlivých přístupů strojového učení navzájem i s tradičně používanými metodami. V rámci některých studií nebyl mezi srovnávanými klasickými metodami a strojovým učením nalezen výraznější rozdíl (např. srovnání regresních stromů s víceproměnnou lineární regresí [Goetz a kol., 2007], srovnání náhodných lesů se zobecněnými lineárními modely [Eldegard a kol., 2014] či srovnání náhodných lesů s logistickou regresí a lineární diskriminační analýzou [Cutler a kol., 2007]), jindy se použití strojového učení ukázalo jako výhodnější přístup, viz např. studii porovnávající neuronovou síť s lineárním modelem [Monteil a kol., 2005]. Předmětem snahy dalších studií pak bylo i srovnání více různých metod strojového učení [Elith a kol., 2006, Kampichler a kol., 2010, Wu a Liang, 2018, Valavi a kol., 2022]. Ukazuje se, že nelze jednoznačně označit některý z přístupů jako univerzálně nejlepší pro modelování vztahů mezi biologickými společenstvy a jejich prostředím a za vhodné je považováno pro daný problém zvážit více různých metod [Fielding, 1999, Kosicki, 2020]. Obecně si ale lépe vedou obvykle spíše skupinové modely složené z více jednotlivých modelů, velkou roli také mohou hrát drobné úpravy dané metody [Valavi a kol., 2022]. Další zkoumanou otázkou pak také může být schopnost jednotlivých metod strojového učení vypořádat se s multikolinearitou proměnných prostředí při modelování vhodnosti stanoviště pro výskyt ptačího druhu [Farrell a kol., 2019]. Vvod 5 Hlavním cílem této práce je tedy prostřednictvím nastudování problematiky matematických modelů příhodných k modelování vztahů podmínek prostředí a biologických společenstev a vypracování rešerše možných modelů vybrat vhodnou metodu, která bude následně aplikována na reálná data z monitoringu ptačích společenstev liniových porostů jihozápadního Slovenska. Takto získané výsledky jsou poté rovněž vyhodnoceny a zjištěné vztahy mezi podmínkami prostředí a biologickými společenstvy vhodným způsobem in­ terpretovány. 1 Biologická společenstva Za společenstvo lze v přírodě považovat skupinu populací různých druhů, které se spolu vyskytují v jednom čase a na jednom místě [Begon a kol., 2006]. Tato práce se konkrétně věnuje živým jedincům různých druhů ptáků řádů hrabaví, vrubozobí, měkkozobí, dravci, sovy, šplhavci, sokoli a pěvci, kteří obývali daný vymezený prostor (lokalitu) ve stejném čase (hnízdním období). 1.1 Data biologických společenstev Data biologických společenstev mohou sloužit například ke zkoumání vztahů mezi společenstvy a prostředím, ve kterém se vyskytují. K dostatečnému popisu jak společenstva, tak i jeho prostředí, stejně jako k následnému nalezení co nejpřesnější reprezentace vztahu mezi nimi, je obvykle nutné zaznamenat mnoho jejich charakteristik, čímž jsou získána mnohorozměrná data [Jongman a kol., 1995]. Ta jsou často reprezentována pomocí datových matic o rozměrech n x p, kde n je počet pozorování / vzorků uložených v řádcích (např. zkoumané lokality) a p je počet sledovaných proměnných, jejichž hodnoty jsou zapsány ve sloupcích. V případě ekologických studií hledajících vztahy mezi společenstvem a jeho prostředím je tedy vhodné mít data uspořádána do dvou takových matic, kdy jedna bude obsahovat údaje o společenstvu (primární / druhová data obsahující vysvětlované proměnné) a druhá informace o prostředí (vysvětlující proměnné / prediktory - charakteristiky prostředí / environmentálni proměnné) [Lepš a Smilauer, 2000]. Biologické společenstvo je zpravidla popsáno pomocí skladby druhů (případně i jiných taxonů), které jsou v něm zastoupeny. Může se jednat například o pouhé zaznamenání ne/přítomnosti druhu na lokalitě, stanovení hustoty vyskytnuvších se jedinců sledovaných druhů nebo odhady pokryvnosti či biomasy [Lepš a Smilauer, 2000]. Ani prostředí nelze uspokojivě popsat jen pomocí několika málo údajů. Zaznamenávány tak mohou být fyzikální a chemické faktory (složení půdy, klimatické podmínky, ...), nebo třeba charakteristiky vegetačního porostu [Jongman a kol., 1995]. V obou případech se může jednat jak o data kvantitativní (např. koncentrace látky v půdě), tak kvalitativní (např. indikátor přítomnosti druhu na lokalitě) [Lepš a Smilauer, 2000]. S daty ekologických studií jsou často spojeny různé problémy, se kterými je nutné počítat při pozdější analýze. Jedním z nich je již zmíněná vysoká dimenzionalita a komplexnost, další problémy plynou například i ze způsobů závislosti výskytu jednotlivých druhů na gradientech proměnných charakterizujících prostředí, která je často nelineární. -6- Kapitola 1. Biologická společenstva 7 Je obvyklé, že se daný druh vyskytuje ve svém optimu dané charakteristiky prostředí a směrem od tohoto optima (jakýmkoliv směrem) se četnost (či pravděpodobnost) jeho výskytu snižuje. Objevovat se tak mohou i různé nepříliš běžné tvary distribuce četností (například multimodální). Další častou překážkou může být provázanost charakteristik prostředí, které spolu obvykle navzájem souvisí, tedy multikolinearita či další komplexní interakce. Také chybějící, případně nesprávné, hodnoty nejsou ve výzkumu ničím neobvyklým, při dalším zpracování dat je však opět nezbytné tato problematická pozorování ošetřit. Zejména v případě dat o výskytu druhů jsou rovněž časté řídké datové matice obsahující mnoho nul, vzácnější druhy jsou totiž častější než druhy s vysokou četností vyskytující se na mnoha lokalitách. Některé informace z dat lze pak dokonce interpretovat pouze nepřímo [Gauch, 1982, Fielding, 1999, Thessen, 2016]. 1.2 Charakteristika společenstva Na rozdíl od strukturálních metod (např. shlukování nebo různé ordinační metody), jejichž cílem je nalézt nějakou strukturu v datové matici obsahující více vysvětlovaných proměnných, odpovídá hledání vztahu mezi sadou vysvětlujících a vysvětlovaných proměnných přístupu funkčního modelování [Greenacre a Primicerio, 2013], přičemž příslušné metody, kterým se bude tato práce dále věnovat, se zabývají modelováním pouze jedné závislé proměnné. Pro některé metody je tedy nutné vyjádřit vektor hodnot reprezentujících společenstvo z jedné lokality pomocí nějaké shrnující charakteristiky vyjádřené jako jediné číslo i za cenu ztráty informace [Jarkovský a kol., 2012]. 1.2.1 Indexy biodiverzity Jednou z možností, jak souhrnně popsat biologické společenstvo, je použití nějakého ukazatele biodiverzity. Tu však nelze jednoduše shrnout do jediné hodnoty a je tak nutné zvážit, kterou z jejích komponent je v daném kontextu nejvhodnější měřit [Magurran, 2003]. Ohodnotit ji je například možné jak z kvalitativního, tak i kvantitativního pohledu, tedy podle toho, kolik různých druhů organismů zde lze nalézt a v jakém poměru jsou ve společenstvu zastoupeny [Jarkovský a kol., 2012]. Kromě poněkud zjednodušujícího ukazatele počtu druhů ve společenstvu, který je však nejlépe uchopitelným indexem diverzity, je možné biodiverzitu společenstva vyjádřit například i pomocí dalších indexů, které berou do úvahu i relativní abundanci druhů [Jarkovský a kol., 2012, Gardener, 2014]. Indexy diverzity se mohou věnovat pouze počtu druhů vyskytujících se ve společenstvu (např. Margafelův index), zastoupení jednotlivých druhů (např. Shannonův index) nebo křivce početností kumulativního počtu druhů (Q statistika). Indexy, které se zabývají zastoupením druhů ve společenstvu, se zaměřují na ekvitabilitu, tedy vyrovnanost zastoupení jednotlivých druhů, případně do výpočtu zahrnují i druhové bohatství [Jarkovský a kol., 2012]. Mezi nejpoužívanější indexy patří Shannonův a Simpsonův index [Gardener, 2014]. Blíže zde bude přiblížen pouze Shannonův index, který byl spolu s počtem druhů zvolen pro ohodnocení biodiverzity společenstev, jimiž se tato práce dále zabývá. Kapitola 1. Biologická společenstva 8 Shannonův index vychází z informační teorie a předpokládá, že se jedná o náhodný výběr jedinců z teoreticky neomezeně velké populace a přítomnost všech druhů společenstva ve vzorku. Lze jej spočítat pomocí následujícího vztahu: kde S je celkový počet druhů (taxonů), N je celkový počet jedinců, nř- je počet jedinců ř-tého druhu a pi je maximálně věrohodný odhad pravděpodobnosti příslušnosti náhodně vybraného jedince společenstva k /-tému druhu [Pielou, 1969]. Hodnoty Shannonova indexu se obvykle pohybují v rozmezí 1,5 až 4,5, přičemž vyšší hodnota indikuje společenstvo s rovnoměrnějším zastoupením druhů. Jeho nejnižší možná hodnota H'min — 0 by tak představovala společenstvo pouze s jedním dominantním druhem a naopak nejvyšší možná hodnota H'max — —In S by odpovídala společenstvu se stejnou početností všech jeho druhů. Při výpočtu Shannonova indexu je možné použít i jiný než přirozený logaritmus, což však ovlivní výslednou hodnotu. Při porovnávání je tedy nutné při výpočtu použít vždy stejný základ logaritmu [Jarkovský a kol., 2012]. 1.2.2 Indikační druhy Na základě přítomnosti některých druhů je možné odvodit další vlastnosti celého společenstva nebo prostředí, ve kterém dané společenstvo žije. Výskyt těchto tzv. indikačních druhů je tedy pozitivně asociován s výskytem nějakého jiného druhu nebo typem habitatu, případně rysem prostředí (například hustý porost), a negativně asociován s výskytem jiného druhu či odlišnými podmínkami prostředí [Gardener, 2014]. s H' = -^Pilnpi (1.1) i=i 2 Metody analýzy ekologických dat „Any sufficiently advanced technology is indistinguishable from magie. " Arthur C. Clarke Tato kapitola je věnována stručnému představení metod používaných při analýze ekologických dat se zaměřením zejména na metody strojového učení. Cílem je především nastínění hlavního principu těchto metod tak, aby dále použité metody nebyly považovány za nějaké „kouzlo". Vzhledem k nejasné hranici mezi tradičně používanými metodami a metodami strojového učení je vhodné na tomto místě upřesnit, že lineární regrese a zobecněné lineární modely jsou zde považovány za klasický přístup. 2.1 Řešené úlohy Výběr vhodné metody analýzy dat závisí na problému, který má být řešen. Obvykle je možné k jednomu problému přistupovat více různými způsoby a také danou metodu lze často použít pro řešení více typů úloh [Thessen, 2016]. Tato práce se dále bude zabývat následujícími dvěma problémy: Principem regresních úloh je hledání vztahu mezi vysvětlujícími proměnnými a vysvětlovanou proměnnou. Tento vztah je zpravidla popisován pomocí funkce daných nezávislých proměnných, kterou se obvykle snažíme s pomocí nějakého kritéria aproximovat. Na základě takto nalezeného vztahu je pak možné predikovat hodnoty pozorované proměnné mimo rozsah dat [Lantz, 2013, Thessen, 2016]. V kontextu biologických společenstev a jejich vztahu s prostředím se může jednat například o predikci počtu druhů na lokalitách či hodnot daného indexu biodiverzity. Cílem klasifikace je zařazení nového pozorování modelem do jedné ze skupin pozorovaných v rámci původního datového souboru [Thessen, 2016]. V případě biologických společenstev a jejich prostředí se může například jednat o zařazení zkoumaných lokalit do skupin podle toho, zda se na nich vyskytoval určitý druh. - 9 - Kapitola 2. Metody analýzy ekologických dat 10 2.2 Klasické metody 2.2.1 Lineární regresní modely Asi nejpoužívanějším přístupem při modelování numerických proměnných je víceproměnná lineární regrese. Jejím cílem je nalezení aproximace pozorovaných datových bodů v prostoru nadrovinou při minimalizaci chyb s ohledem na odhadované regresní koeficienty j8. Obecně lze model zapsat za pomoci následující rovnice: Yi = Po + M i + foXi2 + ... + pkXik + eu i e {1,2,..,n}, (2.1) kde Yi představuje hodnotu vysvětlované (závislé) proměnné na /-té lokalitě, Xn,..., Xik jsou hodnoty vysvětlujících (nezávislých) proměnných na /-té lokalitě, /3o, ...fík jsou regresní koeficienty, které je potřeba odhadnout (např. za pomoci metody nejmenších čtverců), a eř je nepozorovaná náhodná chyba, která by měla být pro jednotlivá pozorování nezávislá a mít normální rozdělení s nulovou střední hodnotou a rozptylem a2 , tj. £;- ~ N(0, a2 ) [Lantz, 2013]. Předpokládá se tedy, že střední hodnota Yi je lineární funkcí regresních koeficientů /3 [Kaurakol., 1996]. 2.2.2 Zobecněné lineární modely Modelovaná závislá proměnná však nemusí být jen spojitá proměnná. Kupříkladu se může jednat o počty, či zařazení pozorování do určitých kategorií. V tomto případě pak lze využít zobecněné lineární modely, které využívají transformaci, tzv. linkovací funkci g(.), modelované střední hodnoty [Kaurakol., 1996, Lantz, 2013]. Transformovaná střední hodnota Yi, tj. g(jUř), je pak opět modelována jako lineární kombinace vysvětlujících proměnných a neznámých regresních koeficientů: g(jM) =8(EYi) = p0 + p1Xil+p2^a + ... + pkXik, i e {1,2,..,«}, (2.2) kde Xii,...,Xik jsou hodnoty vysvětlujících proměnných na /-té lokalitě a /3o,.../3fc jsou regresní koeficienty, které je potřeba odhadnout (např. s využitím metody maximální věrohodnosti) [Kaurakol., 1996]. Jak v případě lineárních regresních modelů, tak zobecněných lineárních modelů lze různými způsoby upravit specifikaci modelu. Je možné zahrnout různé transformace vysvětlujících proměnných (např. jejich logaritmy či různé mocniny) i přidat do modelové rovnice také interakce mezi vybranými nezávislými proměnnými. Vždy je však nutné zachovat linearitu modelu v regresních koeficientech. Samotná specifikace modelové rovnice je u těchto metod ponechána na uživateli [Lantz, 2013]. Kapitola 2. Metody analýzy ekologických dat 11 2.3 Metody strojového učení Strojové učeníje disciplína zabývající se technikami umožňujícími počítačovému systému učit se z dat [Géron, 2019]. Za učení se lze v tomto kontextu chápat změnu programu vedoucí ke zlepšení jeho řešení zadaného úkolu skrze nějakou zkušenost [Mitchell, 1997]. Během tohoto procesu dochází ke shrnutí vstupu programu do modelu, který představuje jakýsi popis struktury a vztahů mezi daty [Lantz, 2013]. Jednat se může o nacházení vztahů mezi nezávislými proměnnými a závislou proměnnou [Thessen, 2016]. Může jít o rovnice, grafy, logické výroky či vytvoření shluků dat. K získání modelu pro daný dataset dochází během trénování modelu, poté by měl být takto získaný model testován na novém datovém souboru a ohodnocen z hlediska možnosti zobecnění tohoto modelu i pro data, se kterými se dosud neseznámil. Pokud by model až příliš dobře vysvětloval data, na kterých byl naučen, ale selhával by u dosud neviděných dat (signalizováno velkým rozdílem mezi predikční chybou u trénovacích a testovacích dat), zřejmě došlo k jeho přeučení (overfitting). Takové modely jsou obvykle příliš komplexní a nezachycují příliš dobře jádro studovaného problému. [Lantz, 2013]. Metody strojového učení lze dělit z mnoha hledisek. Nejčastěji používaným kritériem dělení je to, jakým způsobem se algoritmus učí. Dvě hlavní skupiny představují učení se s a bez učitele (supervised a unsupervised learning). V prvním případě má algoritmus v rámci trénovacího datového souboru k dispozici hodnoty vysvětlované proměnné a iterativně se snaží optimalizovat model při minimalizaci chyby modelu nebo jiného kritéria. Modelje pak možné využít při predikci hodnot pro nová data [Lantz, 2013, Thessen, 2016]. Naproti tomu při učení bez učitele nejsou hodnoty závislé proměnné známy. Algoritmus se pak zaměřuje na hledání různých vzorců, struktur a shluků v datech [Lantz, 2013]. V rámci této práce pak bude využit pouze přístup učení se s učitelem. Mezi často používané metody strojového učení v ekologii patří mimo jiné metody založené na vytváření stromů zahrnující regresní a klasifikační stromy a náhodné lesy, dále neuronové sítě, metoda podpůrných vektorů a Bayesův klasifikátor, které také budou následně přiblíženy, výčet však zdaleka není vyčerpávající [Thessen, 2016]. 2.3.1 Limitace přístupu Kromě již zmíněné možnosti přeučení a s tím souvisejícího upřednostňování spíše komplexních modelů před jednoduššími, které však nemusí nutně překonat jednodušší model, nelze je zobecnit na další data a znesnadňují interpretaci, lze jmenovat i opačný problém, a to nedoučení modelu (underfitting). Problematická je také snaha zahrnout co největší množství vysvětlujících proměnných, a to i těch, které nejsou pro daný problém relevantní. Potřebná velikost trénovacího datového souboru tak roste, neboť se algoritmus potřebuje dostatečně seznámit ideálně se všemi možnými kombinacemi v datech. Vyhnout se tomuto problému pak lze za pomoci redukce množiny vysvětlujících proměnných na podsoubor nej důležitějších proměnných pro řešený problém [Thessen, 2016]. Další limitace pak mohou vycházet i ze samotných dat. Problematická jsou například data s mnoha chybějícími či odlehlými hodnotami či nevyvážené zastoupení skupin Kapitola 2. Metody analýzy ekologických dat 12 ANO ANO_ vertikální pokryvnost >=356 lokalita s porosty křovin NE NE ANO „ „ . . NE l přítomnost hlohu— kos na lokalitě přítomen kos na lokalitě přítomen kos na lokalitě nepřítomen kos na lokalitě nepřítomen Obrázek 1: Schéma jednoduchého rozhodovacího stromu pro klasifikaci lokalit z hlediska přítomnosti hnízdícího kosa černého. v datech [Fielding, 1999, Thessen, 2016]. 2.3.2 Metody založené na vytváření stromů Rozhodovací stromy Hlavní princip rozhodovacích stromů (angl. decision trees) spočívá v postupném dělení datového souboru na základě daného pravidla tak, aby dané vzniklé podsoubory obsahovaly co možná nejpodobnější pozorování [Fielding, 1999, Thessen, 2016]. Jsou tvořeny hierarchicky uspořádanými rozhodovacími pravidly, které lze snadno graficky znázornit [Mitchell, 1997, Komprdová, 2012]. Příkladem může být strom na obrázku 1, který postupně klasifikuje danou lokalitu podle toho, zda splňuje daná rozhodovací pravidla v uzlech grafu. Dané pozorování se postupně dostává z horního uzlu (kořene) do jednoho z terminálních uzlů (listy). Pokud se lokalita octne v „zeleném" listu, je zařazena mezi ty, kde kos černý hnízdí. Pozorování závislé proměnné jsou tedy rozdělena do uzlů na základě hodnot vysvětlujících proměnných. V případě kategoriálních proměnných budou data rozdělena podle jejich kategorií, u spojitých proměnných je nutné najít dělicí hodnotu, pomocí které jsou pozorování posléze rovněž rozdělena. V každém uzlu je pro větvení stromu použita pouze jedna vysvětlující proměnná, ty je však dále možné používat opakovaně při vytváření dalších rozhodovacích pravidel. Naproti tomu každé pozorování lze zařadit pouze do jednoho listu, podle něhož je mu při klasifikačních úlohách přiřazena kategorie, do níž dané pozorování náleží, nebo průměrná hodnota závislé proměnné v daném listu při regresi [Komprdová, 2012]. V ideálním případě by ve všech listech měla být pozorování stejné hodnoty závislé proměnné, to však obvykle vede k příliš složitým modelům, a tak je nutné také stanovit pravidlo pro zastavení dělení uzlů (stopping rule), případně strom „prořezat" (pruning) [Fielding, 1999, Komprdová, 2012]. Kapitola 2. Metody analýzy ekologických dat 13 Algoritmů pro tvorbu rozhodovacích stromů existuje mnoho, přičemž hlavní rozdíly mezi nimi spočívají zejména ve výběru vhodné proměnné pro dělení datového souboru v uzlu a dělicí hodnoty pro spojité vysvětlující proměnné [Komprdová, 2012]. Mezi výhody používání rozhodovacích lesů se řadí přehledná vizualizace modelu ajeho snadná interpretace, absence předpokladů o rozdělení dat, použitelnost pro jakýkoli typ závislé proměnné, využití pouze nejdůležitějších proměnných, jsou tedy vhodné i pro datové soubory s relativně vysokým počtem nezávislých proměnných, dále také vhodnost této metody i pro vysoce korelovaná data a v neposlední řadě dostatečná robustnost vůči odlehlým a chybějícím hodnotám a chybám v datech. K nevýhodám pak naopak patří snadné přeučení či nedoučení modelu, možné obtíže s uchopením příliš velkých stromů a zejména vysoká nestabilita modelů, kdy malá změna nastavení metody může vést k významné změně modelu při stejných datech, či nepatrné odlišnosti v datech výrazně ovlivní výsledný strom [Mitchell, 1997, Fielding, 1999, Komprdová, 2012, Lantz, 2013]. Náhodné lesy Zejména kvůli nestabilitě modelů nebyly samostatné rozhodovací stromy při zpracování datového souboru v této práci použity, existují však metody, jež se pomocí vhodného kombinování více takových stromů dokáží s některými problémy, které provází samostatné stromy, vypořádat. Jednou z takových metodjsou právě náhodné lesy (angl. randomforests) [Komprdová, 2012]. Při vytváření modelu náhodného lesa jsou nejprve sestaveny jednotlivé stromy, a to za pomoci náhodných výběrů s opakováním (tj. bootstrapové výběry) z trénovacího datového souboru, modelovaná hodnota závislé proměnné pro dané pozorování je pak dána hlasováním této skupiny stromů. Při klasifikaci je tedy pozorování zařazeno do skupiny, do které jej zařadila i většina ze sestavených klasifikačních stromů, u regrese se pak jedná o průměrnou hodnotu ze všech hodnot modelovaných za pomoci jednotlivých stromů. Pro snížení korelace mezi stromy je pro každé dělení uzlu vytvářených stromů navíc náhodně vybrán pouze určitý počet vysvětlujících proměnných, ze kterých se následně vybírá nejvhodnější proměnná pro dělení [Breiman, 2007, Komprdová, 2012]. Náhodné lesy lze opět využít jak pro klasifikaci, tak regresi. Jejich nespornou výhodou je vyšší stabilita oproti samotnému rozhodovacímu stromu i vyšší přesnost, dále vhodnost i pro malé datové soubory či data s mnoha vysvětlujícími proměnnými a možnost využití různých metod pro interpretaci, jako je zjištění významnosti nezávislých proměnných pro model či těsnosti pozorování. Na druhou stranu jsou ve srovnání s rozhodovacími stromy výpočetně náročnější, nelze jednoduše reprezentovat výsledný model a je také nutné věnovat jisté úsilí nastavení hyperparametrů modelu [Cutler a kol., 2007, Komprdová, 2012, Lantz, 2013]. 2.3.3 Neuronové sítě Neuronové sítě (angl. artificial neural networks) jsou inspirovány stavbou a způsobem zpracování informací nervovou soustavou a stejně jako ony se skládají z neuronů. Kapitola 2. Metody analýzy ekologických dat 14 vstupující signál dendrity Obrázek 2: Schéma biologického neuronu [Lantz, 2013, upraveno]. Obrázek 3: Schéma uměl ého neuronu. Na l ineární kombinaci £ vstupů xi a jejich vah wř- je aplikována aktivační funkce / . Výsledkem je výstup y [Lantz, 2013]. Biologický neuron přijímá skrze dendrity signály z více zdrojů. Ty mohou mít různé váhy dle své důležitosti či frekvence. Při překonání určité hranice (threshold) akumulací příchozích signálů pak dochází k přenosu signálu axonem a skrze synapse do sousedních neuronů. Jednoduché schéma biologického neuronu je uvedeno na obrázku 2. Neuron umělé neuronové sítě (obrázek 3) modeluje vztah mezi sadou různě vážených vstupních signálů (vysvětlující proměnné xř- s váhami wř) a výstupním signálem (vysvětlovaná proměnná y). Při zpracování je suma vážených vstupů transformována aktivační funkcí {activation function) f. Často používaná je logistická křivka, dále (saturovaná) lineární funkce, hyperbolický tangens a Gaussova funkce. U většiny aktivačních funkcí jen poměrně úzký interval hodnot výrazněji ovlivní modelovaný výstup a proto se u neuronových sítí používá transformace dat na úzkou škálu v okolí nuly [Fielding, 1999, Lantz, 2013]. Při sestavování neuronové sítě je také nutné určit její strukturu (architekturu), konkrétněji počet vrstev neuronů a počet neuronů v nich a také možnost zpětné vazby. Zde záleží zejména na řešeném problému. Velké sítě budou schopny modelovat složité komplexní vztahy, budou však také náchylnější k přeučení [Fielding, 1999, Lantz, 2013]. V ekologii jsou typicky používány vícevrstvé sítě bez možnosti signálů vracet se zpět [Thessen, 2016]. Nakonec je rovněž nezbytné zvolit trénovací algoritmus pro určení vah jednotlivých spojení neuronů. Častým přístupem je algoritmus zpětného šíření chyby (backpwpagation), který spočívá v iterativní úpravě vah porovnáváním výstupu modelu při aktuálním nastavení se skutečnou hodnotou proměnné [Fielding, 1999, Lantz, 2013]. Neuronové sítě lze využít pro celou řadu problémů, nejen klasifikaci a regresi, díky nespočetným možnostem nastavení jejich struktury jsou velmi flexibilní a dokáží tak modelovat i velmi komplexní a nelineární vztahy a jejich použití je možné i při nepřesných datech. Jsou však náchylné k přeučení i nedoučení modelu a jejich interpretace je sama o sobě velmi obtížná až nemožná. Jedná se také o výpočetně náročnější metodu. Jednou natrénovanou síť již také obvykle nelze modifikovat a je nutné model naučit znovu [Fielding, 1999, Lek a Guégan, 1999, Lantz, 2013]. Kapitola 2. Metody analýzy ekologických dat 75 Obrázek 4: Schéma nalezené hranice (černá plná čára) metody podpůrných vektorů rozdělující datové body lineárně separabilních tříd na dvě skupiny v prostoru dvou vysvětlujících proměnných [Lantz, 2013, upraveno]. 2.3.4 Metoda podpůrných vektorů Metoda podpůrných vektorů (angl. support vector machine, případně pro regresi i jako support vector regression) spočívá v nalezení optimální hranice v prostoru pozorování. Při klasifikaci by hranice měla ležet v co největší vzdálenosti od datových bodů. Nové pozorování je pak zařazeno na základě své polohy v prostoru vzhledem k hranici. Podpůrné vektory {support vectors) jsou pozorování ze všech skupin v datech ležící co nejblíže hranici a pomocí jejichž polohy byla hledaná hranice nalezena. V nejjednodušším případě lze pozorování jednotlivých skupin rozlišit pomocí nadroviny, pak se jedná o lineárně separabilní třídy (viz obrázek 4). U regresních úloh je snahou nalézt funkci, která by nejlépe prokládala data. V případě lineárního vztahu se bude opět jednat o nadrovinu. Oba případy pak vedou na minimalizaci velikosti vektoru vah w pro jednotlivé nezávislé proměnné: min (2.3) při omezení | w r X i | > l , ie{l,2,...,n} (2.4) pro klasifikaci a | w r x i | > £ , i e {1,2,...,n} (2.5) pro regresi, kde £ je práh ignorace chyb odhadu modelu nebo také maximální chyba. Pro lineárně neseparabilní třídy a nelineární regresi lze zavést relaxační proměnné (slack variables), které v okolí hranice vytváří pásmo umožňující některým bodům zůstat na nesprávné straně hranice, resp. nacházet se mimo pás daný maximální chybou £. Tyto Kapitola 2. Metody analýzy ekologických dat 16 body jsou ohodnoceny hodnotou nákladu C a minimalizovány jsou celkové náklady. Při vyšších hodnotách C bude toleranční pásmo úzké a počet nesprávně zařazených objektů nižší, může ale být pro algoritmus problematické dosáhnout hledaného minima. Jiným přístupem může být zobrazení dat v novém prostoru za využití jádrové funkce (kernel function) [Lantz, 2013, Awad a Khanna, 2015]. Metoda podpůrných vektorů je vhodná i pro data s mnoha proměnnými a málo pozorováními, není příliš náchylná k přeučení modelu a je dostatečně robustní i pro nepřesná data a odlehlé hodnoty. Natrénování modelu však může trvat déle, zejména při vysokém počtu nezávislých proměnných nebo pozorování. Nalezení optimálního nastavení algoritmu může být rovněž problematické a náročná až nemožná je interpretace výsledného modelu [Lantz, 2013]. 2.3.5 Naivní Bayesův klasifikátor Jedná se o jednu z bayesovských metod, jejichž principem je využití kombinace apriorní představy o problému a informace z dat. Jak už název napovídá, jedná se o metodu řešící klasifikační úlohy. Naivní Bayesův klasifikátor (angl. naivě Bayesian classifier) představuje jednoduchou aplikaci Bayesovy věty. Například při klasifikaci lokalit z hlediska přítomnosti kosa černého je aposteriorní pravděpodobnost (posteriorprobability) P(kos|data) přítomnosti kosa na lokalitě získána za pomoci věrohodnostní funkce (likelihoodfunction) P(data|kos), marginální věrohodnosti dat P(data) a apriorní pravděpodobnosti (prior probability) /'(kos) přítomnosti kosa na lokalitě - viz vztah 2.6. Lokalita je pak zařazena do skupiny s nejvyšší pravděpodobností [Lantz, 2013, Thessen, 2016]. , , . PfdatalkoslPfkos) P ( k O S l d a , a > = f (data) <2 '6 > Výhodou této metody klasifikace je její rychlost a jednoduchost a potřeba méně tónovacích dat. Také si dobře vede i při nepřesných datech s chybějícími hodnotami. Atraktivní je rovněž snadné získání odhadů pravděpodobností jednotlivých skupin při predikci. Problematický je však téměř nesplnitelný předpoklad stejné důležitosti a nezávislosti vysvětlujících proměnných (i při porušení tohoto předpokladu si však obvykle metoda vede velmi dobře) a mohou nastat také obtíže při specifikaci apriorní informace, přičemž výsledek modelu na ni může být též velmi citlivý [Lorena a kol., 2011, Lantz, 2013]. 3 Metodika 3.1 Datový soubor Data zpracovávaná v rámci této práce se věnují ptačím hnízdním společenstvům ploch liniových porostů dřevin (vetrolamu) jihozápadního Slovenska. Celkově se jedná o 100 vetrolamu z osmi míst (Čierna Voda, Devínska Nová Ves, Dunajská Lužná, Galanta, Samorín 1 a 2, Senkvice 1 a 2), na kterých byly naměřeny údaje o 74 proměnných charakterizujících prostředí vetrolamu a data o zaznamenaných hnízdících párech 44 druhů ptáků. Seznamy proměnných prostředí a druhů vyskytnutých na větrolamech jsou obsahem příloh 1 a 2. Tato data byla obdržena uložená ve dvou souborech jako datové matice s lokalitami uloženými ve sloupcích a proměnnými prostředí v řádcích a druhy zaznamenanými prostřednictvím počtu hnízdních párů na 100 m2 a uloženými ve sloupcích a lokalitami uloženými naopak v řádcích. Vzhledem k tomu, že datové soubory neobsahovaly žádné chybějící či zjevně chybné hodnoty, ani se nevyskytl žádný jiný problém vyžadující nějakou úpravu dat, nebyla tedy data z tohoto hlediska nikterak dále upravována. Došlo pouze k transponování matice s daty o prostředí. Za hlavní problémy, které by mohly vyvstat při zpracování a analýze tohoto datového souboru, lze považovat zejména multikolinearitu a nelineární vztahy mezi vysvětlujícími a vysvětlovanými proměnnými. Roli rovněž hraje vyšší dimenzionalita dat, vzhledem ke zvoleným metodám analýzy byla datová matice obsahující informace o zjištěných druzích ptáků převedena na několik vysvětlujících proměnných, které pak byly následně zkoumány odděleně. 3.2 Tvorba modelů Postup tvorby jednotlivých modelů, o kterém blíže pojednává následující podkapitola, je také obecně shrnut pomocí schématu uvedeného na obrázku 5. -17- Kapitola 3. Metodika 18 D a t o v ý soubor ptačích d r u h ů Datový; soubor p r o m ě n n ý c h p r o s t ř e d í Výpočet závislé p r o m ě n n é Předvýběr p r o m ě n n ý c h p r o s t ř e d í I n t e r p r e t a c e a s r o v n á n í m o d e l ů Rozdělení d a t o v é h o s o u b o r u Testovací • d a t a s e t H Trénovací dataset •• Selekce p r o m ě n n ý c h ( n á h o d n ý les) •Predikce O d h a d Htó] Obrázek 5: Schéma znázorňující použitý obecný postup tvorby modelů. 3.2.1 Výběr modelované proměnné Jako vysvětlovaná proměnná reprezentující ptačí společenstvo byl pro regresi zvolen počet druhů a Shannonův index biodiverzity počítaný dle vztahu 1.1. Dále bylo rozhodnuto využít i přítomnost indikačních druhů, konkrétně kosa černého (Turdus merula) jako typického zástupce hustých porostů, sýkory koňadry (Parus major), cožje typický zástupce dutinových hnízdičů, a bažanta obecného (Phasianus colchicus), tedy typického obyvatele světlejších lokalit s nižší pokryvností křovin a stromů. To pak vedlo na klasifikační úlohy, při kterých bylo posuzováno, zda je daná lokalita pro zvolený druh vhodná a s jakou pravděpodobností bude daný druh na lokalitě možné nalézt. 3.2.2 Předvýběr proměnných prostředí Ještě před rozdělením datového souboru z něj byly vyloučeny proměnné, které vysoce korelovaly s dalšími vysvětlujícími proměnnými, s nimiž rovněž věcně souvisely. Pro výpočet těchto korelací byl využit Spearmanův korelační koeficient. Nebyly tak například využity informace o vertikální či horizontální pokryvností vegetace, které lze poměrně úspěšně nahradit proměnnými udávajícími například pokryvnost trávy či výšku vyšší křovinné etáže. Také proměnné o počtu stromů různých druhů byly z analýzy vyloučeny, neboť tyto údaje zase souvisí s pokryvností těchto druhů. Dále také nebyly zahrnuty vysvětlující proměnné, u nichž počet nulových hodnot přesahoval 75 % všech jejich hodnot. Zde se jednalo o pokryvnost vodních ploch na lokalitě, pokryvnost dřezovce, vrby a lípy. Tímto způsobem bylo vybráno 46 proměnných prostředí. Informace o tom, které proměnné byly do analýzy zařazeny, je uvedena v příloze 1. Kapitola 3. Metodika 19 3.2.3 Rozdělení datového souboru Po vytvoření dané vysvětlované proměnné a výběru vhodného podsouboru environmentálních proměnných následovalo rozdělení tohoto vzniklého datového souboru. S ohledem na počet pozorování byla data rozdělena na trénovací a testovací dataset, a to v poměru 70:30. Rozdělení proběhlo tak, aby proporce závislé proměnné byla v trénovacím a testovacím datasetu podobná a odpovídala proporci v celém datovém souboru. 3.2.4 Selekce vysvětlujících proměnných Dále bylo rozhodnuto po rozdělení datového souboru přistoupit nejprve k selekci vysvětlujících proměnných, a to na základě významnosti proměnných dle průměrného poklesu přesnosti modelu získané pomocí modelu náhodného lesa vytvořeného na tónovacím datasetu. Takto bylo vybráno vždy prvních dvacet proměnných prostředí, které byly modelem náhodného lesa na základě zvoleného kritéria označeny pro danou vysvětlovanou proměnnou jako nejvýznamnější. Stejné vysvětlující proměnné pak byly vybrány z testovacího datasetu. V případě regresních úloh byla také testována statistická významnost Spearmanových korelačních koeficientů pro vztah jednotlivých proměnných s vysvětlovanou proměnnou a u klasifikačních úloh pak byl spočítán Mannův-Whitneyho U test pro každou vysvětlující proměnnou. Protože však tyto testy berou do úvahy pouze izolovaný vztah dané proměnné prostředí a vysvětlované proměnné, jejich samotné použití není pro tato data příliš vhodné, protože nepostihují vztahy mezi dalšími proměnnými. Tyto metody tedy byly použity jako prvotní a sloužily spíše jako doplňující pohled na data. 3.2.5 Transformace dat Pro vytvoření modelu neuronové sítě byla data transformována na škálu [0,1], potažmo [—1,1], pomocí min-max normalizace a její modifikace: Xnorm Xnorm — X %min Xnorm — Xmax Xmin - U % •*•*'(! , - [ 2 %max Xmin / (3.1) Při modelování pomocí metody podpůrných vektorů byla využita standardizace dat. Použité standardizované proměnné tak měly nulový průměr a jednotkový rozptyl: - X —?L (% %\x stand — ) \P'J) Sx kde x je výběrový průměr a sx výběrová směrodatná odchylka proměnné x. Kapitola 3. Metodika 20 3.2.6 Výběr modelu při použití klasických metod Při hledání nej vhodnějšího lineárního regresního modelu a zobecněného lineárního modelu byl vždy nejprve sestaven celkový model se všemi dříve vybranými vysvětlujícími proměnnými trénovacího datového souboru. To přineslo první náhled na to, které proměnné by mohlo být vhodné ponechat a které naopak nejsou pro modelovanou závislost nikterak významné za předpokladu pouze lineárních závislostí. Tento model však sám o sobě nikdy nebyl vhodný, neboť vždy obsahoval zbytečně mnoho proměnných, z nichž většina nebyla pro vysvětlení zkoumané proměnné podstatná. Pro výběr výsledného modelu pak byla zvolena metoda sekvenční selekce proměnných s výběrem prediktorů na základě nejnižší hodnoty Akaikeho informačního kritéria. Takto byly získány dva modely, jeden pomocí algoritmu dopředné sekvenční selekce vycházející z nulového modelu a druhý pomocí algoritmu zpětné sekvenční selekce začínající s celkovým modelem. V obou případech bylo algoritmu umožněno v případě potřeby zpětně odebrat, resp. přibrat, vhodnou proměnnou. Tyto modely byly posléze porovnány s celkovým modelem pomocí analýzy rozptylu a v žádném případě nedošlo na hladině významnosti a — 0,05 k zamítnutí rovnocennosti porovnávaných modelů a možnosti přechodu na jednodušší model. Dále byly také vykresleny vztahy mezi vysvětlovanou a vysvětlujícími proměnnými zahrnutými do těchto modelů pro zvážení zahrnutí i vyšších mocnin nezávislých proměnných. Tak byl vytvořen další model, který obsahoval i statisticky významné druhé mocniny některých vysvětlujících proměnných, přičemž statisticky nevýznamné proměnné (na hladině významnosti a — 0,05) byly z tohoto modelu odstraněny. Do sebe zanořené modely pak byly opět testovány ohledně možnosti přechodu k jednoduššímu z nich pomocí analýzy rozptylu, jinak byly modely porovnávány pomocí Akaikeho a Bayesova informačního kritéria a adjustovaného koeficientu determinace. U zvoleného modelu bylo následně ověřeno splnění příslušných předpokladů. Při modelování závislosti počtu druhů na proměnných prostředí bylo možné zvolit Poissonův nebo lineární regresní model. Vzhledem ke splnění předpokladů lineárního regresního modelu byl vybrán druhý jmenovaný přístup. Při klasifikaci byla u všech indikačních druhů použita logitová linkovací funkce zobecněného lineárního modelu, jednalo se tedy o logistickou regresi. 3.2.7 Nastavení hyperparametrů modelů strojového učení Pro algoritmus náhodného lesa byl hledán vhodný počet stromů v lese (ntree) a počet náhodně vybraných kandidátních prediktorů pro dělení každého uzlu stromu (mtry). Vzhledem k relativní časové nenáročnosti algoritmu pro tato data byla velikost lesa vždy nastavena na hodnotu 1000, a to i v případě, že celková střední čtvercová chyba lesa při regresi, resp. celková chybovost lesa při klasifikaci, byla stabilní již při menším počtu sestavených stromů. Tím bylo umožněno zvýšení stability významnosti proměnných, neboť se zvýšila jejich šance výběru pro použití při dělení uzlů. Počet náhodně vybraných prediktorů mtry byl volen s ohledem na co nejnižší chybovost výsledného lesa. V případě, že se chybovost pro různá nastavení téměř nelišila, byla upřednostěna nejnižší vhodná hodnota pro zajištění Kapitola 3. Metodika 21 nízké korelace mezi jednotlivými stromy. Zvolené hodnoty jsou obsahem tabulky 1. Při vytváření modelů neuronových sítí byla pro každou vysvětlovanou proměnnou učiněna volba mezi použitím min-max normalizace dat na škálu [0,1] a její modifikací zobrazující data na škálu [—1,1] , dále bylo nutné rozhodnout mezi logistickou aktivační funkcí a hyperbolickým tangens (act . f ct) a zvolit vhodnou architekturu sítě (hidden). U počtu skrytých vrstev se rozhodovalo mezi jednou a dvěma, vzhledem k velikosti datového souboru nebylo více vrstev uvažováno ve snaze zabránit přeučení modelu jeho přílišnou komplexností neodpovídající složitosti řešeného problému. Pro určení vah při trénování modelu byla použita modifikace algoritmu zpětného šíření chyby (resilient backpwpagation with weight backtracking) [Riedmiller, 1994]. Optimální nastavení modelu bylo posuzováno při regresi na základě metrik odmocnina střední čtvercové chyby predikce (root mean square prediction error, dále jako RMSE) počítané pomocí vztahu 3.4 a střední absolutní chyba predikce {mean absolute prediction error, dále jako MAE), k jejímuž výpočtu byl využit vztah 3.5: RMSE = y^£(y*-y;)2 , (3.4) MAE = - £ \y*-yi\, (3.5) kde yi je skutečná hodnota závislé proměnné, yř* je hodnota predikovaná modelem a n je počet pozorování. U klasifikace proběhlo porovnání možných nastavení modelu pomocí celkové přesnosti modelu (accuracy; procento správně zařazených pozorování), senzitivity (sensitivity; procento správně zařazených výskytů indikačního druhu) a specificity (specificity; procento správně zařazených nepřítomností indikačního druhu) - viz vztahy 3.6, 3.7 a 3.8: TP + TN —M—^ ( 3 - 6 ) TP (3.7) (3.8) T N + F P kde TP jsou správně zařazené výskyty indikačního druhu (true positive), TN jsou správně klasifikované nepřítomnosti indikačního druhu (true negative), F P a F N jsou nesprávně zařazené ne/přítomnosti druhu (falše positive a falše negative) a M je celkový počet modelem predikovaných hodnot. V obou případech byly zmíněné metriky spočítány na testovací množině dat. Nejprve byla zvolena taková transformace dat a aktivační funkce, pro kterou byly zmíněné metriky nejnižší, resp. nejvyšší, a následně proběhlo posouzení vhodnosti počtu skrytých vrstev sítě, přičemž ve všech případech bylo vhodnější použití logistické aktivační funkce a architektury sítě se dvěma skrytými vrstvami. Optimální počet neuronů byl hodnocen opět na základě RMSE a MAE, resp. celkové přesnosti, senzitivity a specificity, mezi několika nej vhodnějšími nastaveními počtu neuronů v jednotlivých vrstvách, u nichž se zvolené TP + FN TN Kapitola 3. Metodika 22 metriky lišily jen minimálně, pak byla upřednostněna architektura mající co nejnižší počet neuronů v obou vrstvách. Nastavení všech modelů neuronových sítí lze nalézt v tabulce 1. Pro modely metody podpůrných vektorů bylo ve všech případech kromě modelování přítomnosti kosa černého na lokalitě zvoleno gaussovské radiální bázové jádro, jehož použití vedlo k nejlepším hodnotám sledovaných metrik modelu na testovacím souboru (RMSE a MAE, resp. celková správnost, senzitivita a specificita) oproti dalším zvažovaným jádrům, tj. lineárnímu, polynomickému ajádru hyperbolického tangens. Poslední jmenované jádro bylo nejvhodnější pro klasifikaci lokalit s přítomným kosem černým. Porovnáním různých nastavení algoritmu pomocí uvedených metrik pak byla dále volena i vhodná hodnota parametru C. Konkrétní hodnoty hyperparametrů jsou uvedeny v tabulce 1. 3.2.8 Interpretace a srovnání modelů Pro interpretaci modelů metod strojového učení a pochopení vlivu zahrnutých proměnných na predikovaný výstup modelu bylo pro regresní úlohy určeno pořadí permutační významnosti prediktorů na základě nárůstu RMSE a MAE, pro klasifikační úlohy pak byla významnost proměnných ohodnocena pomocí metody SHAP (z anglického SHapley Additive exPlanations) založené na Shapleyho hodnotách. Dále byly vykresleny grafy akumulovaných lokálních efektů (angl. accumulated local effects plots; dále jako A L E grafy). Principem ohodnocení permutační významnosti prediktorů je změření nárůstu predikční chyby modelu při narušení vztahu mezi hodnotami dané proměnné a závislou proměnnou, což je zajištěno permutací hodnot této vysvětlující proměnné. Čím vyšší je nárůst chyby modelu, tím důležitější tato proměnná je [Fisher a kol., 2019, Molnar, 2019]. Při měření chyb predikce je možné využít různé metriky, v této práci byly použity RMSE a MAE. Pro zvýšení stability odhadů nárůstu chyby byla permutace hodnot prediktorů provedena vždy dvacetkrát. Pro klasifikační úlohy se však hodnocení významnosti proměnných s využitím permutací ukázalo jako nevhodné, protože zřejmě často docházelo k tomu, že se po permutaci hodnot prediktorů sice změnila pravděpodobnost výskytu sledovaného druhu na dané lokalitě, následně však byla lokalita na základě této pravděpodobnosti ohodnocena hodnotou nula nebo jedna, podle toho, zda by se zde tento druh ne/vyskytoval, a tato hodnota se již nelišila od hodnoty přiřazené lokalitě bez permutace hodnot vysvětlující proměnné. Na základě tohoto přístupu pak byla významnost mnoha proměnných u některých modelů nulová, proto byla pro klasifikační úlohy počítána významnost proměnných pomocí SHAP metody využívající teorii her. Smyslem SHAP hodnotje vysvětlení predikcí modelu pomocí nalezení příspěvku každé proměnné k této predikované hodnotě, a to pro každé pozorování. Využívá k tomu myšlenky Shapleyových hodnot z teorie kooperativních her. Pro dané pozorování lze hodnoty jednotlivých proměnných považovat za spolupracující hráče, mezi které je potřeba spravedlivě rozdělit predikci modelu. Toto rozdělení lze získat právě za pomoci Shapleyových hodnot. Výpočet SHAP hodnotje však efektivnější a tedy využitelnější pro strojové učení. Významnost proměnných založená na SHAP metodě vychází z toho, že důležitější pro- Kapitola 3. Metodika 23 měnné budou mít v absolutní hodnotě vyšší SHAP hodnoty. Je tedy počítána jako průměrná hodnota SHAP hodnot v absolutní hodnotě [Lundberg a Lee, 2017, Molnar, 2019]. ALE grafy umožňují vizualizovat vztah mezi vstupními proměnnými a výstupem modelu. Oproti častěji užívaným grafům parciální závislosti (partial dependence plots) je možné je korektně použít i pro korelované prediktory. Při výpočtu akumulovaných lokálních efektů pro proměnnou X[ jsou její hodnoty nejprve rozděleny na základě kvantilů do intervalů. V rámci každého intervalu je pro každé pozorování v něm spočítán rozdíl mezi výstupy modelu, pokud hodnotu proměnné xř- tohoto pozorování nahradíme dolní a horní hranicí intervalu. Pro vykreslení grafu jsou tyto rozdíly následně akumulovány přes všechny intervaly a centrovány. ALE hodnoty lze interpretovatjako hlavní efekt proměnné při dané hodnotě v porovnání s průměrným výstupem [Molnar, 2019, Apley a Zhu, 2020]. Kromě pořadí proměnných dle přisuzované významnosti byly modely porovnávány i pomocí některých k tomu vhodných metrik spočítaných na základě predikcí modelu na testovacích datech. Pro regresi byly zvoleny RMSE A MAE, pro klasifikaci celková přesnost modelu, senzitivita, specificita a plocha pod ROC křivkou1 {area under curve, dále jako AUC); viz také tabulku 1. 3.3 Použitý software a implementace Při práci s datovým souborem, provedené exploratorní analýze a vizualizaci dat i tvorbě veškerých modelů byl použit software R ve verzi 4.2.2 [R Core Team, 2022]. Pro manipulaci s daty a vykreslení některých grafů byl využit balík knihoven t idy verse [Wickham a kol., 2019]. Výpočet Shannonova indexu proběhl pomocí funkce divers i t y z knihovny vegan [Oksanen a kol., 2022]. Rozdělení dat na trénovací a testovací proběhlo pomocí funkce createDataPartition knihovny caret [Kuhn, 2022]. Model náhodného lesa byl sestaven pomocí funkce randomForest ze stejnojmenné knihovny [Liaw a Wiener, 2002], model neuronové sítě pomocí funkce neuralnet opět ze stejnojmenné knihovny [Fritsch a kol., 2019], model podpůrných vektorů pomocí funkce ksvm z knihovny kernlab [Karatzoglou a kol., 2023] a konečně Bayesův klasifikátor byl odhadnut funkcí naiveBayes z knihovny el071 [Meyer a kol., 2023]. Permutační významnost vysvětlujících proměnných byla odhadnuta s využitím knihovny iml [Molnar a kol., 2018], pro zjištění a vykreslení významnosti proměnných pomocí SHAP metody byly využity knihovny fastshap [Greenwell, 2021] ashapviz [Mayer, 2023] a ALE grafy byly vykresleny s pomocí funkce ALEPlot ze stejnojmenné knihovny [Apley, 2018]. Pro práci s ROC křivkou byly využity knihovny R0CR [Sing a kol., 2005] a pROC [Robin a kol., 2011]. receiver operating characteristics; jedná se o křivku získanou vykreslením všech možných hodnot 1 — specificita proti všem možným hodnotám senzitivity [Fielding, 1999]. Tabulka 1: Shrnutí použitých metod. Nezávislé Transformace Model Nastavení Metriky pro proměnné dat Model hyperparametrů modelu srovnání modelů — lineární regresní model — - náhodný les ntree =1000 Počet druhů viz příloha 3 škála [0,1] standardizace neuronová síť metoda podpůrných vektorů mtry = 3 logistická aktivační funkce hidden = c(5, 3) radiální bázové jádro C = 1,53 RMSE, M A E - lineární regresní model - náhodný les ntree =1000 Shannonův index diverzity viz příloha 3 škála [0,1] standardizace neuronová síť metoda podpůrných vektorů mtry = 3 logistická aktivační funkce hidden = c(7, 7) radiální bázové jádro C = 1,57 RMSE, M A E - logistická regrese Kos černý viz příloha 3 škála [-1,1] standardizace náhodný les neuronová síť metoda podpůrných ntree =1000 mtry = 3 logistická aktivační funkce hidden = c(4, 1) jádro hyperbol, tangens celková správnost, senzitivita, specificita, AUC vektorů C = 0,64 celková správnost, senzitivita, specificita, AUC - Bayesův klasifikátor - Tabulka 1: Shrnutí použitých metod (pokrač.). Nezávislé proměnné Transformace dat Model Nastavení hyperparametrů modelu Metriky pro srovnání modelů Sýkora koňadra viz příloha 3 škála [0,1] standardizace logistická regrese náhodný les neuronová síť metoda podpůrných vektorů Bayesův klasifikátor ntree =1000 mtry = 2 logistická aktivační funkce hidden = c(4, 2) radiální bázové jádro C = 2,35 celková správnost, senzitivita, specificita, AUC - logistická regrese - náhodný les ntree =1000 celková Bažant viz škála [0,1] neuronová síť mtry = 4 logistická aktivační funkce správnost, senzitivita, specificita, AUC obecný příloha 3 standardizace metoda podpůrných hidden = c(2, 1) radiální bázové jádro správnost, senzitivita, specificita, AUC vektorů C = 1,34 správnost, senzitivita, specificita, AUC - Bayesův klasifikátor - 4 Výsledky 4.1 Sumarizace datového souboru Základní představu o proměnných prostředí datového souboru lze získat za pomoci krabicových grafů uvedených na obrázku 6. Lze si povšimnout různého rozpětí hodnot jednotlivých proměnných i rozličných rozdělení. 4.1.1 Závislé proměnné Sumární statistiky pro počet ptačích druhů na lokalitách a Shannonův index diverzity jsou uvedeny v tabulce 2, zaznamenaný počet druhů se pohyboval od tří do třiadvaceti, průměrně se na větrolamech vyskytovalo 11,36 různých hnízdících druhů. Z hodnot Shannonova indexu v rozmezí 1,04-2,66 lze usoudit, že se spíše jedná o ne příliš vyrovnaná společenstva s několika málo dominantnějšími druhy. Na obrázku 7 jsou uvedeny histogramy těchto proměnných. Počty lokalit podle přítomnosti indikačních druhů jsou uvedeny v tabulce 3. U sýkory koňadry a bažanta obecného byl jejich výskyt pozorován na přibližně polovině lokalit, kos černý se vyskytoval na 41 % sledovaných vetrolamu, tato nevyváženost však stále není markantní a neměla by při analýze činit větší potíže. Nejvýznamnější nezávislé proměnné pro každou závislou proměnnou získané selekcí pomocí náhodného lesa a použité pro modelování jsou uvedené v příloze 3. Tabulka 2: Sumární statistiky vysvětlovaných proměnných počet druhů na lokalitě a hodnota Shannonova indexu diverzity. Min. Medián Max. Průměr Sm. odchylka Počet druhů 3,00 11,00 23,00 11,36 4,81 Shannonův index 1,04 2,03 2,66 2,02 0,36 -26- Kapitola 4. Výsledky 27 proměnná prostredí bazplocha proměnná prostředí Obrázek 6: Krabicové grafy proměnných prostředí datového souboru. Názvy vysvětlujících proměnných viz příloha 1. 4.1.2 Problematické rysy datového souboru Vztahy mezi proměnnými prostředí byly prozkoumány pomocí Spearmanova korelačního koeficientu pro každou dvojici těchto proměnných. Jak je vidět na grafu na obrázku 8, mnoho proměnných datového souboru je navzájem velmi silně korelováno. Tyto silné vztahy však nejsou nikterak překvapivé, vezme-li se v úvahu i věcný význam daných proměnných. Je například vcelku jasné, že vyšší počet stromů či keřů některého rostlinného druhu povede zároveň k jeho vyšší pokryvnosti na lokalitě nebo že vyšší pokryvnost vegetace v určité výšce bude souviset s vyšší pokryvnosti těch druhů, které svou typickou výškou spadají do dané vrstvy (například pokryvnost ve vrstvě nad devět metrů a pokryvnost stromů). Z tohoto důvodu došlo k předvýběru vhodných proměnných pro další práci, jak bylo popsáno v podkapitole 3.2.2. Nelinearitu vztahů lze demonstrovat na příkladu grafu na obrázku 9 znázorňujícího vztah výšky nižší křovinné etáže a Shannonova indexu diverzity ptačího společenstva. Kapitola 4. Výsledky 28 15 • 10 - 20 - 15 ,8 1 0 - 5 - 11 13 15 17 19 21 23 počet druhů (a) počet druhů 1,10 1,49 1,88 2,26 hodnota Shannonova indexu (b) Shannonův index 2,65 Obrázek 7: Histogramy vysvětlovaných proměnných počet druhů na lokalitě a hodnota Shannonova indexu diverzity ptačího společenstva. Je zjevné, že body popisující jednotlivé vetrolamy lze jen stěží proložit pouhou přímkou reprezentující lineární vztah, na druhou stranu zde lze vypozorovat jistou kvadratickou závislost. 4.2 Závislost počtu druhů a indexu diverzity ptačího společenstva na podmínkách prostředí 4.2.1 Počet druhů Dle lineárního regresního modelu, který byl vybrán jako nejlépe popisující trénovací data, statisticky významně na hladině významnosti a — 0,05 ovlivňuje pozitivně počet druhů na lokalitě šířka větrolamu, bazální plocha živých stromů, průměrná vzájemná vzdálenost stromů, celková pokryvnost stromů a pokryvnost topolu. Negativní závislost pak byla zjištěna v případě průměrné tlouštky živých stromů a druhých mocnin průměrné vzájemné vzdálenosti stromů a pokryvnosti topolu. Odhady regresních koeficientů pro tyto proměnné jsou uvedeny v rovnici 4.1 pro odhad počtu ptačích druhů na /-té lokalitě. Tabulka 3: Počty lokalit podle přítomnosti indikačního druhu. Druh Přítomnost Nepřítomnost Kos černý 41 59 Sýkora koňadra 53 47 Bažant obecný 48 52 Kapitola 4. Výsledky 29 Počet strcmCi drezovce, pokryvnost drezovce (v %] Počet stromlj lipy, pokryvnost lipy (v %) Počet strcmCi jilrnu, pokryvnost jilmu (v%| Počet strcmíi akátu, pokryvnost akátu [v%] Počet strč m íi javoru, pokryvnost javoru [v %) Počet strcmíi vrby, pokryvnost vŕby (v %) Počet stromů jasanu, ookryvnost jasanu iy %) Počet stře mů topolu, pokryvnost topolu [v%] Vertikální pokryvnost ve 3-7 m (v%), celková ve-nkální pokryjno:t [v %) Pľ'iet veai bezu, ccí'yvncsi bez., [v 9i] Pokryvnost vegetace ve vrstve 7-9 m {v%\ pokryvnosl vegetace ve vrstvě nad 9 m (v 5í) Po kry vrost trávy [v %), pc v^/vncs: lip nice (v K) Po kry vnost javoru (v 5í), Po kry vnost javoru - keřů (v %] Počet stromu javoru, pokry vnost javoru - keřů (v %) Po kry vnost vegetace ve vrstve 7-9 m {v%\ vertikálni pokryvnosl ve 3-7 m (v %| o.o 0.2 0.4 0.6 o.e 1,0 Obrázek 8: Grafické znázornění Spearmanova koeficientu korelace pro 15 nejkorelovanějších dvojic proměnných prostředí. Všechny závislosti jsou kladné. 50 60 70 Výška nižší krovinné etáže (cm) Obrázek 9: Příklad zjevně nelineárního vztahu proměnné prostředí popisující výšku nižší křovinné etáže v cm a Shannonova indexu diverzity ptačího společenstva. pocetDruhui = — 4,8455 + 0,2124sirkcii + 0,0003bazplochai + 4,2176vzajvzstri - 0,lAlAvza jvzstrf + 0,0125pstrsumai + 0,2249pokrPopuk (4.1) — 0,0034pokrPopulf — 0,3635hrubkastri Pro model náhodného lesa bylo pět nejvýznamnějších proměnných pokryvnost ptačího zobu, šířka vetrolamu, pokryvnost hlohu, pokryvnost javoru a pokryvnost topolu, a to jak na základě nárůstu RMSE, tak i M A E při permutaci hodnot těchto proměnných (viz grafy na obrázku 10). Již při malé pokryvnosti ptačího zobu dochází ke zvýšení modelovaného počtu druhů, zřejmě však stačí pouhá přítomnost tohoto keře, protože A L E hodnoty se od přibližně 2,5% pokryvnosti již nemění. Rostoucí šířka vetrolamu dle modelu rovněž zvyšuje počet druhů na lokalitě, do přibližně 18 metrů se jedná o víceméně lineární Kapitola 4. Výsledky 30 pkrLigus sirka pkrCratae pkrAcer pokrPopul - pkrosuma pstrsuma - pkrlnekr pctdrstr - pkrRhCor - pkrRubus lezstr vzajvzstr bazplocha hrubkastr lezkro pocsustr pkrytkrov pkrCarCir - pkrUlmus - 0,3 0,4 nárůst RMSE (a) nárůst RMSE pkrLigus sirka pkrCratae pokrPopul - pkrAcerpstrsuma - pkrosuma pkrRhCor - pkrlnekr pctdrstr - pkrRubus lezstr vzajvzstr bazplocha hrubkastr lezkro pocsustr pkrytkrov pkrCarCir - pkrUlmus - 0,2 0,3 nárůst MAE (b) nárůst M A E Obrázek 10: Permutační významnost vysvětlujících proměnných modelu náhodného lesa pro počet druhů na lokalitě vyhodnocená na základě odhadu nárůstu RMSE a M A E oproti původnímu modelu při permutaci hodnot dané proměnné. Sedě úsečky představují 95% intervaly spolehlivosti. Názvy vysvětlujících proměnných viz příloha 1. závislost, od této hodnoty už však větší šířka spíše vliv nemá. V případě hlohu a javoru je situace podobná jako u ptačího zobu. Stačí poměrně malé zastoupení těchto druhů pro zvýšení modelovaného počtu druhů, poté však již rostoucí pokryvnost nemá v podstatě žádný vliv, i když u javoru můžeme i dále pozorovat pozvolný nárůst. Pro pokryvnost topolu do cca 40 % postupně dochází k navyšování modelovaného počtu druhů, a to zejména od 20% pokryvnosti, kdy je nárůst opravdu vcelku značný. Poté naopak dochází k negativnímu vlivu zvyšované pokryvnosti na počet druhů na lokalitě. Vlivy ostatních zahrnutých druhů (s výjimkou jilmu) jsou obdobné jako u již popsaných druhů, tj. od určitého bodu již při vyšších pokryvnostech nepozorujeme přílišnou změnu výstupu, to je v tomto případě zřejmě způsobeno menším zastoupením lokalit s vyššími pokryvnostmi sledovaných druhů a způsobem tvorby stromů modelu náhodného lesa. Pravděpodobně zůstávají tyto lokality při dělení uzlů pospolu a podle modelu pak působí jako jeden celek. I tak lze ale říci, že přítomnost těchto rostlinných druhů na vetrolamu má pozitivní vliv na druhovou pestrost přítomného ptačího společenstva (viz ALE grafy přílohy 4). Mezi nejvíce významné proměnné pro model neuronové sítě patřily proměnné průměrná vzájemná vzdálenost stromů, pokryvnost topolu ajilmu, celková pokryvnost keřů, počet ležících suchých stromů a keřů a počet suchých stromů na 100 m2 (viz obr. 11). Dle ALE grafů (příloha 5) přispívá větší vzdálenost mezi stromy k většímu počtu druhů ptáků na lokalitě, přičemž vztah se zdá být v podstatě lineární. Do přibližně 12% pokryvnosti topolu modelovaný počet druhů rovněž roste, po dosažení této hodnoty pak naopak klesá. Rostoucí pokryvnost jilmu má zřejmě spíše negativní vliv na množství druhů na vetrolamu, zejména při pokryvnosti přibližně nad 8 %. Také vyšší pokryvnost keřů snižuje modelovaný počet druhů, vztah se zde opět zdá být lineární. Naopak ležící suché stromy lineárně zvyšují modelované množství druhů, v případě ležících keřů zase dochází nejprve spíše k poklesu a poté nárůstu. Počet suchých stromů k počtu ptačích druhů spíše přispívá, a to zejména v intervalu 2,5-10 suchých stromů na 100 m2 . Kapitola 4. Výsledky 31 1,0 nárůst RMSE vzajvzstr pokrPopul lezstr pkrosuma pocsustr - sirka lezkro pkrUlmus - pctdrstr - pstrsuma pkrytkrov pkrlnekr pkrRubus pkrCarCir pkrCratae bazplocha pkrLigus hrubkastr - pkrAcerpkrRhCor - 0,8 1,0 nárůst MAE (a) nárůst RMSE (b) nárůst M A E Obrázek 11: Permutační významnost vysvětlujících proměnných modelu neuronové sítě pro počet druhů na lokalitě vyhodnocená na základě odhadu nárůstu RMSE a M A E oproti původnímu modelu při permutaci hodnot dané proměnné. Šedé úsečky představují 95% intervaly spolehlivosti. Názvy vysvětlujících proměnných viz příloha 1. Co se týče nejvýznamnějších proměnných pro model metody podpůrných vektorů, jak z hlediska nárůstu RMSE, tak MAE, za ně byly označeny proměnné průměrná vzájemná vzdálenost stromů, šířka vetrolamu, celková pokryvnost stromů a počet suchých ležících stromů i keřů (obr. 12), přičemž jak rostoucí vzájemná vzdálenost stromů, tak i šířka vetrolamu, celková pokryvnost stromů a počet suchých ležících stromů mají na druhovou pestrost ptačího společenstva pozitivní vliv. Zlom v A L E grafu 6t je nutné brát s rezervou, neboť zde působí vliv pouze jediné lokality. Pouze vyšší počet suchých ležících křovin snižuje modelovaný počet druhů na daném vetrolamu. Všechny zmíněné závislosti jsou dle A L E grafů lineární (viz příloha 6). Srovnání modelů Pro žádné dva modely nebyly nejvýznamnější proměnné úplně shodné, nicméně u těch proměnných, které byly více modely vyhodnoceny jako nejvýznamnější (ať už na základě nárůstu RMSE nebo MAE), byl dle A L E grafů nalezen víceméně stejný vztah s modelovaným počtem druhů. Zdá se tedy, že druhově bohatší ptačí společenstvo se bude nacházet na vetrolamu dostatečné šířky (alespoň cca 15 metrů) se stromy od sebe více vzdálenými, mezi nimiž se nachází topol, jehož pokryvnost by se měla pohybovat přibližně okolo 20 %. Celková pokryvnost stromů by dále měla být také vysoká a měly by se zde vyskytovat i suché stromy. Hodnoty odmocniny střední čtvercové chyby a střední absolutní chyby pro jednotlivé modely jsou uvedeny v tabulce 4. Dle RMSE se jako nejvhodnější jeví metoda podpůrných vektorů, při hodnocení pomocí metriky M A E však lépe vychází model neuronové sítě. Lineární regresní model jako zástupce klasické metody vychází u obou sledovaných metrik nejhůře. Kapitola 4. Výsledky 32 0,4 0,6 o,e nárůst RMSE vzajvzstr sirka • pstrsuma lezstr lezkro pctdrstr pocsustr hrubkastr pkrCarCir pokrPopul pkrAcer bazplocha pkrlnekr pkrytkrov pkrosuma pkrUlmus pkrRubus pkrCratae pkrLigus pkrRhCor 0,4 0,6 0,£ nárůst MAE (a) nárůst RMSE (b) nárůst M A E Obrázek 12: Permutační významnost vysvětlujících proměnných modelu metody podpůrných vektorů pro počet druhů na lokalitě vyhodnocená na základě odhadu nárůstu RMSE a M A E oproti původnímu modelu při permutaci hodnot dané proměnné. Sedě úsečky představují 95% intervaly spolehlivosti. Názvy vysvětlujících proměnných viz příloha 1. Grafické srovnání predikcí jednotlivých modelů je znázorněno v grafu na obrázku 13. Jak se zdá, všechny modely mají tendenci nadhodnocovat počet druhů u druhově méně pestrých lokalit a naopak podhodnocovat lokality s větším zastoupením různých druhů. 4.2.2 Shannonův index diverzity ptačího společenstva Do vybraného lineárního modelu popisujícího závislost hodnoty Shannonova indexu diverzity na prostředí, ve kterém se ptačí společenstvo vyskytuje, byly jako statisticky významné na hladině významnosti a — 0,05 zahrnuty proměnné šířka vetrolamu, průměrná tlouštka živých stromů a proměnné výška nižší křovinné etáže, průměrná vzájemná vzdálenost stromů a pokryvnost topolu i s jejich druhými mocninami. O pozitivní závislost se jednalo v případě šířky vetrolamu, výšky nižšího křovinného patra, vzájemné vzdálenosti stromů a pokryvnosti topolu, negativní vliv na modelovanou hodnotu Shannonova indexu pak měla proměnná popisující průměrnou tlouštku stromů a všechny zahrnuté druhé mocniny proměnných. Odhady regresních koeficientů jsou uvedeny v rovnici 4.2 pro odhad hodnoty Shannonova indexu diverzity na /-té lokalitě. Tabulka 4: Tabulka RMSE a M A E jednotlivých modelů při predikci počtu druhů na lokalitách testovacího souboru. lin. regresní model náhodný les neuronová síť m. podpůrných vektorů RMSE 4,973 4,005 4,266 3,989 M A E 3,921 3,470 3,013 3,212 Kapitola 4. Výsledky 33 Shannorti — — 1,7479 + 0,030lsirkai + O, lOS6vyskankroi — 0,0009vyskankro^ + 0,2566vzajvzstn - 0,030vzajvzstrf + 0,0\2ApokrPopuk (4.2) - O, OOOlpokrPopulf - 0,0lS6hrubkastn Mezi pět nejvýznamnějších proměnných pro model náhodného lesa patřily podle RMSE, resp. MAE, proměnné počet druhů stromů na lokalitě, celková pokryvnost keřů, pokryvnost jiných druhů keřů, pokryvnost hlohu a výška nižší křovinné etáže, resp. průměrná vzájemná vzdálenost keřů (viz grafy na obrázku 14). Dle A L E grafů přílohy 7 přispívá více druhů stromů na lokalitě k vyšší modelované hodnotě Shannonova indexu, a to přibližně do čtyř druhů, poté již k dalšímu navyšování Shannonova indexu nedochází. Podobně je tomu i u celkové pokryvnosti keřů a výšky nižší křovinné etáže. Rostoucí pokryvnost, resp. výška, zvyšuje modelovanou hodnotu Shannonova indexu do cca 45 %, resp. cca 50 cm, od této hodnoty její vliv zeslábne a je spíše negativní. Pokryvnost hlohu a dalších druhů keřů rovněž zvyšuje hodnotu Shannonova indexu, zejména však při malých pokryvnostech, což ilustruje rychlý nárůst A L E hodnot mezi nulovou a 2%, resp. 8%, pokryvností. Poté již vyšší pokryvností nemají žádný vliv. Kapitola 4. Výsledky 34 pctdrstr pkrCratae pkrosuma pkrlnekr vzajvzkrov sirka • vzajvzstr vyskankro pkrRubus pkrEuon pokrlnestr hrubkastr pkrSamb pstrsuma pokrPopul pkrythrab pkrytkrov lezstr vyskakor pkrGeum 0,02 nárůst RMSE 0,005 0,010 0,015 0,020 nárůst MAE (a) nárůst RMSE (b) nárůst M A E Obrázek 14: Permutační významnost vysvětlujících proměnných modelu náhodného lesa pro hodnotu Shannonova indexu diverzity ptačího společenstva vyhodnocená na základě odhadu nárůstu RMSE a M A E oproti původnímu modelu při permutaci hodnot dané proměnné. Šedé úsečky představují 95% intervaly spolehlivosti. Názvy vysvětlujících proměnných viz příloha 1. Pro model neuronové sítě byly nejdůležitější jak z hlediska RMSE, tak MAE, proměnné vzájemná vzdálenost stromů, pokryvnost topolu, počet suchých ležících stromů, výška nižší křovinné etáže a pokryvnost hlohu (obrázek 15). Vliv vzájemné vzdálenosti stromů na modelovanou hodnotu Shannonova indexu je pozitivní a víceméně lineární, okolo čtyř metrů nastává menší zlom a vliv je od této vzdálenosti slabší. Podobně je tomu tak i u počtu ležících stromů a výšce nižšího křovinného patra, zde však od přibližně 8 ležících stromů na 100 m2 není pozorována změna A L E hodnot a u výšek nad přibližně 58 cm dochází postupně naopak ke snižování modelované hodnoty Shannonova indexu. Pokryvnost hlohu má zpočátku pozitivní vliv, od přibližně 3 % se ale trend obrací a jeho zvyšující se výskyt naopak snižuje Shannonův index na lokalitě. U pokryvnosti topolu nelze vysledovat nějaký výraznější trend, spíše by však mohla mít negativní vliv (viz příloha 8). V případě modelu metody podpůrných vektorů patřilo při zohlednění nárůstu RMSE mezi pět nejvýznamnějších proměnných vzájemná vzdálenost stromů, výška nižší křovinné etáže, šířka vetrolamu, vzájemná vzdálenost keřů a průměrná tlouštka živých stromů na vetrolamu. S ohledem na M A E lze místo dvou posledních zmíněných proměnných vzít proměnné pokryvnost opadanky a celkovou pokryvnost stromů (viz obrázek 16). Vzájemná vzdálenost stromů, celková pokryvnost stromů, výška nižšího křovinného patra, šířka vetrolamu i pokryvnost opadanky mají na Shannonův index pozitivní vliv, kdežto vyšší hodnoty průměrné tlouštky stromů a vzájemné vzdálenosti keřů naopak snižují modelovanou hodnotu Shannonova indexu (viz příloha 9). Srovnání modelů U všech modelů byla mezi nejvýznamnější vysvětlující proměnné zařazena výška nižší křovinné etáže. Ta do určité výšky jak se zdá hodnotu Shannonova indexu na lokalitě Kapitola 4. Výsledky 35 0,10 0,15 nárůst RMSE vzajvzstr pokrPopul lezstr vyskankro pkrCratae vzajvzkrov pkrythrab pkrytkrov pkrlnekr pkrRubus sirka • pkrosuma pkrSamb pkrEuon pkrGeum pstrsuma hrubkastr pokrlnestr pctdrstr vyskakor 0,05 0,10 nárůst MAE (a) nárůst RMSE (b) nárůst M A E Obrázek 15: Permutační významnost vysvětlujících proměnných modelu neuronové sítě pro hodnotu Shannonova indexu diverzity ptačího společenstva vyhodnocená na základě odhadu nárůstu RMSE a M A E oproti původnímu modelu při permutaci hodnot dané proměnné. Šedé úsečky představují 95% intervaly spolehlivosti. Názvy vysvětlujících proměnných viz příloha 1. zvyšuje, od určité úrovně však již zřejmě její další zvyšování v podstatě žádný efekt nemá. Vzájemná vzdálenost stromů se pak projevila jako nej významnější ve všech modelech vyjma modelu náhodného lesa. Také ona má na hodnotu Shannonova indexu pozitivní vliv. Vyšší hodnotu Shannonova indexu pravděpodobněji budou mít spíše širší vetrolamy s přiměřenou pokryvností hustších křovin se zastoupením hlohu, přičemž nižší křovinné patro bude mít dostatečnou výšku, což by mělo být umožněno dostatečnou vzdáleností stromů od sebe. Ty by přitom neměly být příliš staré. Srovnání modelů pomocí RMSE a M A E lze učinit na základě údajů uvedených v tabulce 5. V případě obou metrik si nejlépe vedl model neuronové sítě, naopak lineární regresní model se vždy ukázal jako nejhorší možnost. Pro dvě lokality z testovacího souboru s nízkými hodnotami Shannonova indexu tento model dokonce predikoval záporné hodnoty. Grafická vizualizace predikcí jednotlivých modelů oproti skutečným hodnotám Shannonova indexu testovacího souboru dat je znázorněna na obrázku 17. Stejně jako u predikcí počtu druhů na lokalitě všechny modely nadhodnocují hodnotu Shannonova indexu na lokalitách s jeho nižší hodnotou a naproti tomu podhodnocují hodnotu Shannonova indexu na lokalitách s jeho vyššími hodnotami. Tabulka 5: Tabulka RMSE a M A E jednotlivých modelů při predikci hodnoty Shannonova indexu diverzity ptačího společenstva lokalit testovacího souboru. lin. regresní model náhodný les neuronová síť m. podpůrných vektorů RMSE 0,526 0,289 0,267 0,330 M A E 0,313 0,236 0,220 0,251 Kapitola 4. Výsledky 36 0,04 0,06 rarĹst R M SE vzajvzstr sirka vyskankro pkrythrab - pstrsuma hrubkastr pkrytkrov vzajvzkrov - pokrPopul pkrRubus - pkrosuma pokrlnestr pkrlnekr pctdrstr lezstr pkrEuon pkrSamb pkrCratae vyskakor - pkrGeum - 0,03 0,04 0,05 nárůst MAE (a) nárůst RMSE (b) nárůst M A E Obrázek 16: Permutační významnost vysvětlujících proměnných modelu metody podpůrných vektorů pro hodnotu Shannonova indexu diverzity ptačího společenstva vyhodnocená na základě odhadu nárůstu RMSE a M A E oproti původnímu modelu při permutaci hodnot dané proměnné. Sedě úsečky představují 95% intervaly spolehlivosti. Názvy vysvětlujících proměnných viz příloha 1. 4.3 Závislost výskytu indikačních ptačích druhů na podmínkách prostředí 4.3.1 Výskyt kosa černého Jako vhodný model logistické regrese byl zvolen model popsaný rovnicí 4.3, kde pi je odhad pravděpodobnosti výskytu kosa na /-té lokalitě. Model obsahoval proměnné tlouštka suchých stromů, počet druhů stromů na lokalitě, vzájemná vzdálenost keřů, pokryvnost bylin celková a ostatních druhů bylin, pokryvnost ostatních druhů stromů a dále pokryvnost lopuchu, lísky, bezu, jilmu a kopřivy. Větší obvod suchých stromů a vyšší pokryvnost bylin snižují šanci na přítomnost kosa na lokalitě, zvyšující se hodnoty ostatních proměnných naopak šanci na přítomnost kosa na lokalitě zvyšují. = - 4,6011 - 0,9527hrusuchstn + 2,2$\5pctdrstri + 1,2398vzťijvzkrovi - QÁ35 Apkrytbyk + 0,1083pkrlnebyk (4.3) - 0,0935pokrlnestr•,• + 3,227SpkrArct ii + 0,5953pkrRhC on + 0,5059pkrSambi + 0, A\15pkrUlmusi + 0,3388pkrUnicai Za pět nejvýznamnějších proměnných pro model náhodného lesa byly na základě průměrné hodnoty SHAP hodnot lokalit z trénovacího datasetu v absolutní hodnotě označeny environmentálni proměnné pokryvnost křovin, celková pokryvnost stromů, pokryvnost holé půdy, pokryvnost hlohu a pokryvnost dalších druhů keřů (viz graf na obrázku Kapitola 4. Výsledky 37 2 5 •n O E d S 2,0 O O C > !Z C c- 1,5 1.0 lineární regresní model náhodný les neuronová síť metoda podpůrných vektorů 1.0 1,5 2,0 Shannonův index (testovací data) 2 5 Obrázek 17: Srovnání predikcí hodnot Shannonova indexu diverzity ptačího společenstva lokalit testovacího souboru získaných pomocí jednotlivých modelů. Dvě lokality, pro které model lineární regrese predikoval zápornou hodnotu Shannonova indexu, nejsou na grafu vyobrazeny. 18a). Podle A L E grafů z přílohy 10 vyšší pokryvnost keřů zvyšuje logaritmus šance, a tím i pravděpodobnost, přítomnosti kosa na lokalitě, a to zejména do cca 9 %, poté se velikost vlivu této proměnné lehce zmírňuje. Podobně je tomu tak vcelku logicky i u pokryvnosti hlohu a ostatních druhů keřů, v tomto případě od přibližně 5%, resp. 10%, pokryvnosti již další navyšování pokryvnosti zřejmě přílišný vliv nemá, případně dochází i k lehkému poklesu pravděpodobnosti přítomnosti kosa na lokalitě. Zvyšující se pokryvnost holé půdy má pozitivní vliv zejména v rozmezí cca 7-10 %, pokryvnost stromů pak v intervalu 80-115 %. Mimo tyto hodnoty dochází jen k malým změnám v modelovaném logaritmu šance přítomnosti kosa na lokalitě. Pro model neuronové sítě byly dle SHAP hodnot nejdůležitější proměnné tloušťka suchých stromů, výška bylin a stromů, počet druhů stromů na vetrolamu a pokryvnost trávy (obrázek 18b). A L E grafy (viz příloha 11) poukazují na negativní vliv zvětšující se tloušťky suchých stromů na logaritmus šance přítomnosti kosa na lokalitě. Tento vztahje až do cca 22,5 cm přibližně lineární, poté již vyšší hodnoty této proměnné, jak se zdá, nehrají roli. Naproti tomu výška bylinného patra i stromů a počet druhů stromů na lokalitě mají na přítomnost kosa na lokalitě pozitivní vliv. U pokryvnosti trávy nelze žádný výraznější trend vysledovat. Kapitola 4. Výsledky 38 ••<&fSHV •- •••• • - •• •••.«•.*}: ? ~fg»>-» ,10 -0,05 0,00 0,05 0,10 SHAP hodnota (a) model náhodného lesa •'•-•4>ÍJ»--:« • -0,1 0,0 0,1 SHAP hodnota hrusuchslr •í :• í •'.«••.• vyskabyl výskako r ** ! . * ' f H ' l ! ? . - v . - < w < S.'.í.'.-c: •• • ? . - v . - < w < S.'.í.'.-c: •• • pctdrstr * * • ? . - v . - < w < S.'.í.'.-c: •• • pkryttrava pkrytbyl •ŕŕi'fc.A. . pkryttrava pkrytbyl pkrylkrov podahola 1í*V*i> * * pkrU rtica ft •• - • pkrlnekr ••-H — ft •• - • pkrUlmus ••-H — ft •• - •pkľlnsbyl • H •• "d ».--pkrSamb • H •• "d ».-- pokrlneslr •i • H •H 1 K- L* pstrsuma •i • H •H 1 K- L* vzajvzk rov •i • H •H 1 K- L* pkrArtem i . . j n. h U. pkrCratae ... j n. h U. pkrArcti ... j n. h U. pkrRhCor -0,6 -0,4 -0,2 0,0 0,2 0,4 SHAP hodnota pkrCratae pkrUlmus pkrSamb podahola pkrl nebyl pkrArtem pkrRhCor hrusuchstr vzajvzk rov pkrytkrov pkrArcti pkrytbyl pctdrstr pkryttrava pstrsuma vyskabyl pokrlnestr pkrlnekr vyskakor pkrU rtica (b) model neuronové sítě » •• -nil'ii • - -*4 0,00 0,25 SHAP hodnota (c) model metody podpůrných vektorů (d) Bayesův klasifikátor Obrázek 18: SHAP hodnoty lokalit tónovacího datového souboru pro příslušné vysvětlující proměnné a významnost vysvětlujících proměnných pro modely přítomnosti kosa černého na lokalitách založená na SHAP hodnotách (žluté sloupce). Názvy vysvětlujících proměnných viz příloha 1. V případě modelu sestaveného pomocí metody podpůrných vektorů se mezi nejvýznamnější proměnné zařadila tlouštka suchých stromů, pokryvnost holé půdy, křovin, trávy a hlohu (viz graf na obrázku 18c). Grafické znázornění změn logaritmu šance přítomnosti kosa na lokalitě v závislosti na hodnotách environmentálních proměnných je předmětem přílohy 12 obsahující příslušné A L E grafy. Zejména zvětšující se obvod suchých stromů snižuje pravděpodobnost, resp. logaritmus šance přítomnosti kosa na lokalitě, méně výrazný negativní vliv má i pokryvnost trávy. Naopak pozitivní vliv na přítomnost kosa na lokalitě má dle modelu zvláště zvětšující se pokryvnost holé půdy, ale i hlohu. Ve druhém případě je však pozitivní závislost zřejmě jen do pokryvnosti cca 5 %, poté by se opět mohlo jednat o negativní závislost, takové lokality s vyšším zastoupením hlohu jsou však pouze dvě, a tak nelze tomuto naznačovanému vztahu přikládat přílišnou váhu. Změny v pokryvnosti křovin dle příslušného A L E grafu zřejmě nehrají výraznější roli. Kapitola 4. Výsledky 39 Podle významnosti proměnných založené na SHAP hodnotách znázorněné na obrázku 18d byly pro Bayesův klasifikátor nej významnější proměnné zaznamenávající pokryvnost hlohu, jilmu, bezu, holé půdy a ostatních druhů bylin. Přitom dle ALE grafů (viz příloha 13) mají všechny tyto proměnné na hodnotu logaritmu šance přítomnosti kosa na lokalitě pozitivní vliv. Zde by za zmínku mohl stát i negativní vliv zvětšující se tlouštky suchých stromů a zejména vzájemné vzdálenosti křovin. Ač tyto proměnné nebyly podle SHAP hodnot zařazeny mezi nejvýznamnější proměnné, dle A L E grafů přeci jen na výsledný logaritmus šance vliv mají. Srovnání modelů Žádná proměnná prostředí se neobjevila mezi pěticí nej významnějších proměnných pro všechny modely. Jak se zdá, vyšší pravděpodobnost přítomnosti kosa černého mají lokality s vyšší pokryvností holé půdy, kde je však v porostu v malé míře zastoupený hloh. Důležitá je zřejmě také dostatečná pokryvnost křovin jako takových, k ochotě kosa hnízdit ale může přispět i vyšší pokryvnost některých druhů bylin. Vhodná je také přítomnost jilmu a bezu a zastoupení více různých druhů stromů. Příliš velká pokryvnost trávy, která je umožněna spíše na lokalitách s menším zastoupením křovin, a přílišné stáří uschlých stromů kosa naopak odrazuje. To víceméně odpovídá tomu, že je kos černý považován za indikační druh hustých porostů. Na základě tabulky 6 shrnující vybrané metriky pro vyzkoušené modely lze konstatovat, že se v tomto případě jako nejvhodnější model přítomnosti kosa na lokalitě jeví model metody podpůrných vektorů, který má ze všech modelů nejvyšší přesnost i specificitu a také největší plochu pod ROC křivkou. Pouze senzitivitu má vyšší model neuronové sítě. Za nejhorší model lze naopak považovat model náhodného lesa, který dokonce v žádné sledované metrice nepředčí model logistické regrese. 4.3.2 Výskyt sýkory koňadry Vybraný model pro výskyt sýkory koňadry zahrnoval proměnné šířka vetrolamu, pokryvnost opadanky, pelyňku a kuklíku. Hodnoty regresních koeficientů jsou uvedeny v rovnici 4.4, kde pí je odhad pravděpodobnosti výskytu sýkory na /-té lokalitě. Všechny uvedené proměnné prostředí mají pozitivní vliv na logaritmus šance přítomnosti sýkory na vetrolamu. Tabulka 6: Tabulka metrik jednotlivých modelů při predikci přítomnosti kosa černého na lokalitách testovacího souboru. G L M - model logistické regrese, RF - náhodný les, N N neuronová síť, SVM - metoda podpůrných vektorů, B K - Bayesův klasifikátor. G L M RF NN SVM BK Přesnost 0,700 0,667 0,767 0,800 0,667 Senzitivita 0,667 0,583 0,917 0,833 0,667 Specificita 0,722 0,722 0,667 0,778 0,667 AUC 0,694 0,653 0,792 0,806 0,667 Kapitola 4. Výsledky 40 In í-Pi Pi )= - 6,1625 + 0,3101sirkai + 0,0508pkrythrabi (4.4) + 0,3506pkrArtem,- + 0,3223pkrGeunii Pro model náhodného lesa mezi pět nejvýznamnějších proměnných patřila šířka vetrolamu, počet druhů stromů, pokryvnost holé půdy, tlouštka suchých stromů a pokryvnost topolu (obrázek 19a). Na základě A L E grafů zobrazených v příloze 14 lze očekávat, že širší vetrolamy budou mít vyšší pravděpodobnost přítomnosti sýkory, od cca 17 metrů již ale větší šířka vliv nemá. Také rostoucí počet druhů stromů zejména v rozmezí cca tří až čtyř má na přítomnost sýkory na vetrolamu pozitivní vliv. Naproti tomu již malá pokryvnost holé půdy na vetrolamu sýkoře nevyhovuje. Do přibližně 35 % pokryvnosti topolu pak opět pravděpodobnost výskytu sýkory na vetrolamu roste. Zvětšující se obvod kmenů suchých stromů má pozitivní vliv od cca 9 centimetrů, do této hodnoty je ale vliv této proměnné naopak negativní. Lze ještě zmínit, že podobný průběh má proměnná vypovídající o obvodu kmenů živých stromů. V případě modelu neuronové sítě se mezi nejdůležitější vysvětlující proměnné zařadila šířka vetrolamu, pokryvnost opadanky, pokryvnost topolu a holé půdy a tlouštka suchých stromů (obrázek 19b). Šířka vetrolamu má na přítomnost sýkory opět pozitivní vliv, stejně tak je tomu i u pokryvnosti opadanky a topolu. Zvyšující se pokryvnost holé půdy pak působí negativně. Větší obvod kmenů suchých stromů má spíše mírně pozitivní vliv, a to do přibližně 16 cm, poté se vliv této proměnné mění na spíše negativní (viz A L E grafy přílohy 15). Mezi nejvýznamnější proměnné pro model metody podpůrných vektorů se zařadily proměnné šířka vetrolamu a pokryvnosti opadanky, topolu, keřů javoru a růže (obrázek 19c). Všechny tyto vysvětlující proměnné dle příslušných A L E grafů se svojí rostoucí hodnotou zvyšují logaritmus šance přítomnosti sýkory na vetrolamu (viz příloha 16). Proměnné pokryvnost keřů javoru, kuklíku, lísky, pelyňku a topolu byly vybrány mezi nejdůležitější proměnné pro Bayesův klasifikátor (obrázek 19d). Dle A L E grafů uvedených v příloze 17 má vyšší pokryvnost keřů javoru a pokryvnost topolu pozitivní vliv na přítomnost sýkory na lokalitě, u pokryvnosti kuklíku, lísky a pelyňku je jejich vliv nejprve pozitivní, po dosažení určité procentuální pokryvnosti (přibližně 2,5, 16 a 4,5 %) již spíše logaritmus šance výskytu sýkory mírně snižují. Srovnání modelů Sýkoru koňadru jakožto dutinového hnízdiče lze očekávat spíše na dostatečně širokých větrolamech s přítomností topolu. Důležitá je rovněž přítomnost tlustších suchých stromů. Naopak nevhodnejšou pro ni lokality s vysokou pokryvnosti holé půdy, na zemi by tak měla být přítomná opadanka, případně nějaké byliny a keře. Mělo by se tedy jednat o vetrolamy se starším porostem stromů, ve kterých se pak mohou nacházet dutiny vhodné ke hnízdění. Dle údajů uvedených v tabulce 7 si u všech sledovaných metrik při predikci přítomnosti sýkory koňadry na lokalitách testovacího datasetu vedl nejlépe model neuronové sítě. Kapitola 4. Výsledky 41 sirka pctdrstr podahola ,i y.i ;v,*i* sirka pctdrstr podahola sirka pctdrstr podahola pokrPopul •*. hrusuchstr * * .V J*. * " •*/•** VpkrAcer pkrythrab w k ^ é " •*/•** V pkrArtem * . Tí,*- .•.. * ^ vyskakor bazplocha pkrCralae s ^rbazplocha pkrCralae pkrLigus pstrsuma pkrRosa t > * pkrKnoor pkrRubus hrubkastr pkrArcti pbylsuma pkrGeum pbylsuma pkrGeum -0.10 -0,05 0,00 0,05 SHAP hodnota (a) model náhodného lesa sirka pkrythrab **-í á*S*.*K* t. T * » i sirka pkrythrab fft JljiV i> . . J a k . pokrPopul pkrAcer fft JljiV i> . . J a k . pokrPopul pkrAcer pkrRosa hrubkastr vyskakor pkrRosa hrubkastr vyskakor podaholapodahola pctdrstr bazplocha pkrArtem hrusuchstr pkrRubus hrusuchstr pkrRubus pkrCratae pkrGeum pkrCratae pkrGeum pstrsuma pbylsuma pkrLigus pkrArcti pkrRhCor pkrArcti pkrRhCor -0 2 -0 1 0,0 0,1 0,2 0,3 (c) model metody podpůrných vektorů sirka pkrythrab ****** pokrPopul podahola pokrPopul podahola hrusuchstr pctdrstr • • • pkrLigus pkrArtem pkrRosa bazplocha pkrRhCor bazplocha pkrRhCor pkrRubus pbylsuma pkrCratae pkrAcer pkrArcti pkrAcer pkrArcti pkrGeum vyskakor hrubkastr pstrsuma hrubkastr pstrsuma 0,0 0,4 SHAP hodnota (b) model neuronové sítě 1 A pkrAcer • • • pkrGeum • • •pkrhíhoor • • • pkrArtem pokrPopul sirka pkrythrab vyskakor pkrythrab vyskakor hrubkastr pkrArcti pkrRubus bazplocha pkrLigus pstrsuma bazplocha pkrLigus pstrsuma bazplocha pkrLigus pstrsuma pctdrstr pkrRosa pkrCratae pbylsuma hrusuchstr podahola -0,25 0: 30 0,25 0,50 0,75 SHAP hodnota (d) Bayesův klasifikátor Obrázek 19: SHAP hodnoty lokalit tónovacího datového souboru pro příslušné vysvětlující proměnné a významnost vysvětlujících proměnných pro modely přítomnosti sýkory koňadry na lokalitách založená na SHAP hodnotách (žluté sloupce). Názvy vysvětlujících proměnných viz příloha 1. Nejhůře si pak vedl Bayesův klasifikátor, horší specificitu než on však měl model logistické regrese. Tabulka 7: Tabulka metrik jednotlivých modelů při predikci přítomnosti sýkory koňadry na lokalitách testovacího souboru. G L M - model logistické regrese, RF - náhodný les, N N - neuronová síť, S V M - metoda podpůrných vektorů, B K - Bayesův klasifikátor. G L M RF NN SVM BK Přesnost 0,633 0,733 0,900 0,700 0,567 Senzitivita 0,688 0,688 0,875 0,750 0,375 Specificita 0,571 0,786 0,929 0,643 0,786 AUC 0,630 0,737 0,902 0,696 0,580 Kapitola 4. Výsledky 42 4.3.3 Výskyt bažanta obecného Proměnné zahrnuté do výsledného zobecněného lineárního modelu pro modelování přítomnosti bažanta obecného na větrolamech a odhady příslušných regresních koeficientů jsou uvedeny v rovnici 4.5, kde pi je odhad pravděpodobnosti výskytu bažanta na /-té lokalitě. Logaritmus šance přítomnosti bažanta na vetrolamu tedy zvyšuje vyšší pokryvnost holé půdy, pokryvnost pcháče a hlohu. Negativní efekt pak mají zvyšující se hodnoty bazálni plochy stromů, pokryvnosti kopřivy a druhé mocniny pokryvnosti pcháče. ( Pi \ ln \ — =1,6769 — 0,0003bazplochai + 0, \6A6podaholai (4 5) + 1,9642pkrCarCiri —1,6316pkrCarCirf + 1,0422pkrCrataei — 0, \ 329pkrUrticai Mezi nej důležitější proměnné pro model náhodného lesa se dle SHAP hodnot zařadila bazálni plocha stromů, vzájemná vzdálenost stromů a jejich tlouštka, pokryvnost hlohu a pokryvnost ostatních druhů keřů (viz graf na obrázku 20a). Na základě A L E grafů přílohy 18 lze říci, že na přítomnost bažanta na lokalitě má rostoucí bazálni plocha stromů i větší obvod kmenů stromů negativní vliv. Dále vyšší pokryvnost hlohu i jiných druhů křovin má naopak pozitivní vliv, a to zejména přibližně do pokryvnosti 10 %. Rostoucí vzdálenost mezi stromy působí na logaritmus šance přítomnosti bažanta na lokalitě do přibližně 2 m pozitivně, poté je vliv této proměnné negativní. Pro model neuronové sítě patřily mezi nej významnější proměnné opět bazálni plocha stromů, dále výška nižší křovinné etáže, pokryvnost holé půdy, kopřiv a růže (obrázek 20b). Nižší hodnoty logaritmu šance přítomnosti bažanta by měly mít vetrolamy s větší bazálni plochou stromů a vyšším nadzemním křovinným patrem, podobně je tomu i u vyšší pokryvnosti kopřiv. Zde má ale stoupající pokryvnost negativní vliv do cca 14 %, poté se již modelovaný logaritmus šance dle A L E grafu nemění. Vyšší pokryvnost holé půdy a růže má naopak pozitivní vliv (viz příloha 19). Podle metody podpůrných vektorů byly nej důležitější proměnné bazálni plocha stromů, výška nižší křovinné etáže, pokryvnost holé půdy, kopřiv a jasanu (obrázek 20c). Bazálni plocha stromů, výška nižší křovinné etáže i pokryvnost kopřivy mají v tomto případě dle ALE grafů z přílohy 20 opět negativní vliv a pokryvnost holé půdy i jasanu mají naopak pozitivní vliv na přítomnost bažanta na lokalitě. Pro Bayesův klasifikátor pak byly nej významnější pokryvnosti holé půdy, hlohu, jasanu, brslenu a ostatních druhů křovin (obrázek 20d). Rostoucí pokryvnost holé půdy, jasanu i ostatních druhů křovin by však dle A L E grafů uvedených v příloze 21 mohla mít zřejmě pouze slabý pozitivní vliv na logaritmus šance přítomnosti bažanta na lokalitě v porovnání s jinými vysvětlujícími proměnnými. Pokryvnost hlohu a brslenu má pravděpodobně na přítomnost bažanta větší vliv, který je však rovněž pozitivní. Od cca 9% pokryvnosti hlohu se však modelovaná hodnota logaritmu šance již nemění. Kapitola 4. Výsledky. .43 bazplocha .... . ... . •.•ífVí.w.t * pkrCratae pkrlnekr vzajvzstr -4* Vi • lfj#* hrubkastr pocsustr / t, «* .s pkrEuon pokrFrax podahola lezstr pkrCarCir lezstr pkrCarCir pkrRosa hrusuchstr •>••>•.*•««.<•«•* •-*^iiíí.-jf.-.i-- pkrosuma •>••>•.*•««.<•«•* •-*^iiíí.-jf.-.i-- pkrl nebyl •>••>•.*•««.<•«•* •-*^iiíí.-jf.-.i-- pkrU rtica vyskavk rov J...J Vií^ftt*í* . • • výskankro "WW™ *? * pkrytk rov pkrLigus -0,05 0,00 0,05 SHAP hodnota 0,10 (a) model náhodného lesa podahola pkrU rtica pokrFrax bazplocha výskankro pkrEuon pkrRosa pkrCratae pkrCarCir hrubkastr lezstr pkrytk rov hrusuchstr pkrlnekr pkrlnebyľ pkrosuma vzajvzstr vyskavkrov pocsustr pkrLigus -0,1 0,0 0,1 SHAP hodnota (c) model metody podpůrných vektoru p k rU rtica bazplocha pkrRosa vyskankro podahola pkrlnebyľ hrubkastr pkrCratae pokrFrax pkrLigus- pkrEuon hrusuchstr vyskavkrov lezstr pkrytk rov pkrCarCir pocsustr pkrlnekr pkrosuma vzajvzstr pkrCratae pkrEuon pokrFrax podahola pkrlnekr pkrLigus bazplocha pkrlnebyľ pkrCarCir- hrubkastr hrusuchstr vzajvzstr pkrosuma lezstr vyskavkrov pkrRosa pkrytk rov p k rU rtica pocsustr vyskankro 'ti-jB****.. -0,3 0,0 SHAP hodnota .-..-i.» 0,3 (b) model neuronové sítě 0,25 0,50 SHAP hodnota (d) Bayesův klasiŕikátor Obrázek 20: SHAP hodnoty lokalit tónovacího datového souboru pro příslušné vysvětlující proměnné a významnost vysvětlujících proměnných pro modely přítomnosti bažanta obecného na lokalitách založená na SHAP hodnotách (žluté sloupce). Názvy vysvětlujících proměnných viz příloha 1. Srovnání modelů Bažant obecný coby druh otevřených prostor tedy zřejmě vyhledává spíše vetrolamy s mladším porostem stromů a menším zastoupením porostu blízko země. Vhodná je dostatečná pokryvnost holé země a co nejmenší výška nižšího křovinného patra. Nevyhovují mu také porosty s výskytem kopřiv, naopak mu však zřejmě nevadí rozumné zastoupení hlohu, ostatních druhů křovin či jasanu. Na základě hodnot v tabulce 8 je možné říci, že si v tomto případě nejlépe vedl model logistické regrese s výjimkou senzitivity, kdy jej předčila neuronová síť. Shodná specificita s logistickou regresí pak byla obdržena pomocí Bayesova klasifikátoru. Nejhůře si v tomto případě u všech sledovaných metrik vedl model náhodného lesa. Kapitola 4. Výsledky 44 Tabulka 8: Tabulka metrik jednotlivých modelů při predikci přítomnosti bažanta obecného na lokalitách testovacího souboru. G L M - model logistické regrese, RF - náhodný les, N N - neuronová síť, SVM - metoda podpůrných vektorů, B K - Bayesův klasifikátor. G L M RF NN SVM BK Přesnost 0,767 0,600 0,733 0,733 0,667 Senzitivita 0,733 0,533 0,800 0,733 0,533 Specificita 0,800 0,667 0,667 0,733 0,800 AUC 0,767 0,600 0,733 0,733 0,667 5 Diskuze Vetrolamy vhodné velikosti a struktury by měly v zemědělských oblastech přispívat k vyšší diverzitě ptačích společenstev [Kinross, 2004]. Obsahem této kapitoly je zhodnocení výsledků modelování vztahů mezi ptačími společenstvy a prostředím vetrolamu, ve kterých se tato společenstva nacházela, s následným porovnáním zjištění s dostupnou literaturou. Nalezené souvislosti mezi ptačími společenstvy a zkoumanými charakteristikami lze zvážit při péči o vetrolamy v krajině i plánování nových vetrolamu. Dále zde jsou srovnány použité modely, zhodnoceny limitace postupu tvorby modelů a nastíněny možnosti pro možné navazující práce. 5.1 Zhodnocení výsledků modelování Dle výsledků modelů má na počet druhů na větrolamech pozitivní vliv zejména jejich šířka a vzájemná vzdálenost stromů, jejichž pokryvnost by měla být dostatečná, vhodná je zřejmě přiměřená pokryvnost topolu a malý výskyt křovin. Nevadí zde přítomnost ležících stromů, ležící křoviny jsou ale spíše nežádoucí. Hodnotu Shannonova indexu biodiverzity ptačích společenstev zkoumaných vetrolamu pozitivně ovlivňuje dostatečná vzájemná vzdálenost stromů a větší výška nižšího křovinného patra. Křoviny by naopak měly být spíše hustší s decentní přítomností hlohu. Vhodnější je také spíše mladší stromový porost, přičemž není nutné snažit se o co největší druhovou pestrost, samotný vetrolam by pak měl být opět dostatečně široký. Zařazení šířky vetrolamu mezi významné proměnné je v souladu se závěry některých studií, dle kterých je mezi ní nebo rozlohou vetrolamu a druhovou bohatostí či diverzitou také pozitivní vztah [Cable a kol., 1992, Schroeder a kol., 1992, Kinross, 2004]. Stejně tak diverzita ptačích společenstev dle modelů nezávisela na druhové rozmanitosti stromů lineárně, ale měla vliv spíše jen do určitého počtu různých druhů stromů. Většina druhů ptáků v těchto oblastech totiž není závislá na přítomnosti daného rostlinného druhu a dokáží se tak relativně snadno přizpůsobit více různým druhům [MacArthur a MacArthur, 1961]. Nepodařilo se však jednoznačně prokázat pozitivní vztah mezi diverzitou ptačích společenstev a pestrým zastoupením různých výšek olistění, který uvádí autoři některých studií, např. [Karr a Roth, 1971, Clawges a kol, 2008]. Pro přítomnost kosa černého na lokalitě je důležitá dostatečná pokryvnost křovin, ve kterých by měl být zastoupený hloh, bez a keře jilmu, naopak tomuto ptačímu druhu nevyhovuje vysoká pokryvnost trávy a bylin, místo toho upřednostňuje lokality s holou -45- Kapitola 5. Diskuze 46 půdou, mělo by se tedy jednat o vetrolamy s hustšími porosty křovin, které neumožňují růst trávy a bylin, což odpovídá tomu, že je kos druhem hustých porostů. V případě přítomnosti suchých stromů na větrolamech by měly být tyto spíše tenké. Sýkora koňadra pak vyhledává dostatečně široké vetrolamy s přítomností topolu a vyšší pokryvností opadanky. Naopak jí nevyhovují vetrolamy s přílišným výskytem holé půdy a spíše upřednostní výskyt nějakých bylin a keřů. Přítomné suché stromy by taktéž měly být přiměřeně tlusté. Mělo by se tedy zřejmě jednat spíše o vetrolamy se starším porostem stromů, ve kterých se pravděpodobněji budou vyskytovat příhodné dutiny, které by mohla coby dutinový hnízdič využívat. Dle autorů některých studií by měla přítomnost kosa a sýkory na lokalitě souviset s variabilitou výšky vegetace či výškou stromů [Kinross a Nicol, 2008, Múller a kol., 2009, Eldegard a kol., 2014], tento vztah se pro daná data vesměs podařilo zprostředkovaně prokázat skrze jiné proměnné (např. důležitostí přítomnosti různých druhů keřů). Vetrolamy vhodné pro bažanta obecného se pak vyznačují spíše mladším porostem stromů a nepříliš vyvinutým porostem při zemi, což odpovídá tomu, že se jedná o druh otevřených prostor. Nevyhovují mu porosty se zastoupením kopřiv, naopak vhodná je však přítomnost hlohu, či jiných křovin. To by mohlo souviset s jeho potřebou možnosti úkrytu před predátory, kteří je ve větrolamech mohou snáze ulovit [Cable, 1999]. Jak si lze povšimnout, nej důležitější vysvětlující proměnné se pro jednotlivé modely často velmi liší, málokterá proměnná je mezi pěti nej významnějšími proměnnými pro všechny modely. Při interpretaci každého z modelů jednotlivě by tedy bylo často možné dojít k mírně odlišným závěrům. Lze však vysledovat, že při modelování diverzity ptačího společenstva byly vybírány spíše proměnné charakterizující strukturu vegetace vetrolamu než proměnné popisující zastoupení různých rostlinných druhů, což je víceméně v souladu s některými jinými studiemi [MacArthur a MacArthur, 1961, Múller a kol., 2010], při modelování přítomnosti jednotlivých indikačních ptačích druhů byly pokryvností jak obecnějších prvků vegetace (např. opadanky či trávy), tak i konkrétních rostlinných druhů řazeny mezi nej významnější vysvětlující proměnné mnohem častěji. To by ale mohlo být způsobeno i použitím jiné metody při hodnocení významnosti proměnných. Při zvoleném postupu tvorby jednotlivých modelů a jejich nastavení si na základě metrik použitých pro srovnání modelů na těchto datech nejlépe vedly modely neuronové sítě a metody podpůrných vektorů. Kromě modelování přítomnosti bažanta obecného na vetrolamu, pro něž byla logistická regrese nejvhodnější, byl model zastupující tradiční metody vždy mezi nejhoršími modely, nikterak oslnivě si nevedl ani Bayesův klasifikátor. Vhodným přístupem při modelování tohoto datového souboru by tedy mohla být metoda neuronové sítě, která díky mnoha možnostem nastavení hyperparametrů (zejména počtu vrstev a neuronů v nich) představuje velmi flexibilní nástroj a s velkou pravděpodobností bude možné u ní dosáhnout ještě lepších výsledků. Stále se však nejedná o naprosto univerzální přístup a pořád je tak adekvátní doporučení vyzkoušet více různých přístupů, které mohou poskytnout rozličné pohledy na zkoumaná data (podobně viz [Fielding, 1999, Kosicki, 2020]). " Kapitola 5. Diskuze 5.2 Některé limitace zvoleného postupu tvorby modelů 47 V průběhu vytváření jednotlivých modelů bylo možné volit z více možností dalšího postupu. Konečná volba mohla ve většině případů následně ovlivnit jak významnost proměnných prostředí pro jednotlivé modely, tak i jejich výslednou predikční schopnost na testovacích datech. Určitou limitací také byla snaha přistupovat ke všem modelům co nejshodněji tak, aby rozdílnost přístupů neovlivnila nějakým způsobem následné porovnávání modelů. V první řadě by vhodnějším přístupem k dělení datového souboru na trénovací a testovací mohla být namísto predikčního testování externí validací, které sice poskytuje nezávislý trénovací a testovací datový soubor, výsledky však velmi závisí na výběru tónovacích dat, ^-násobná křížová validace, která zmíněný problém zvolené metody dělení dat řeší, na druhou stranu by tento přístup mohl značně zkomplikovat následnou interpretaci neboť v extrémním případě by pro každé dělení souboru mohly být pro stejnou metodu a vysvětlovanou proměnnou jiné nej významnější proměnné prostředí. Žádoucí by taktéž bylo rozdělit datový soubor na trénovací, validační a testovací, s ohledem na počet pozorování v datovém souboru však od tohoto dělení bylo upuštěno, nabízela se zde však i možnost využití náhodného výběru s opakováním (bootstrap), i při použití této metody jsou ale výsledky stále závislé na výběru tónovacích dat. Určitou roli rovněž hrál i proces předvýběru a selekce proměnných prostředí pro samotné modelování. Kromě náhodného lesa by bylo možné použít například různé regularizační techniky, jako je regrese s elastickou sítí, využití ordinačních metod (např. analýzy hlavních komponent) či jiné metody strojového učení. Použití jednorozměrných metod by pro tato data nemuselo být adekvátní, vzhledem ke komplexnosti vazeb mezi proměnnými. Ideálním přístupem by v tomto kroku mohlo být použití více různých metod a následné zkombinování jejich výsledků. Použití stepwise procedury při hledání nejlepšího modelu lineární a logistické regrese také nemusí být úplně šťastné, zvláště pokud byly nejprve použity původní proměnné prostředí bez jakýchkoli transformací, nejvyšší šanci na zařazení do výsledného modelu tak měly proměnné s lineárním vztahem s vysvětlovanou proměnnou a procedura nemohla korektně vyhodnotit nelineární vztahy, na druhou stranu zahrnutí všech možných transformací proměnných, tedy nejen např. jejich druhých mocnin, včetně různých interakcí se rovněž nezdálo být optimálním přístupem. Zahrnutí interakcí navíc u regresních modelů nakonec nebylo uvažováno, protože jejich zahrnutí vedlo na zbytečně velké a složité modely, které by bylo možné interpretovat jen stěží. Podobný přístup však zvolili i autoři některých studií, v rámci kterých byly porovnávány regresní modely s metodami strojového učení [Elith a kol., 2006, Eldegard a kol, 2014, Valavi a kol, 2022]. Co se týče nastavení hyperparametrů jednotlivých modelů strojového učení, byl zde použit poměrně primitivní přístup. Protože však bylo rozhodnuto pokusit se o co nejlepší srovnání použitých metod, nebyla použita žádná optimalizační metoda, kterou použitý sofware nabízí, zejména z důvodu ne vždy transparentního nastavení některých hyperparametrů. Vhodné příliš není ani použití testovacího datasetu jakožto validační datové sady při hledání nejlepšího nastavení parametrů. Kapitola 5. Diskuze 5.3 Návrhy pro navazující práce 48 Jako vhodné rozšíření stávající práce se nabízí zejména použití různých modifikací zvolených metod strojového učení a následné porovnání i s dalšími metodami strojového učení, zde se nabízí například genetické algoritmy či bayesovské sítě. Při porovnávání jednotlivých modelů by pak také mohly být využity i další metriky. Některé z metod strojového učeníjsou tzv. black box modely a samy o sobě neposkytují žádnou interpretovatelnou rovnici apod. (např. neuronové sítě a metoda podpůrných vektorů). Takové modely jsou pak sice vhodné pro predikci, při snaze pochopit vztahy mezi biologickými společenstvy a jejich prostředím by však příliš užitečné nebyly. V poslední době však naštěstí vznikají metody odstraňující tuto překážku využívání daných metod strojového učení, jako je permutační významnost proměnných, SHAP metoda či A L E grafy použité v této práci. Kromě vyvinutí dalších podobných metod umožňujících snazší interpretaci modelů by bylo rovněž vhodné příslušné metody na ekologických datech porovnat, zejména pak z hlediska možnosti jejich záměny, případně i s metodami specifickými pro některé modely (například hodnocení významnosti vysvětlujících proměnných pro model náhodného lesa založené na Gini indexu). Kromě významnosti vysvětlujících proměnných a jejich vlivu na výstup modelů je možné se zaměřit i na metody hodnocení interakcí mezi proměnnými, příkladem může být metoda založená na Friedmanově H-statistice [Molnar, 2019]. Dalším krokem by rovněž mohlo být, za využití patřičných metod, modelování vztahů mezi prostředím a ptačím společenstvem jako celkem. Závěr Tato diplomová práce se věnovala využití metod strojového učení při modelování vztahů mezi ptačími společenstvy a podmínkami prostředí, ve kterém tato společenstva žijí. Hlavním cílem přitom bylo prostřednictvím rešerše patřičných modelů vybrat vhodnou metodu, která pak byla následně aplikována na reálná data z monitoringu ptačích společenstev liniových porostů jihozápadního Slovenska. Takto získané výsledky byly posléze vhodným způsobem vyhodnoceny a zjištěné vztahy mezi ptačími společenstvy a jejich prostředím také interpretovány. Pro modelování byly vybrány náhodné lesy, neuronové sítě, metoda podpůrných vektorů a Bayesův klasifikátor. Pro porovnání těchto metod strojového učení byly sestaveny též lineární regresní modely a modely logistické regrese. S pomocí těchto metod byla modelována druhová bohatost společenstev, Shannonův index biodiverzity společenstev a přítomnost indikačních druhů kosa černého, sýkory koňadry a bažanta obecného na lokalitách trénovacího datového souboru. Modely byly interpretovány za pomoci permutační významnosti proměnných prostředí, významnosti proměnných prostředí založené na SHAP hodnotách a A L E grafů izolovaného vlivu dané proměnné prostředí na výstup modelu. Srovnání modelů pak proběhlo za pomoci střední čtvercové chyby predikce, střední absolutní chyby predikce při modelování počtu druhů společenstev ajejich hodnoty Shannonova indexu diverzity a prostřednictvím srovnání celkové přesnosti modelů, jejich senzitivity, specificity a AUC vyhodnocených pomocí predikce na testovacím datovém souboru. Při modelování druhové bohatosti a hodnoty Shannonova indexu biodiverzity ptačích společenstev byla mezi nej významnějšími proměnnými pro některé modely zařazena šířka vetrolamu, což koresponduje se závěry autorů jiných studií. Vztah s heterogenitou výšky olistění se však nepodařilo uspokojivě prokázat. Při modelování přítomnosti vybraných indikačních ptačích druhů pak výsledné modely víceméně odpovídaly prostředím, které těmto druhům vyhovují, oproti závěrům autorů některých studií se však nepodařilo nalézt přímou souvislost výskytu kosa a sýkory s výškou stromů. Pro zkoumané modely se často nejvýznamnější proměnné lišily, nelze ani jednoznačně doporučit obecně nejlepší metodu pro zpracování zkoumaných dat. Nejlépe si však vedly modely neuronové sítě a metody podpůrných vektorů, tradičně používané metody spíše zaostávaly. Výjimku tvořilo modelování přítomnosti bažanta na větrolamech, kde kromě senzitivity neuronové sítě byla logistická regrese lepší než ostatní metody strojového učení. Bayesův klasifikátor se pro tato data neukázal jako nejvhodnější model. Vhodné by tedy mohlo být použití neuronové sítě zejména z důvodu její velké flexibility při nastavování -49- Závěr 50 její struktury i dalších hyperparametrů. Diskutovány byly také limitace této práce vztažené především na postup při vytváření jednotlivých modelů. Následně byly také nastíněny možnosti pro navázání na tuto práci. Celkově se metody strojového učení ukazují jako velmi vhodné pro modelování vztahů mezi biologickými společenstvy a jejich prostředím. Mírně problematická a zatím stále trochu limitující je interpretovatelnost některých z nich. V poslední době vzniklo několik metod umožňujících lépe popsat a pochopit i jinak neinterpretovatelné metody, pro efektivnější využívání metod strojového učení nejen v ekologických studiích by však bylo vhodné repertoár těchto nástrojů ještě rozšířit. Seznam zkratek A L E acumulated local effects AUC area under curve; plocha pod ROC křivkou BK Bayesův klasifikátor G L M generalized linear model; zobecněný lineární model (zde logistická regrese) M A E mean absolute prediction error, střední absolutní chyba predikce NN neuronová síť RF random forest; náhodný les RMSE root mean square prediction error; střední čtvercová chyba predikce ROC receiver operating characteristics SHAP SHapley Additive explanations S V M support vector machine; metoda podpůrných vektorů -51- Seznam obrázků 1 Schéma jednoduchého rozhodovacího stromu pro klasifikaci lokalit z hlediska přítomnosti hnízdícího kosa černého 12 2 Schéma biologického neuronu 14 3 Schéma umělého neuronu 14 4 Schéma nalezené hranice (černá plná čára) metody podpůrných vektorů rozdělující datové body lineárně separabilních tříd na dvě skupiny v prostoru dvou vysvětlujících proměnných 15 5 Schéma znázorňující použitý obecný postup tvorby modelů 18 6 Krabicové grafy proměnných prostředí datového souboru 27 7 Histogramy vysvětlovaných proměnných počet druhů na lokalitě a hodnota Shannonova indexu diverzity ptačího společenstva 28 8 Grafické znázornění Spearmanova koeficientu korelace pro 15 nejkorelovanějších dvojic proměnných prostředí. Všechny závislosti jsou kladné. . 29 9 Příklad zjevně nelineárního vztahu proměnné prostředí popisující výšku nižší křovinné etáže v cm a Shannonova indexu diverzity ptačího společenstva 29 10 Permutační významnost vysvětlujících proměnných modelu náhodného lesa pro počet druhů na lokalitě vyhodnocená na základě odhadu nárůstu PvMSE a M A E oproti původnímu modelu při permutaci hodnot dané proměnné 30 11 Permutační významnost vysvětlujících proměnných modelu neuronové sítě pro počet druhů na lokalitě vyhodnocená na základě odhadu nárůstu RMSE a M A E oproti původnímu modelu při permutaci hodnot dané proměnné. . 31 12 Permutační významnost vysvětlujících proměnných modelu metody podpůrných vektorů pro počet druhů na lokalitě vyhodnocená na základě odhadu nárůstu PvMSE a M A E oproti původnímu modelu při permutaci hodnot dané proměnné 32 13 Srovnání predikcí počtu druhů na lokalitách testovacího souboru získaných pomocí jednotlivých modelů 33 14 Permutační významnost vysvětlujících proměnných modelu náhodného lesa pro hodnotu Shannonova indexu diverzity ptačího společenstva vyhodnocená na základě odhadu nárůstu PvMSE a M A E oproti původnímu modelu při permutaci hodnot dané proměnné 34 -52- Seznam obrázků 53 15 Permutační významnost vysvětlujících proměnných modelu neuronové sítě pro hodnotu Shannonova indexu diverzity ptačího společenstva vyhodnocená na základě odhadu nárůstu RMSE a M A E oproti původnímu modelu při permutaci hodnot dané proměnné 35 16 Permutační významnost vysvětlujících proměnných modelu metody podpůrných vektorů pro hodnotu Shannonova indexu diverzity ptačího společenstva vyhodnocená na základě odhadu nárůstu RMSE a M A E oproti původnímu modelu při permutaci hodnot dané proměnné 36 17 Srovnání predikcí hodnot Shannonova indexu diverzity ptačího společenstva lokalit testovacího souboru získaných pomocí jednotlivých modelů. . 37 18 SHAP hodnoty lokalit trénovacího datového souboru pro příslušné vysvětlující proměnné a významnost vysvětlujících proměnných pro modely přítomnosti kosa černého na lokalitách založená na SHAP hodnotách. . . 38 19 SHAP hodnoty lokalit trénovacího datového souboru pro příslušné vysvětlující proměnné a významnost vysvětlujících proměnných pro modely přítomnosti sýkory koňadry na lokalitách založená na SHAP hodnotách. . 41 20 SHAP hodnoty lokalit trénovacího datového souboru pro příslušné vysvětlující proměnné a významnost vysvětlujících proměnných pro modely přítomnosti bažanta obecného na lokalitách založená na SHAP hodnotách. 43 Seznam tabulek 1 Shrnutí použitých metod 24 2 Sumární statistiky vysvětlovaných proměnných počet druhů na lokalitě a hodnota Shannonova indexu diverzity 26 3 Počty lokalit podle přítomnosti indikačního druhu 28 4 Tabulka RMSE a M A E jednotlivých modelů při predikci počtu druhů na lokalitách testovacího souboru 32 5 Tabulka RMSE a M A E jednotlivých modelů při predikci hodnoty Shannonova indexu diverzity ptačího společenstva lokalit testovacího souboru. . 35 6 Tabulka metrik jednotlivých modelů při predikci přítomnosti kosa černého na lokalitách testovacího souboru 39 7 Tabulka metrikjednotlivých modelů při predikci přítomnosti sýkory koňadry na lokalitách testovacího souboru 41 8 Tabulka metrikjednotlivých modelů při predikci přítomnosti bažanta obecného na lokalitách testovacího souboru 44 -54- Seznam použité literatury Apley D., 2018: ALEPlot: Accumulated Local Effects (ALE) Plots and Partial Dependence (PD) Plots [online]. R package version 1.1 [cit. 12. 5. 2023]. Dostupne z: https://CRAN.R-proj ect.org/package=ALEPlot. Apley D. W., Z H U J., 2020: Visualizing the Effects of Predictor Variables in Black Box Supervised Learning Models. Journal of the Royal Statistical Society Series B: Statistical Methodology [online]. 82(4), 1059-1086 [cit. 22. 3. 2023]. ISSN 1369-7412. DOI: 10.1111/rssb. 12377. Aspinall R., Veitch N., 1993: Habitat Mapping from Satellite Imagery and Wildlife Survey Data Using a Bayesian Modeling Procedure in a GIS. Photogrammetric Engineering & Remote Sensing [online]. 59(4), 537-543 [cit. 6. 5. 2023]. Dostupne z: h t t p s : //www.asprs.org/wp-content/uploads/pers/1993j ournal/apr/1993_apr_537 -543.pdf. Awad M., Khanna R., 2015: Support Vector Regression. In: Awad, M., Khanna R., Efficient Learning Machines [online]. Apress, Berkeley, CA, pp. 67-80 [cit. 1. 5. 2023]. ISBN 978-1-4302-5989-3. DOI: 10.1007/978-l-4302-5990-9_4. Begon M., Townsend C. R., Harper J. L., 2006: Ecology: From Individuals to Ecosystems. 4th ed. Blackwell Publishing, pp. 750. ISBN 978-1405111171. Breiman L., 2001: Random Forests. Machine Leearning [online]. Kluwer Academic Publishers. 45(1), 5-32 [cit. 30. 4. 2023]. DOI: 10.1023/ a: 1010933404324. Cable T. T., Schroeder R. L., Brack V , Jr., Cook P. S., 1992: Summer Bird Use of Kansas Windbreaks. Prairie Naturalist [online]. 24(3), 175-184 [cit. 6. 5. 2023]. Dostupne z: https://www.researchgate.net/profile/Virgil-Brack/publication/25914 6597_Summer_bird_use_of_Kansas_windbreaks/links/5501afc60cf24cee39f8 65d3/Summer-bird-use-of-Kansas-windbreaks.pdf. Cable T. T., 1999: Nonagricultural Benefits of Windbreaks in Kansas. Great Plains Research [online]. 9(1), 41-53 [cit. 6. 5. 2023]. Dostupne z: https : //www. jstor. org/st able/23777880. Clawges R., Vierling K , Vierling L., Rowell E., 2008. The use of airborne lidar to assess avian species diversity, density, and occurrence in a pine/aspen forest. Remote Sensing -55- Seznam použité literatury 56 of Environment [online]. 112(5), 2064-2073 [cit. 6. 5. 2023]. ISSN 00344257. DOI: 10.1016/j.rse.2007.08.023. Cutler D. R., Edwards T. C , Jr., Beard K. H., Cutler A., Hess K. T., Gibson J., Lawler J. J., 2007: Random Forests for Classification in Ecology. Ecology [online]. 88(11), 2783-2792 [cit. 30. 4. 2023]. DOI: 10.1890/07-0539.1. Eldegard K., Dirksen J. W., 0rka H. O., Halvorsen R., Naesset E., Gobakken T., Ohlson M., 2014: Modelling bird richness and bird species presence in a boreal forest reserve using airborne laser-scanning and aerial images. Bird Study [online]. 61(2), 204-219 [cit. 6. 5. 2023]. ISSN 0006-3657. DOI: 10.1080/00063657.2014.885492. Elith J., Graham C. H., Anderson R. P., Dudik M., Ferrier S., Guisan A., Hijmans R. J., Huettmann F , Leathwick J. R., Lehmann A., Li J., Lohmann L. G., Loiselle B. A., Manion G , Moritz C , Nakamura M., Nakazawa Y., Overton J. McC. M., Townsend Peterson A., Phillips S. J., Richardson K., Scachetti-Pereira R., Schapire R. E, Soberon J., Williams S., Wisz M . S., Zimmermann N. E., 2006: Novel methods improve prediction of species' distributions from occurrence data. Ecography [online]. 29(2), 129-151 [cit. 6. 5. 2023]. ISSN 09067590. DOI: 10.111 l/j.2006.0906-7590.04596.x. Farrell A., Wang G., Rush S. A., Martin J. A., Belant J. L., Butler A. B., Godwin D., 2019: Machine learning of large-scale spatial distributions of wild turkeys with highdimensional environmental data. Ecology and Evolution [online]. 9(10), 5938-5949 [cit. 6. 5. 2023]. ISSN 2045-7758. DOI: 10.1002/ece3.5177. Ferrarini A., Calevi E., Brozzetti D., Colle A., De Santis R., Laurenti S., Savo E., Gustin M., 2023: Optimized Monitoring and Conservation of Farmland Bird Species through Bayesian Modelling: The Montagu's Harrier Circus pygargus Population in Central Italy. Sustainability [online]. 15(5), 4426 [cit. 6. 5. 2023]. ISSN 2071-1050. DOI: 10.3390/su 15054426. Fielding A. H., 1999: Machine Learning Methods for Ecological Applications. 1st ed. Kluwer Academic Publishers, Norwell (Massachusetts), pp. 274. ISBN 978-0412841903. Fisher A., Rudin C , Dominici F , 2019: All Models are Wrong, but Many are Useful: Learning a Variable's Importance by Studying an Entire Class of Prediction Models Simultaneously. Journal of Machine Learning Research [online]. 20(177), 1-81 [cit. 24. 3. 2023]. Dostupne z: https://www.jmlr.org/papers/volume20/18-760/18-760 .pdf. Fritsch S., Guenther F , Wright M., 2019: neuralnet: Training of Neural Networks [online]. Rpackage version 1.44.2 [cit. 12. 5. 2023]. Dostupne z: https://CRAN.R-project.o rg/package=neuralnet. Gardener, M., 2014: Community Ecology: Analytical Methods Using R and Excel®. 1st ed. Pelagic Publishing, Exeter, pp. 556. ISBN 978-1907807619. Gauch, H. G., 1982: Multivariate Analysis in Community Ecology. 1st ed. Cambridge University Press, pp. 314. ISBN 978-0521238205. Seznam použité literatury 57 Géron A., 2019: Hands-on Machine Learning with Scikit-Learn, Keras, and TensorFlow: Concepts, Tools, and Techniques to Build Intelligent Systems. 2nd ed. O'Reilly Media, Beijing, pp. 856. ISBN 978-1492032649. Gil-Tena A., Vega-García C., Brotons L., Saura S., 2011: Modelling bird species richness with neural networks for forest landscape management in NE Spain. Forest Systems [online]. 3(4), 113-125 [cit. 6. 5. 2023]. ISSN 2171-9845. DOI: 10.5424/fs/201019S- 9290. Goetz S. J., Steinberg D., Dubayah R., Blair B., 2007: Laser remote sensing of canopy habitat heterogeneity as a predictor of bird species richness in an eastern temperate forest, USA. Remote Sensing of Environment [online]. 108(3), 254-263 [cit. 6. 5. 2023]. ISSN 0034-4257. DOI: 10.1016/j.rse.2006.11.016. Goetz S. J., Sun M., Zolkos S., Hansen A., Dubazah R., 2014: The relative importance of climate and vegetation properties on patterns of North American breeding bird species richness. Environmental Research Letters [online]. 9(3) [cit. 6.5.2023]. ISSN 1748-9326. DOI: 10.1088/1748-9326/9/3/034013. Greenacre M., Primicerio R., 2013: Multivariate Analysis of Ecological Data. Fundación BBVA, Bilbao, pp. 336. ISBN 978-8492937509. Greenwell B., 2021: fastshap: Fast Approximate Shapley Values [online]. R package version 0.0.7 [cit. 12. 5. 2023]. Dostupné z: https : //CRAN. R-proj ect. org/package =fastshap. Hepinstall, J. A., Sader S. A., 1997: Using Bayesian Statistics, Thematic Mapper Satellite Imagery, and Breeding Bird Survey Data to Model Bird Species Probability of Occurrence in Maine. Photogrammetric Engineering & Remote Sensing [online]. 63(10), 1231-1237 [cit. 6. 5. 2023]. Dostupné z: https://www.researchgate.net/publication/26548 7398_Using_Bayesian_Statistics_Thematic_Mapper_Satellite_Imagery_and _Breeding_Bird_Survey_Data_to_Model_Bird_Species_Probability_of_0ccu rrence_in_Maine. Jarkovský J., Littnerová S., Dušek L., 2012: Statistické hodnocení biodiverzity [online]. Akademické nakladatelství CERM, Brno, pp. 77 [cit. 22. 2. 2023]. ISBN 978- 8072047901. Dostupné z: https : //www.matematickabiologie. cz/media/3293328 /jarkovsky-statisticke-hodnoceni-biodiverzity.pdf. Jongmann R. H. G., Ter Braak C. J. F , van Tongeren O. F. R., 1995: Data Analysis in Community and Landscape Ecology. Cambridge University Press, pp. 324. ISBN 978-0521475747. Jungandreas A., Roilo S., Strauch M., Václavík T, Volk M., Cord A. F , 2022: Response of endangered bird species to land-use changes in an agricultural landscape in Germany. Regional Environmental Change [online]. 22(1) [cit. 6. 5. 2023]. ISSN 1436-3798. DOI: 10.1007/s 10113-022-01878-3. Seznam použité literatury 58 Kampichler Ch., Wieland R., Calmé S., Weissenberger H., Arriaga-Weiss S., 2010: Classification in conservation biology: A comparison of five machine-learning methods. Ecological Informatics [online]. 5(6), 441-450 [cit. 6. 5. 2023]. ISSN 1574-9541. DOI: 10.1016/j.ecoinf.2010.06.003. Karatzoglou A., Smola A., Hornik K., 2023: kernlab: Kernel-Based Machine Learning Lab [online]. R package version 0.9-32 [cit. 12. 5. 2023]. Dostupné z: https : //CRAM. R -project.org/package=kernlab. Karr J. R., Roth R. R., 1971: Vegetation Structure and Avian Diversity in Several New World Areas. The American Naturalist [online]. 105(945), 423-435 [cit. 6.5.2023]. ISSN 0003-0147. DOI: 10.1086/282735. Kaur A., Gregoři D., Patil G. P., Taillie C., 1996: Ecological Applications of Generalized Linear Models and Quasi-Likelihood Methods: An Overview. Statistica Applicata [online]. 8(1), 59-82 [cit. 30. 4. 2023]. Dostupné z: https : //bpb-us-el. wpmucdn. com/ sites.psu.edu/dist/6/41917/files/2016/04/1995-0601-EC0L0GICAL-APPLI CATIONS-0F-GEMERALIZED-LINEAR-M0DELS-AND-QUASI-LIKELIH00D-METH0DS-A N-OVERVIEW-by-Amarjot-Kaur-Dario-Gregori-G.-P.-Patil-and-C.-Taillie -.pdf. Kinross C., 2004: Avian use of farm habitats, including windbreaks, on the New South Wales Tablelands. Pacific Conservation Biology [online]. 10(3), 180-192 [cit. 6.5.2023]. ISSN 1038-2097. DOI: 10.1071/PC040180. Kinross C , Nicol H., 2008: Responses of birds to the characteristics of farm windbreaks in central New South Wales, Australia. Emu - Austral Ornithology [online]. 108(2), 139-152 [cit. 6. 5. 2023]. ISSN 0158-4197. DOI: 10.1071/MU06024. Komprdová K , 2012: Rozhodovací stromy a lesy [online]. Akademické nakladatelství CERM, Brno, pp. 99 [cit. 30. 4. 2023]. ISBN 978-8072047857. Dostupné z: https: //www.matematickabiologie.cz/media/3293330/komprdova-rozhodovaci-str omy-lesy.pdf. Kosicki J. Z., 2020: Generalised Additive Models and Random Forest Approach as effective methods for predictive species density and functional species richness. Environmental and Ecological Statistics [online]. 27(2), 273-292 [cit. 6. 5. 2023]. ISSN 1352-8505. DOI: 10.1007/sl0651-020-00445-5. Kuhn M., 2022: caret: Classification and Regression Training [online]. R package version 6.0-93 [cit. 12.5.2023]. Dostupné z: https : //CRAN. R-proj ect. org/package=caret. Lantz B., 2013: Machine learning with R: Learn how to use R to apply powerful machine learning methods and gain an insight into real-world applications. Packt Publishing, Birmingham, UK, pp. 396. ISBN 978-1782162148. Lek S., Guégan J. F., 1999: Artificial neural networks as a tool in ecological modelling, an introduction. Ecological Modelling [online]. 120(2-3), 65-73 [cit. 1. 5. 2023]. ISSN 0304-3800. DOI: 10.1016/S0304-3800(99)00092-7. Seznam použité literatury 59 Lepš J., Šmilauer R, 2000: Mnohorozměrná analýza ekologických dat [online]. Jihočeská univerzita v Českých Budějovicích, pp. 102 [cit. 22. 2. 2023]. Dostupné z: h t t p : / / r e gent.j cu.cz/skripta.pdf. Liaw A., Wiener M., 2002: Classification and Regression by randomForest [online]. R News 2(3), 18-22 [cit. 12. 5. 2023]. Dostupné z: https://CRAN.R-project.org/pac kage=randomForest. Lorena A. C , Jacintho L. F. O., Siqueira M . F , De Giovanni R., Lohmann L. G., de Carvalho A. C. R L. F , Yamamoto M., 2011: Comparing machine learning classifiers in potential distribution modelling [online]. Expert Systems with Applications. 38(5), 5268-5275 [cit. 1. 5. 2023]. DOI: 10.1016/j.eswa.2010.10.031. Lundberg S. M., Lee S.-L, 2017: A Unified Approach to Interpreting Model Predictions. In: Proceedings of the 31st International Conference on Neural Information Processing Systems (NIPS'17) [online]. Red Hook, New York: Curran Associates Inc. 4768-4777 [cit. 10. 4. 2023]. ISBN 978-1510860964. Dostupné z: https : //proceedings .neurip S.cc/paper/2017/file/8a20a8621978632d76c43dfd28b67767-Paper.pdf. MacArthur R. H., MacArthur J. W., 1961: On Bird Species Diversity. Ecology [online]. 42(3), 594-598 [cit. 6. 5. 2023]. ISSN 0012-9658. DOI: 10.2307/1932254. Magurran A. E., 2003: Measuring Biological Diversity. 1st ed. Blackwell Publishing, Bodmin (Cornwall), pp. 272. ISBN 978-0632056330. Maleki S., Baghdadi N., Rahdari V., 2020: Which water bird groups need greater habitat conservation measures in a wetland ecosystem? Ecological Engineering [online]. 143(15) [cit. 6. 5. 2023]. ISSN 0925-8574. DOI: 10.1016/j.ecoleng.2019.105677. Mayer M., 2023: shapviz: SHAP Visualizations [online]. R package version 0.6.0 [cit. 12. 5. 2023]. Dostupné z: https : //CRAN. R-proj ect. org/package=shapviz. Meyer D., Dimitriadou E., Hornik K., Weingessel A., Leisch F , 2023: el071: Misc Functions of the Department of Statistics, Probability Theory Group (Formerly: E1071), TU Wien [online]. R package version 1.7-13 [cit. 12. 5. 2023]. Dostupné z: h t t p s : //CRAN.R-project.org/package=el071. Mitchell T. M., 1997: Machine learning. 1st ed. McGraw-Hill, Boston, pp. 432. ISBN 978-0070428072. Molnar C , Casalicchio G., Bischl B., 2018: iml: An R package for Interpretable Machine Learning. Journal of Open Source Software [online]. 3(27), 786 [cit. 12. 5. 2023]. DOI: 10.21105/JOSS.00786. Molnar Ch., 2019: Interpretable Machine Learning: A Guide for Making Black Box Models Explainable [online], pp. 251 [cit. 22. 3.2023]. ISBN 979-8411463330. Dostupné z:https://originalstatic.aminer.cn/misc/pdf/Molnar-interpretable-mac hine-learning_compressed.pdf. Seznam použité literatury 60 Monteil C , DeconchatM., Balent G., 2005: Simple Neural Network Reveals Unexpected Patterns of Bird Species Richness in Forest Fragments. Landscape Ecology [online]. 20(5), 513-527 [cit. 6. 5. 2023]. ISSN 0921-2973. DOI: 10.1007/s 10980-004-3317-x. Müller J., Moning Ch., Bässler C., Heurich M., Brandl R., 2009: Using airborne laser scanning to model potential abundance and assemblages of forest passerines. Basic and Applied Ecology [online]. 10(7), 671-681 [cit. 6. 5. 2023]. ISSN 1439-1791. DOI: 10.1016/j .baae.2009.03.004. Müller J., Stadler J., Brandl R., 2010: Composition versus physiognomy of vegetation as predictors of bird assemblages: The role of lidar. Remote Sensing of Environment [online]. 114(3), 490-495 [cit. 6. 5. 2023]. ISSN 0034-4257. DOI: 10.1016/j.rse.2009.10.006. O'Connor R. J., Jones M . T, White D., Hunsaker C , Loveland T, Jones B., Preston E., 1996: Spatial Partitioning of Environmental Correlates of Avian Biodiversity in the Conterminous United States. Biodiversity Letters [online]. 3(3), 97-110 [cit. 6. 5. 2023]. ISSN 0967-9952. DOI: 10.2307/2999723. Oksanen J., Simpson G., Blanchet F , Kindt R., Legendre P., Minchin P., O'Hara R., Solymos P., Stevens M., Szoecs E., Wagner H., Barbour M., Bedward M., Bolker B., Borcard D., Carvalho G., Chirico M., De Caceres M., Durand S., Evangelista H., FitzJohn R., Friendly M., Furneaux B., Hannigan G., Hill M., Lahti L., McGlinn D., Ouellette M., Ribeiro Cunha E., Smith T, Stier A., Ter Braak C , Weedon J., 2022: vegan: Community Ecology Package [online]. Rpackage version 2.6-4 [cit. 12. 5. 2023]. Dostupne z: https : //CRAN.R-proj ect.org/package=vegan. Pielou E. C , 1969: An Introduction to Mathematical Ecology. Wiley-Interscience, New York, pp. 286. ISBN 0471689181. R Core Team, 2022: R: A language and environment for statistical computing. R Foundation for Statistical Computing, Vienna, Austria. Dostupne z: https : //www. R-pro j e ct.org/. Riedmiller M., 1994: Rprop - Description and Implementation Details. Technical Report [online]. University of Karlsruhe [cit. 1. 5. 2023]. Dostupne z: http: //www. inf . f u-b erlin.de/lehre/WS06/Musterererkennung/Paper/rprop.pdf. Robin X., Turck N., Hainard A., Tiberti N., Lisacek F , Sanchez J.-CH., Müller M., 2011: pROC: an open-source package for R and S+ to analyze and compare ROC curves. BMC Bioinformatics [online]. 12, pp. 77 [cit. 12. 5. 2023]. DOI: 10.1186/1471-2105-12-77. Schroeder R. L., Cable T. T, Haire S. L., 1992: Wildlife Species Richness in Shelterbelts: Test of a Habitat Model. Wildlife Society Bulletin [online]. 20(3), 264-273 [cit. 6. 5. 2023]. Dostupne z: https : //www. j stor. org/stable/pdf/3783029. pdf ?casa_to ken=zXSbr-HvA9IAAAAA:F40ZXYrj7FjuxuoRQhX0SkruPQMvMjUDMlB2z-qvyT3sFI3 knHqogtiPZKeC5xzBq3rMe44xMdZFe0BFZfpySSyizuHLUzfrqLhRWvktnYuT6n77S0U lrg. Seznam použité literatury 61 Simpson E. H., 1949: Measurement of Diversity. Nature [online]. 163(4148), 688-688 [cit. 1. 3. 2023]. ISSN 0028-0836. DOI: 10.1038/163688a0. Sing T., Sander O., Beerenwinkel N., Lengauer T., 2005: ROCR: visualizing classifier performance in R. Bioinformatics [online]. 21(20), 3940-3941 [cit. 12. 5. 2023]. DOI: 10.1093/bioinformatics/bti623. Dostupne z: http: / / r o c r .bioinf .mpi-sb .mpg. de. Su J.-H., Piao Y.-Ch., Luo Z., Yan B.-P, 2018: Modeling Habitat Suitability of Migratory Birds from Remote Sensing Images Using Convolutional Neural Networks. Animals [online]. 8(5), 66 [cit. 6. 5. 2023]. ISSN 2076-2615. DOI: 10.3390/ani8050066. Thessen A. E., 2016: Adoption of Machine Learning Techniques in Ecology and Earth Science. One Ecosystem [online]. 1(2) [cit. 25. 2. 2023]. ISSN 2367-8194. DOI: 10.3897/oneeco.l.e8621. Valavi R., Guillera-ArroitaG., Lahoz-Monfort J. J., Elith J., 2022: Predictive Performance of Presence-only Species Distribution Models: A Benchmark Study with Reproducible Code. Ecological Monographs [online]. 92(l):el486, 1-27 [cit. 6. 5. 2023]. ISSN 0012- 9615. DOI: 10.1002/ecm.l486. Wickham H., Averick M., Bryan J., Chang W., McGowan L. D., Francois R., Grolemund G , Hayes A., Henry L., Hester J., Kuhn M., Pedersen T. L., Miller E., Bache S. M., Miiller K., Ooms J., Robinson D., Seidel D. P., Spinu V., Takahashi K., Vaughan D., Wilke C , Woo K., Yutani H., 2019: Welcome to the tidyverse. Journal of Open Source Software [online]. 4(43), 1686 [12. 5. 2023]. DOI: 10.21105/joss.01686. Wu J., Liang S., 2018: Developing an Integrated Remote Sensing Based Biodiversity Index for Predicting Animal Species Richness. Remote Sensing [online]. 10(5), 739 [cit. 6. 5. 2023]. ISSN 2072-4292. DOI: 10.3390/rs 10050739. Přílohy Příloha 1. Seznam proměnných prostředí. Zkratka Název proměnné Ponechání proměnné Název proměnné pro analýzu 1 pocvsstr Počet všech stromů na 100 m2 / 2 pocusstr Počet suchých stromů na 100 m2 / 3 hrubkastr Průměrná tlouštka živých stromů (cm) / 4 hrusuchstr Průměrná tlouštka suchých stromů (cm) / 5 bazplocha Bazálni plocha živých stromů (cm2 /100 m2 ) / 6 vyskabyl Výška bylinné etáže (cm) / 7 vyskankro Výška nižší křovinné etáže (cm) / 8 vyskavkrov Výška vyšší křovinné etáže (m) / 9 vyskakor Výška stromů (m) / 10 vzajvzstr Vzájemná vzdálenost stromů (m) / 11 vzajvzkrov Vzájemná vzdálenost keřů (m) / 12 pkrythrab Pokryvnost opadanky (%) / 13 pkryttrava Pokryvnost trávy (%) / 14 pkrytbyl Pokryvnost bylin (%) / 15 pkrytkrov Pokryvnost křovin (%) / 16 podahola Pokryvnost holé půdy (%) / 17 voda Pokryvnost vody (%) X 18 hor0-0.3 Pokryvnost vegetace ve vrstvě 0-0,3 m (%) X 19 hor0.3-l Pokryvnost vegetace ve vrstvě 0,3-1 m (%) X 20 horl-3 Pokryvnost vegetace ve vrstvě 1-3 m (%) X 21 hor3-7 Pokryvnost vegetace ve vrstvě 3-7 m (%) X 22 hor7-9 Pokryvnost vegetace ve vrstvě 7-9 m (%) X 23 hor9viac Pokryvnost vegetace ve vrstvě nad 9 m (%) X 24 horsuma Celková pokryvnost vegetace (%) X 25 verl-3 Vertikální pokryvnost v kategorii 1-3 m (%) X 26 ver3-7 Vertikální pokryvnost v kategorii 3-7 m (%) X 27 ver7-9 Vertikální pokryvnost v kategorii 7-9 m (%) X 28 versuma Celková vertikální pokryvnost (%) X 29 pbylsuma Celková pokryvnost bylin (%) / -62- Přílohy 63 Příloha 1. Seznam proměnných prostředí (pokrač.). Zkratka Název proměnné Ponechání proměnné Název proměnné pro analýzu 30 pkrosuma Celková pokryvnost keřů (%) / 31 pstrsuma Celková pokryvnost stromů (%) / 32 lezstr Počet suchých ležících stromů na 100 m2 / 33 lezkro Počet suchých ležících keřů na 100 m / 34 sirka Šířka vetrolamu (m) / 35 pctAcer Počet stromů javoru na 100 m2 X 36 pctFrax Počet stromů jasanu na 100 m2 X 37 pctGled Počet stromů dřezovce na 100 m2 X 38 pctPopul Počet stromů topolu na 100 m2 X 39 pctRobin Počet stromů akátu na 100 m2 X 40 pctSalix Počet stromů vrby na 100 m2 X 41 pctSamb Počet stromů bezu na 100 m2 X 42 pctTilia Počet stromů lípy na 100 m X 43 pctUlmus Počet stromů jilmu na 100 m2 X 44 pctlnestr Počet stromů ostatních druhů na 100 m2 X 45 pctdrstr Počet druhů stromů / 46 pokrAcer Pokry vnost javoru (%) X 47 pokrFrax Pokryvnost jasanu (%) / 48 pokrGled Pokryvnost dřezovce (%) X 49 pokrPopul Pokryvnost topolu (%) / 50 pokrRobin Pokryvnost akátu (%) / 51 pokrSalix Pokryvnost vrby (%) / 52 pokrSamb Pokryvnost bezu (%) X 53 pokrTilia Pokryvnost lípy (%) / 54 pokrUlmu Pokryvnost jilmu (%) X 55 pokrlnestr Pokryvnost jiných druhů stromů (%) / 56 pkrAcer Pokryvnost javoru - keřů (%) / 57 pkrCratae Pokryvnost hlohu (%) / 58 pkrEuon Pokryvnost brslenu (%) / 59 pkrLigus Pokryvnost ptačího zobu (%) / 60 pkrRhCor Pokryvnost lísky (%) / 61 pkrRosa Pokryvnost růže (%) / 62 pkrRubus Pokryvnost ostružníku (%) / 63 pkrSamb Pokryvnost bezu (%) / 64 pkrUlmus Pokryvnost jilmu - keřů (%) / 65 pkrlnekr Pokryvnost jiných druhů křovin (%) / 66 pkrArcti Pokryvnost lopuchu (%) / 67 pkrArtem Pokryvnost pelyňku (%) / 68 pkrCarCir Pokryvnost pcháče (%) / 69 pkrDauc Pokryvnost Daucaceae (%) / 70 pkrGeum Pokryvnost kuklíku (%) / 71 pkrLamiac Pokryvnost Lamiaceae (%) / 72 pkrPoac Pokryvnost lipnice (%) / 73 pkrUrtica Pokryvnost kopřivy (%) / 74 pkrlnebyl Pokryvnost jiných druhů bylin (%) / Přílohy. .64 Příloha 2. Seznam zaznamenaných druhů. Tučným písmem jsou označeny druhy, kterým se práce blíže věnuje. Rád Český název Latinský název Hrabaví Bažant obecný Hrabaví Koroptev polní Vrubozobí Kachna divoká Měkkozobí Holub hřivnáč Měkkozobí Hrdlička divoká Dravci Káně lesní Sovy Kalous ušatý Šplhavci Strakapoud jižní Šplhavci Strakapoud velký Sokoli Ostříž lesní Sokoli Poštolka obecná Pěvci Bramborníček černohlavý Pěvci Dlask tlustozobý Pěvci Drozd zpěvný Pěvci Konipas bílý Pěvci Kos černý Pěvci Lejsek šedý Pěvci Linduška lesní Pěvci Moudivláček luzní Pěvci Pěnice černohlavá Pěvci Pěnice hnědokřídlá Pěvci Pěnice pokřovní Pěvci Pěnice slavíková Pěvci Pěnice vlašská Pěvci Pěnkava obecná Pěvci Rákosník velký Pěvci Rákosník zpěvný Pěvci Sedmihlásek hajní Pěvci Slavík obecný Pěvci Stehlík obecný Pěvci Straka obecná Pěvci Strnad luční Pěvci Strnad obecný Pěvci Sýkora babka Pěvci Sýkora koňadra Pěvci Sýkora modřinka Pěvci Špaček obecný Pěvci Tuhýk menší Pěvci Ťuhýk obecný Pěvci Vrabec polní Pěvci Vrána šedá Pěvci Zvonek zelený Pěvci Zvonohlík zahradní Pěvci Žluva hajní Phasianus colchicus Perdix perdix Anas platyrhynchos Columba palumbus Streptopelia turtur Buteo buteo Asio otus Dendwcopos syriacus Dendwcopos major Falco subbuteo Falco tinnunculus Saxicola rubicola Coccothraustes coccothraustes Turdus philomelos Motacilla alba Turdus merula Muscicapa striata Anthus trivialis Remiz pendulinus Sylvia atricapilla Sylvia communis Sylvia curruca Sylvia borin Sylvia nisoria Fringilla coelebs Acrocephalus arundinaceus Acrocephalus palustris Hippolais icterina Luscinia megarhynchos Carduelis carduelis Pica pica Emberiza calandra Emberiza citrinella Poecile palustris Parus major Cyanistes caeruleus Sturnus vulgaris Lanius minor Lanius collurio Passer montanus Corvus cornix Chloris chloris Serinus serinus Oriolus oriolus Přílohy 65 Příloha 3. Seznam proměnných prostředí v abecedním pořadí vybraných selekcí prostřednictvím významnosti proměnných v rámci modelu náhodného lesa pro zvolené závislé proměnné. Tyto proměnné byly dále použity pro modelování vybranými metodami. Názvy vysvětlujících proměnných viz příloha 1. Závislá proměnná Počet druhů Vybrané nezávislé proměnné bazplocha, hrubkastr, lezkro, lezstr, pctdrstr, pkrAcer, pkrCarCir, pkrCratae, pkrlnekr, pkrLigus, pkrosuma, pkrRhCor, pkrRubus,pkrUlmus, pkrytkrov, pocsustr, pokrPopul, pstrsuma, sirka, vzajvzstr Shannonův index diverzity hrubkastr, lezstr, pctdrstr, pkrCratae, pkrEuon, pkrGeum, pkrlnekr, pkrosuma, pkrRubus, pkrSamb, pkrythrab, pkrytkrov, pokrlnestr, pokrPopul, pstrsuma, sirka, vyskakor, vyskankro, vzajvzkrov, vzajvzstr Kos černý hrusuchstr, pctdrstr, pkrArcti, pkrArtem, pkrCratae, pkrlnebyl, pkrlnekr, pkrRhCor, pkrSamb, pkrUlmus, pkrUrtica, pkrytbyl, pkrytkrov, pkryttrava, podahola, pokrlnestr, pstrsuma, vyskabyl, vyskakor, vzajvzkrov Sýkora koňadra bazplocha, hrubkastr, hrusuchstr, pbylsuma, pctdrstr, pkrAcer, pkrArcti, pkrArtem, pkrCratae, pkrGeum, pkrLigus, pkrRhCor, pkrRosa, pkrRubus, pkrythrab, podahola, pokrPopul, pstrsuma, sirka, vyskakor Bažant obecný bazplocha, hrubkastr, hrusuchstr, lezstr, pkrCarCir, pkrCratae, pkrEuon, pkrlnebyl, pkrlnekr, pkrLigus, pkrosuma, pkrRosa, pkrUrtica, pkrytkrov, pocsustr, podahola, pokrFrax, vyskankro, vyskavkrov, vzajvzstr Přílohy 66 Příloha 4. ALE grafy vysvětlujících proměnných v abecedním pořadí pro modelování počtu druhů na lokalitě pomocí modelu náhodného lesa. Názvy vysvětlujících proměnných viz příloha 1. , (a) bazplocha (b) hrubkastr (c) lezkro E • < - 1 . 5 (d) lezstr (e) pctdrstr (f) pkrAcer 0-1,0- É O 1.0 - O 1,0 ed.početdru [ ed.početdru Q_ / (3 £ -0,5 - .SOI .SOI ítomr \ •ítomľ Incepi incepi ;d.log.ŠÍ ;d.log.ŠÍ napr< napr< ALE | i LU . '— < (g) pkrArcti (h) pkrArtem (i) pkrCratae (j) pkrGeum (k) pkrLigus (1) pkrRhCor Přílohy 92 Příloha 17. A L E grafy vysvětlujících proměnných v abecedním pořadí pro modelování přítomnosti sýkory koňadry pomocí Bayesova klasifikátoru. Názvy vysvětlujících proměnných viz příloha 1. E B 1C E B 10 5000 10000 15000 20000 25000 30000 (a) bazplocha (b) hrubkastr (c) hrusuchstr E B io (d) pbylsuma (e) pctdrstr (f) pkrAcer E Q io - E B io (g) pkrArcti (h) pkrArtem (i) pkrCratae 0 2 4 6 B 10 12 14 0 S 10 15 20 25 30 36 0 5 10 15 20 25 30 35 (j) pkrGeum (k) pkrLigus (1) pkrRhCor Přílohy 94 Příloha 18. A L E grafy vysvětlujících proměnných v abecedním pořadí pro modelování přítomnosti bažanta obecného pomocí modelu náhodného lesa. Názvy vysvětlujících proměnných viz příloha 1. (a) bazplocha (b) hrubkastr (c) hrusuchstr 0 2 4 S 8 10 12 (d) lezstr (e) pkrCarCir (f) pkrCratae • i (g) pkrEuon (h) pkrlnebyl (i) pkrlnekr , , (j) pkrLigus (k) pkrosuma (1) pkrRosa Přílohy 96 Příloha 19. A L E grafy vysvětlujících proměnných v abecedním pořadí pro modelování přítomnosti bažanta obecného pomocí modelu neuronové sítě. Názvy vysvětlujících proměnných viz příloha 1. 20000 25000 (a) bazplocha (b) hrubkastr (c) hrusuchstr (d) lezstr (e) pkrCarCir (f) pkrCratae • i (g) pkrEuon (h) pkrlnebyl (i) pkrlnekr , , (j) pkrLigus (k) pkrosuma (1) pkrRosa Přílohy 98 Příloha 20. A L E grafy vysvětlujících proměnných v abecedním pořadí pro modelování přítomnosti bažanta obecného pomocí metody podpůrných vektorů. Názvy vysvětlujících proměnných viz příloha 1. 20000 25000 (a) bazplocha (b) hrubkastr (c) hrusuchstr £ -0.2 (d) lezstr (e) pkrCarCir (f) pkrCratae • i (g) pkrEuon (h) pkrlnebyl (i) pkrlnekr , , (j) pkrLigus (k) pkrosuma (1) pkrRosa Přílohy 100 Příloha 21. A L E grafy vysvětlujících proměnných v abecedním pořadí pro modelování přítomnosti bažanta obecného pomocí Bayesova klasifikátoru. Názvy vysvětlujících proměnných viz příloha 1. 15000 20000 25000 (a) bazplocha (b) hrubkastr (c) hrusuchstr (d) lezstr (e) pkrCarCir (f) pkrCratae • i (g) pkrEuon (h) pkrlnebyl (i) pkrlnekr , , (j) pkrLigus (k) pkrosuma (1) pkrRosa ALE na pred. log. šance výskytu bažanta ALE na pred. log. šance výskytu bažanta 3 - hr-J ALE na pred. log. šance výskytu bažanta z ^ 1 §• o •a o ALE na pred. log. šance výskytu bažanta ^ o ALE na pred. log. šance výskytu bažanta c < ALE na pred. log. šance výskytu bažanta ALE na před. log. šance výskytu bažanta ALE na pred. log. šance výskytu bažanta