#Skript MUNI
#Načtení knihoven
library(rvest)
library(quanteda)
library(quanteda.textplots)
library(ggplot2)

keywords<-c(phrase('alternat* medicín*'), phrase('anal* dat*'), phrase('datov* analýz*'), 'dezinform*', 'EBM', phrase('založen* na důkazech'), phrase('fake news'), phrase('falešn* zpráv*'), phrase('lživ* zpráv*'), phrase('nepravdiv* zpráv*'), 'infodemi*', phrase('informačn* gramotnost*'), phrase('klinick* studi*'), phrase('konspirační* teori*'), 'kreativ*', phrase('kritick* myšlení*'), 'malinform*', 'misinform*', phrase('odborn* literat*'), phrase('odborn* časopis*'), phrase('otevřen* otázk*'), phrase('predátorsk* časopis*'), phrase('přehledov* pr*'), 'review', phrase('přehledov* studi*'), 'pseudověd*','sebevědom*', phrase('skupinov* aktivit*'), phrase('vědeck* komunikac*'), phrase('vyhledáv* informac*')) #Definice vektoru klíčových slov

#muni_vl<-read_html(read.csv('Odkazy MUNI.csv',header=FALSE))
muni_vl<-read.csv('Odkazy MUNI.csv',header=FALSE,sep=';') #Načtení dat z CSV souboru do tabulky
n<-nrow(muni_vl) #Počet řádků
muni_pages<-c() #Prázdný vektor
for (i in 1:n){        #Cyklus prováděný pro každý řádek
  muni_vli<-read_html(muni_vl[i,]) #Načtení HTML kódu z URL adresy na daném řádku
  muni_vli<-muni_vli %>% html_nodes("p, span, h1, h2, h3, h4, h5, h6, ul, ol, dt, dd, td, th") %>% html_text() #získání vektoru s textovými elementy stránek jako jeho prvky
  muni_vli<-paste(muni_vli,collapse='') ##Spojení vektoru odstavců do jediného řetězce
  muni_pages<-append(muni_pages,muni_vli) #Přidání řetězce do vektoru muni_pages
}
muni_corpus<-corpus(muni_pages) #Vytvoření korpusu z vektoru muni_pages
muni_tokens<-tokens(muni_corpus,remove_numbers = TRUE, remove_punct = TRUE, remove_separators = TRUE, remove_url = TRUE ) #Tokenizace korpusu
muni_kwic<-kwic(muni_tokens,keywords) #Vyhledání klíčových slov v textu
textplot_xray(muni_kwic) + ggtitle('LF MU Všeobecné lékařství') + labs(x='Pozice v textu',y='Označení dokumentu') #Vizualizace klíčových slov
-------------------------------
#Skript UPOL
#Načtení knihoven
library(rvest)
library(quanteda)
library(quanteda.textplots)
library(ggplot2)

keywords<-c(phrase('alternat* medicín*'), phrase('anal* dat*'), phrase('datov* analýz*'), 'dezinform*', 'EBM', phrase('založen* na důkazech'), phrase('fake news'), phrase('falešn* zpráv*'), phrase('lživ* zpráv*'), phrase('nepravdiv* zpráv*'), 'infodemi*', phrase('informačn* gramotnost*'), phrase('klinick* studi*'), phrase('konspirační* teori*'), 'kreativ*', phrase('kritick* myšlení*'), 'malinform*', 'misinform*', phrase('odborn* literat*'), phrase('odborn* časopis*'), phrase('otevřen* otázk*'), phrase('predátorsk* časopis*'), phrase('přehledov* pr*'), 'review', phrase('přehledov* studi*'), 'pseudověd*','sebevědom*', phrase('skupinov* aktivit*'), phrase('vědeck* komunikac*'), phrase('vyhledáv* informac*')) #Definice vektoru klíčových slov

upol_vl<-read.csv('Odkazy UPOL.csv',header=FALSE,sep=';') #Načtení dat z CSV souboru do tabulky
n<-nrow(upol_vl) #Počet řádků
upol_pages<-c() #Prázdný vektor
for (i in 1:n){        #Cyklus prováděný pro každý řádek
  upol_vli<-read_html(upol_vl[i,]) #Načtení HTML kódu z URL adresy na daném řádku
  upol_vli<-upol_vli %>% html_nodes("p, span, h1, h2, h3, h4, h5, h6, ul, ol, dt, dd, td, th") %>% html_text() #získání vektoru s textovými elementy stránek jako jeho prvky
  upol_vli<-paste(upol_vli,collapse='') ##Spojení vektoru odstavců do jediného řetězce
  upol_pages<-append(upol_pages,upol_vli) #Přidání řetězce do vektoru upol_pages
}
upol_corpus<-corpus(upol_pages) #Vytvoření korpusu z vektoru upol_pages
upol_tokens<-tokens(upol_corpus,remove_numbers = TRUE, remove_punct = TRUE, remove_separators = TRUE, remove_url = TRUE ) #Tokenizace korpusu
upol_kwic<-kwic(upol_tokens,keywords) #Vyhledání klíčových slov v textu
textplot_xray(upol_kwic) + ggtitle('LF UP Všeobecné lékařství') + labs(x='Pozice v textu',y='Označení dokumentu') #Vizualizace klíčových slov
-----------------------------------------------------
#Skript OSU
#Načtení knihoven
library(rvest)
library(quanteda)
library(quanteda.textplots)
library(ggplot2)
library(pdftools)

keywords<-c(phrase('alternat* medicín*'), phrase('anal* dat*'), phrase('datov* analýz*'), 'dezinform*', 'EBM', phrase('založen* na důkazech'), phrase('fake news'), phrase('falešn* zpráv*'), phrase('lživ* zpráv*'), phrase('nepravdiv* zpráv*'), 'infodemi*', phrase('informačn* gramotnost*'), phrase('klinick* studi*'), phrase('konspirační* teori*'), 'kreativ*', phrase('kritick* myšlení*'), 'malinform*', 'misinform*', phrase('odborn* literat*'), phrase('odborn* časopis*'), phrase('otevřen* otázk*'), phrase('predátorsk* časopis*'), phrase('přehledov* pr*'), 'review', phrase('přehledov* studi*'), 'pseudověd*','sebevědom*', phrase('skupinov* aktivit*'), phrase('vědeck* komunikac*'), phrase('vyhledáv* informac*')) #Definice vektoru klíčových slov

osu_vl<-read.csv('Odkazy OSU.csv',header=FALSE,sep=';') #Načtení dat z CSV souboru do tabulky
n<-nrow(osu_vl) #Počet řádků
osu_pages<-c() #Prázdný vektor
for (i in 1:n){        #Cyklus prováděný pro každý řádek
  osu_vli<-read_html(osu_vl[i,]) #Načtení HTML kódu z URL adresy na daném řádku
  osu_vli<-osu_vli %>% html_nodes("p, span, h1, h2, h3, h4, h5, h6, ul, ol, dt, dd, td, th") %>% html_text() #získání vektoru s textovými elementy stránek jako jeho prvky
  osu_vli<-paste(osu_vli,collapse='') ##Spojení vektoru odstavců do jediného řetězce
  osu_pages<-append(osu_pages,osu_vli) #Přidání řetězce do vektoru osu_pages
}
osu_vlpdf<-read.csv('Odkazy OSU PDF.csv',header=FALSE,sep=';')
n<-nrow(osu_vlpdf)
for (i in 1:n){
  download.file(osu_vlpdf[i,],destfile='soubor.pdf',mode='wb') #Stažení PDF souboru z URL na daném řádku
  pdf.text<- pdftools::pdf_text("soubor.pdf") #Získání textu z PDF souboru
  pdf.text<-paste(pdf.text,collapse='')
  osu_pages<-append(osu_pages,pdf.text)
}

osu_corpus<-corpus(osu_pages) #Vytvoření korpusu z vektoru osu_pages
osu_tokens<-tokens(osu_corpus,remove_numbers = TRUE, remove_punct = TRUE, remove_separators = TRUE, remove_url = TRUE ) #Tokenizace korpusu
osu_kwic<-kwic(osu_tokens,keywords) #Vyhledání klíčových slov v textu
textplot_xray(osu_kwic) + ggtitle('LF OS Všeobecné lékařství') + labs(x='Pozice v textu',y='Označení dokumentu') #Vizualizace klíčových slov
---------------------------------------------------
#Skript UK1
#Načtení knihoven
library(rvest)
library(quanteda)
library(quanteda.textplots)
library(ggplot2)

keywords<-c(phrase('alternat* medicín*'), phrase('anal* dat*'), phrase('datov* analýz*'), 'dezinform*', 'EBM', phrase('založen* na důkazech'), phrase('fake news'), phrase('falešn* zpráv*'), phrase('lživ* zpráv*'), phrase('nepravdiv* zpráv*'), 'infodemi*', phrase('informačn* gramotnost*'), phrase('klinick* studi*'), phrase('konspirační* teori*'), 'kreativ*', phrase('kritick* myšlení*'), 'malinform*', 'misinform*', phrase('odborn* literat*'), phrase('odborn* časopis*'), phrase('otevřen* otázk*'), phrase('predátorsk* časopis*'), phrase('přehledov* pr*'), 'review', phrase('přehledov* studi*'), 'pseudověd*','sebevědom*', phrase('skupinov* aktivit*'), phrase('vědeck* komunikac*'), phrase('vyhledáv* informac*')) #Definice vektoru klíčových slov

uk1_vl<-read.csv('Odkazy 1LF.csv',header=FALSE,sep=';') #Načtení dat z CSV souboru do tabulky
n<-nrow(uk1_vl) #Počet řádků
uk1_pages<-c() #Prázdný vektor
for (i in 1:n){        #Cyklus prováděný pro každý řádek
  uk1_vli<-read_html(uk1_vl[i,]) #Načtení HTML kódu z URL adresy na daném řádku
  uk1_vli<-uk1_vli %>% html_nodes("p, span, h1, h2, h3, h4, h5, h6, ul, ol, dt, dd, td, th") %>% html_text() #získání vektoru s textovými elementy stránek jako jeho prvky
  uk1_vli<-paste(uk1_vli,collapse='') ##Spojení vektoru odstavců do jediného řetězce
  uk1_pages<-append(uk1_pages,uk1_vli) #Přidání řetězce do vektoru uk1_pages
}
uk1_corpus<-corpus(uk1_pages) #Vytvoření korpusu z vektoru uk1_pages
uk1_tokens<-tokens(uk1_corpus,remove_numbers = TRUE, remove_punct = TRUE, remove_separators = TRUE, remove_url = TRUE ) #Tokenizace korpusu
uk1_kwic<-kwic(uk1_tokens,keywords) #Vyhledání klíčových slov v textu
textplot_xray(uk1_kwic) + ggtitle('1. LF UK Všeobecné lékařství') + labs(x='Pozice v textu',y='Označení dokumentu') #Vizualizace klíčových slov
------------------------------------------------
#Skript UK2
#Načtení knihoven
library(rvest)
library(quanteda)
library(quanteda.textplots)
library(ggplot2)

keywords<-c(phrase('alternat* medicín*'), phrase('anal* dat*'), phrase('datov* analýz*'), 'dezinform*', 'EBM', phrase('založen* na důkazech'), phrase('fake news'), phrase('falešn* zpráv*'), phrase('lživ* zpráv*'), phrase('nepravdiv* zpráv*'), 'infodemi*', phrase('informačn* gramotnost*'), phrase('klinick* studi*'), phrase('konspirační* teori*'), 'kreativ*', phrase('kritick* myšlení*'), 'malinform*', 'misinform*', phrase('odborn* literat*'), phrase('odborn* časopis*'), phrase('otevřen* otázk*'), phrase('predátorsk* časopis*'), phrase('přehledov* pr*'), 'review', phrase('přehledov* studi*'), 'pseudověd*','sebevědom*', phrase('skupinov* aktivit*'), phrase('vědeck* komunikac*'), phrase('vyhledáv* informac*')) #Definice vektoru klíčových slov

uk2_vl<-read.csv('Odkazy 2LF.csv',header=FALSE,sep=';') #Načtení dat z CSV souboru do tabulky
n<-nrow(uk2_vl) #Počet řádků
uk2_pages<-c() #Prázdný vektor
for (i in 1:n){        #Cyklus prováděný pro každý řádek
  uk2_vli<-read_html(uk2_vl[i,]) #Načtení HTML kódu z URL adresy na daném řádku
  uk2_vli<-uk2_vli %>% html_nodes("p, span, h1, h2, h3, h4, h5, h6, ul, ol, dt, dd, td, th") %>% html_text() #získání vektoru s textovými elementy stránek jako jeho prvky
  uk2_vli<-paste(uk2_vli,collapse='') ##Spojení vektoru odstavců do jediného řetězce
  uk2_pages<-append(uk2_pages,uk2_vli) #Přidání řetězce do vektoru uk2_pages
}
uk2_corpus<-corpus(uk2_pages) #Vytvoření korpusu z vektoru uk2_pages
uk2_tokens<-tokens(uk2_corpus,remove_numbers = TRUE, remove_punct = TRUE, remove_separators = TRUE, remove_url = TRUE ) #Tokenizace korpusu
uk2_kwic<-kwic(uk2_tokens,keywords) #Vyhledání klíčových slov v textu
textplot_xray(uk2_kwic) + ggtitle('2. LF UK Všeobecné lékařství') + labs(x='Pozice v textu',y='Označení dokumentu') #Vizualizace klíčových slov
---------------------------------------------------------
#Skript UK3
#Načtení knihoven
library(rvest)
library(quanteda)
library(quanteda.textplots)
library(ggplot2)

keywords<-c(phrase('alternat* medicín*'), phrase('anal* dat*'), phrase('datov* analýz*'), 'dezinform*', 'EBM', phrase('založen* na důkazech'), phrase('fake news'), phrase('falešn* zpráv*'), phrase('lživ* zpráv*'), phrase('nepravdiv* zpráv*'), 'infodemi*', phrase('informačn* gramotnost*'), phrase('klinick* studi*'), phrase('konspirační* teori*'), 'kreativ*', phrase('kritick* myšlení*'), 'malinform*', 'misinform*', phrase('odborn* literat*'), phrase('odborn* časopis*'), phrase('otevřen* otázk*'), phrase('predátorsk* časopis*'), phrase('přehledov* pr*'), 'review', phrase('přehledov* studi*'), 'pseudověd*','sebevědom*', phrase('skupinov* aktivit*'), phrase('vědeck* komunikac*'), phrase('vyhledáv* informac*')) #Definice vektoru klíčových slov

uk3_vl<-read.csv('Odkazy 3LF.csv',header=FALSE,sep=';') #Načtení dat z CSV souboru do tabulky
n<-nrow(uk3_vl) #Počet řádků
uk3_pages<-c() #Prázdný vektor
for (i in 1:n){        #Cyklus prováděný pro každý řádek
  uk3_vli<-read_html(uk3_vl[i,]) #Načtení HTML kódu z URL adresy na daném řádku
  uk3_vli<-uk3_vli %>% html_nodes("p, span, h1, h2, h3, h4, h5, h6, ul, ol, dt, dd, td, th") %>% html_text() #získání vektoru s textovými elementy stránek jako jeho prvky
  uk3_vli<-paste(uk3_vli,collapse='') ##Spojení vektoru odstavců do jediného řetězce
  uk3_pages<-append(uk3_pages,uk3_vli) #Přidání řetězce do vektoru uk3_pages
}
uk3_corpus<-corpus(uk3_pages) #Vytvoření korpusu z vektoru uk3_pages
uk3_tokens<-tokens(uk3_corpus,remove_numbers = TRUE, remove_punct = TRUE, remove_separators = TRUE, remove_url = TRUE ) #Tokenizace korpusu
uk3_kwic<-kwic(uk3_tokens,keywords) #Vyhledání klíčových slov v textu
textplot_xray(uk3_kwic) + ggtitle('3. LF UK Všeobecné lékařství') + labs(x='Pozice v textu',y='Označení dokumentu') #Vizualizace klíčových slov
-----------------------------------------------
#Skript HK
#Načtení knihoven
library(rvest)
library(quanteda)
library(quanteda.textplots)
library(ggplot2)

keywords<-c(phrase('alternat* medicín*'), phrase('anal* dat*'), phrase('datov* analýz*'), 'dezinform*', 'EBM', phrase('založen* na důkazech'), phrase('fake news'), phrase('falešn* zpráv*'), phrase('lživ* zpráv*'), phrase('nepravdiv* zpráv*'), 'infodemi*', phrase('informačn* gramotnost*'), phrase('klinick* studi*'), phrase('konspirační* teori*'), 'kreativ*', phrase('kritick* myšlení*'), 'malinform*', 'misinform*', phrase('odborn* literat*'), phrase('odborn* časopis*'), phrase('otevřen* otázk*'), phrase('predátorsk* časopis*'), phrase('přehledov* pr*'), 'review', phrase('přehledov* studi*'), 'pseudověd*','sebevědom*', phrase('skupinov* aktivit*'), phrase('vědeck* komunikac*'), phrase('vyhledáv* informac*')) #Definice vektoru klíčových slov

hk_vl<-read.csv('Odkazy LFHK.csv',header=FALSE,sep=';') #Načtení dat z CSV souboru do tabulky
n<-nrow(hk_vl) #Počet řádků
hk_pages<-c() #Prázdný vektor
for (i in 1:n){        #Cyklus prováděný pro každý řádek
  hk_vli<-read_html(hk_vl[i,]) #Načtení HTML kódu z URL adresy na daném řádku
  hk_vli<-hk_vli %>% html_nodes("p, span, h1, h2, h3, h4, h5, h6, ul, ol, dt, dd, td, th") %>% html_text() #získání vektoru s textovými elementy stránek jako jeho prvky
  hk_vli<-paste(hk_vli,collapse='') ##Spojení vektoru odstavců do jediného řetězce
  hk_pages<-append(hk_pages,hk_vli) #Přidání řetězce do vektoru hk_pages
}
hk_corpus<-corpus(hk_pages) #Vytvoření korpusu z vektoru hk_pages
hk_tokens<-tokens(hk_corpus,remove_numbers = TRUE, remove_punct = TRUE, remove_separators = TRUE, remove_url = TRUE ) #Tokenizace korpusu
hk_kwic<-kwic(hk_tokens,keywords) #Vyhledání klíčových slov v textu
textplot_xray(hk_kwic) + ggtitle('LF HK Všeobecné lékařství') + labs(x='Pozice v textu',y='Označení dokumentu') #Vizualizace klíčových slov
---------------------------------------
#Skript Plzeň
#Načtení knihoven
library(rvest)
library(quanteda)
library(quanteda.textplots)
library(ggplot2)

keywords<-c(phrase('alternat* medicín*'), phrase('anal* dat*'), phrase('datov* analýz*'), 'dezinform*', 'EBM', phrase('založen* na důkazech'), phrase('fake news'), phrase('falešn* zpráv*'), phrase('lživ* zpráv*'), phrase('nepravdiv* zpráv*'), 'infodemi*', phrase('informačn* gramotnost*'), phrase('klinick* studi*'), phrase('konspirační* teori*'), 'kreativ*', phrase('kritick* myšlení*'), 'malinform*', 'misinform*', phrase('odborn* literat*'), phrase('odborn* časopis*'), phrase('otevřen* otázk*'), phrase('predátorsk* časopis*'), phrase('přehledov* pr*'), 'review', phrase('přehledov* studi*'), 'pseudověd*','sebevědom*', phrase('skupinov* aktivit*'), phrase('vědeck* komunikac*'), phrase('vyhledáv* informac*')) #Definice vektoru klíčových slov

plz_vl<-read.csv('Odkazy LFP.csv',header=FALSE,sep=';') #Načtení dat z CSV souboru do tabulky
n<-nrow(plz_vl) #Počet řádků
plz_pages<-c() #Prázdný vektor
for (i in 1:n){        #Cyklus prováděný pro každý řádek
  plz_vli<-read_html(plz_vl[i,]) #Načtení HTML kódu z URL adresy na daném řádku
  plz_vli<-plz_vli %>% html_nodes("p, span, h1, h2, h3, h4, h5, h6, ul, ol, dt, dd, td, th") %>% html_text() #získání vektoru s textovými elementy stránek jako jeho prvky
  plz_vli<-paste(plz_vli,collapse='') ##Spojení vektoru odstavců do jediného řetězce
  plz_pages<-append(plz_pages,plz_vli) #Přidání řetězce do vektoru plz_pages
}
plz_corpus<-corpus(plz_pages) #Vytvoření korpusu z vektoru plz_pages
plz_tokens<-tokens(plz_corpus,remove_numbers = TRUE, remove_punct = TRUE, remove_separators = TRUE, remove_url = TRUE ) #Tokenizace korpusu
plz_kwic<-kwic(plz_tokens,keywords) #Vyhledání klíčových slov v textu
textplot_xray(plz_kwic) + ggtitle('LF Plzeň Všeobecné lékařství') + labs(x='Pozice v textu',y='Označení dokumentu') #Vizualizace klíčových slov
-----------------------------------------------
#Skript UKB
#Načtení knihoven
library(rvest)
library(quanteda)
library(quanteda.textplots)
library(ggplot2)
library(pdftools)

keywords<-c(phrase('alternat* medicín*'), phrase('anal* dát*'), phrase('dátov* analýz*'), 'dezinform*', 'EBM', phrase('založen* na dôkazoch'), phrase('fake news'), phrase('falošn* správ*'), phrase('klamn* správ*'), phrase('nepravdiv* správ*'), 'infodémi*', phrase('informačn* gramotnos*'), phrase('klinick* štúdi*'), phrase('klinick* skúšeni*'), phrase('konspiračn* teóri*'), 'kreativ*', phrase('kritick* mysleni*'), 'malinform*', 'misinform*', phrase('odborn* literat*'), phrase('odborn* časopis*'), phrase('otvoren* otázk*'), phrase('predátorsk* časopis*'), phrase('prehľadov* pr*'), 'review', phrase('prehľadov* štúdi*'), 'pseudoved*','sebavedom*', phrase('skupinov* aktivit*'), phrase('vedeck* komunikáci*'), phrase('vyhľadáv* informáci*')) #Definice vektoru klíčových slov

ukb_vl<-read.csv('Odkazy UKB.csv',header=FALSE,sep=';') #Načtení dat z CSV souboru do tabulky
n<-nrow(ukb_vl) #Počet řádků
ukb_pages<-c() #Prázdný vektor
for (i in 1:n){        #Cyklus prováděný pro každý řádek
  ukb_vli<-read_html(ukb_vl[i,]) #Načtení HTML kódu z URL adresy na daném řádku
  ukb_vli<-ukb_vli %>% html_nodes("p, span, h1, h2, h3, h4, h5, h6, ul, ol, dt, dd, td, th") %>% html_text() #získání vektoru s textovými elementy stránek jako jeho prvky
  ukb_vli<-paste(ukb_vli,collapse='') ##Spojení vektoru odstavců do jediného řetězce
  ukb_pages<-append(ukb_pages,ukb_vli) #Přidání řetězce do vektoru ukb_pages
}
ukb_vlpdf<-read.csv('Odkazy UKB PDF.csv',header=FALSE,sep=';')
n<-nrow(ukb_vlpdf)
for (i in 1:n){
  download.file(ukb_vlpdf[i,],destfile='soubor.pdf',mode='wb') #Stažení PDF souboru z URL na daném řádku
  pdf.text<- pdftools::pdf_text("soubor.pdf") #Získání textu z PDF souboru
  pdf.text<-paste(pdf.text,collapse='')
  ukb_pages<-append(ukb_pages,pdf.text)
}

ukb_corpus<-corpus(ukb_pages) #Vytvoření korpusu z vektoru ukb_pages
ukb_tokens<-tokens(ukb_corpus,remove_numbers = TRUE, remove_punct = TRUE, remove_separators = TRUE, remove_url = TRUE ) #Tokenizace korpusu
ukb_kwic<-kwic(ukb_tokens,keywords) #Vyhledání klíčových slov v textu
textplot_xray(ukb_kwic) + ggtitle('LF UK Bratislava Všeobecné lekárstvo') + labs(x='Pozice v textu',y='text9') #Vizualizace klíčových slov #Popisek osy y upraven dle získaných výsledků
-----------------------------------------------------------------------------
#Skript JLF
#Načtení knihoven
library(rvest)
library(quanteda)
library(quanteda.textplots)
library(ggplot2)
library(pdftools)

keywords<-c(phrase('alternat* medicín*'), phrase('anal* dát*'), phrase('dátov* analýz*'), 'dezinform*', 'EBM', phrase('založen* na dôkazoch'), phrase('fake news'), phrase('falošn* správ*'), phrase('klamn* správ*'), phrase('nepravdiv* správ*'), 'infodémi*', phrase('informačn* gramotnos*'), phrase('klinick* štúdi*'), phrase('klinick* skúšeni*'), phrase('konspiračn* teóri*'), 'kreativ*', phrase('kritick* mysleni*'), 'malinform*', 'misinform*', phrase('odborn* literat*'), phrase('odborn* časopis*'), phrase('otvoren* otázk*'), phrase('predátorsk* časopis*'), phrase('prehľadov* pr*'), 'review', phrase('prehľadov* štúdi*'), 'pseudoved*','sebavedom*', phrase('skupinov* aktivit*'), phrase('vedeck* komunikáci*'), phrase('vyhľadáv* informáci*')) #Definice vektoru klíčových slov

jlf_vl<-read.csv('Odkazy JLF.csv',header=FALSE,sep=';') #Načtení dat z CSV souboru do tabulky
n<-nrow(jlf_vl) #Počet řádků
jlf_pages<-c() #Prázdný vektor
for (i in 1:n){        #Cyklus prováděný pro každý řádek
  jlf_vli<-read_html(jlf_vl[i,]) #Načtení HTML kódu z URL adresy na daném řádku
  jlf_vli<-jlf_vli %>% html_nodes("p, span, h1, h2, h3, h4, h5, h6, ul, ol, dt, dd, td, th") %>% html_text() #získání vektoru s textovými elementy stránek jako jeho prvky
  jlf_vli<-paste(jlf_vli,collapse='') ##Spojení vektoru odstavců do jediného řetězce
  jlf_pages<-append(jlf_pages,jlf_vli) #Přidání řetězce do vektoru jlf_pages
}
jlf_vlpdf<-read.csv('Odkazy jlf PDF.csv',header=FALSE,sep=';')
n<-nrow(jlf_vlpdf)
for (i in 1:n){
  download.file(jlf_vlpdf[i,],destfile='soubor.pdf',mode='wb') #Stažení PDF souboru z URL na daném řádku
  pdf.text<- pdftools::pdf_text("soubor.pdf") #Získání textu z PDF souboru
  pdf.text<-paste(pdf.text,collapse='')
  jlf_pages<-append(jlf_pages,pdf.text)
}

jlf_corpus<-corpus(jlf_pages) #Vytvoření korpusu z vektoru jlf_pages
jlf_tokens<-tokens(jlf_corpus,remove_numbers = TRUE, remove_punct = TRUE, remove_separators = TRUE, remove_url = TRUE ) #Tokenizace korpusu
jlf_kwic<-kwic(jlf_tokens,keywords) #Vyhledání klíčových slov v textu
textplot_xray(jlf_kwic) + ggtitle('LF JLF Všeobecné lekárstvo') + labs(x='Pozice v textu',y='Označení dokumentu') #Vizualizace klíčových slov
------------------------------------------------------
#Skript UPJŠ
#Načtení knihoven
library(rvest)
library(quanteda)
library(quanteda.textplots)
library(ggplot2)

keywords<-c(phrase('alternat* medicín*'), phrase('anal* dát*'), phrase('dátov* analýz*'), 'dezinform*', 'EBM', phrase('založen* na dôkazoch'), phrase('fake news'), phrase('falošn* správ*'), phrase('klamn* správ*'), phrase('nepravdiv* správ*'), 'infodémi*', phrase('informačn* gramotnos*'), phrase('klinick* štúdi*'), phrase('klinick* skúšeni*'), phrase('konspiračn* teóri*'), 'kreativ*', phrase('kritick* mysleni*'), 'malinform*', 'misinform*', phrase('odborn* literat*'), phrase('odborn* časopis*'), phrase('otvoren* otázk*'), phrase('predátorsk* časopis*'), phrase('prehľadov* pr*'), 'review', phrase('prehľadov* štúdi*'), 'pseudoved*','sebavedom*', phrase('skupinov* aktivit*'), phrase('vedeck* komunikáci*'), phrase('vyhľadáv* informáci*')) #Definice vektoru klíčových slov

upjs_vl<-read.csv('Odkazy UPJŠ.csv',header=FALSE,sep=';') #Načtení dat z CSV souboru do tabulky
n<-nrow(upjs_vl) #Počet řádků
upjs_pages<-c() #Prázdný vektor
for (i in 1:n){        #Cyklus prováděný pro každý řádek
  upjs_vli<-read_html(upjs_vl[i,]) #Načtení HTML kódu z URL adresy na daném řádku
  upjs_vli<-upjs_vli %>% html_nodes("p, span, h1, h2, h3, h4, h5, h6, ul, ol, dt, dd, td, th") %>% html_text() #získání vektoru s textovými elementy stránek jako jeho prvky
  upjs_vli<-paste(upjs_vli,collapse='') ##Spojení vektoru odstavců do jediného řetězce
  upjs_pages<-append(upjs_pages,upjs_vli) #Přidání řetězce do vektoru upjs_pages
}
upjs_corpus<-corpus(upjs_pages) #Vytvoření korpusu z vektoru upjs_pages
upjs_tokens<-tokens(upjs_corpus,remove_numbers = TRUE, remove_punct = TRUE, remove_separators = TRUE, remove_url = TRUE ) #Tokenizace korpusu
upjs_kwic<-kwic(upjs_tokens,keywords) #Vyhledání klíčových slov v textu
textplot_xray(upjs_kwic) + ggtitle('LF UPJŠ 	Všeobecné lekárstvo') + labs(x='Pozice v textu',y='Označení dokumentu') #Vizualizace klíčových slov
---------------------------------------------------------------
#Skript SZU
#Načtení knihoven
library(rvest)
library(quanteda)
library(quanteda.textplots)
library(ggplot2)
library(pdftools)

keywords<-c(phrase('alternat* medicín*'), phrase('anal* dát*'), phrase('dátov* analýz*'), 'dezinform*', 'EBM', phrase('založen* na dôkazoch'), phrase('fake news'), phrase('falošn* správ*'), phrase('klamn* správ*'), phrase('nepravdiv* správ*'), 'infodémi*', phrase('informačn* gramotnos*'), phrase('klinick* štúdi*'), phrase('klinick* skúšeni*'), phrase('konspiračn* teóri*'), 'kreativ*', phrase('kritick* mysleni*'), 'malinform*', 'misinform*', phrase('odborn* literat*'), phrase('odborn* časopis*'), phrase('otvoren* otázk*'), phrase('predátorsk* časopis*'), phrase('prehľadov* pr*'), 'review', phrase('prehľadov* štúdi*'), 'pseudoved*','sebavedom*', phrase('skupinov* aktivit*'), phrase('vedeck* komunikáci*'), phrase('vyhľadáv* informáci*')) #Definice vektoru klíčových slov

szu_vl<-read.csv('Odkazy SZU.csv',header=FALSE,sep=';') #Načtení dat z CSV souboru do tabulky
n<-nrow(szu_vl) #Počet řádků
szu_pages<-c() #Prázdný vektor
for (i in 1:n){        #Cyklus prováděný pro každý řádek
  szu_vli<-read_html(szu_vl[i,]) #Načtení HTML kódu z URL adresy na daném řádku
  szu_vli<-szu_vli %>% html_nodes("p, span, h1, h2, h3, h4, h5, h6, ul, ol, dt, dd, td, th") %>% html_text() #získání vektoru s textovými elementy stránek jako jeho prvky
  szu_vli<-paste(szu_vli,collapse='') ##Spojení vektoru odstavců do jediného řetězce
  szu_pages<-append(szu_pages,szu_vli) #Přidání řetězce do vektoru szu_pages
}
szu_vlpdf<-read.csv('Odkazy SZU PDF.csv',header=FALSE,sep=';')
n<-nrow(szu_vlpdf)
for (i in 1:n){
  download.file(szu_vlpdf[i,],destfile='soubor.pdf',mode='wb') #Stažení PDF souboru z URL na daném řádku
  pdf.text<- pdftools::pdf_text("soubor.pdf") #Získání textu z PDF souboru
  pdf.text<-paste(pdf.text,collapse='')
  szu_pages<-append(szu_pages,pdf.text)
}

szu_corpus<-corpus(szu_pages) #Vytvoření korpusu z vektoru szu_pages
szu_tokens<-tokens(szu_corpus,remove_numbers = TRUE, remove_punct = TRUE, remove_separators = TRUE, remove_url = TRUE ) #Tokenizace korpusu
szu_kwic<-kwic(szu_tokens,keywords) #Vyhledání klíčových slov v textu
textplot_xray(szu_kwic) + ggtitle('LF SZU Všeobecné lekárstvo') + labs(x='Pozice v textu',y='Označení dokumentu') #Vizualizace klíčových slov