Diff for ''

Revision 29
Author:
black
Time:
2024-07-16 13:59
Revision 85
Time:
2024-09-18 21:04
Comment:
Automatizovaná konverze z MediaWiki do Markdownu
Deletions are marked like this. Additions are marked like this.
Line 1: Line 1:
{{Předmět|Úvod do počítačové lingvistiky|Vladislav Kuboň|PFL012}} {{Předmět|Dobývání znalostí|Doc. RNDr. Mrázová Iveta, CSc.|NDBI023}}
Line 3: Line 3:
Úvodní přednáška do počítačové lingvistiky. Výklad doktora Kuboně je srozumitelný a v rozumné míře zábavný, poměr teorie a praktických ukázek je vyrovnaný. ## Požadavky 12/13 ##
Line 5: Line 5:
== Zkouška ==
Na zkoušku se lze během jednoho dne v pohodě naučit (tomu, kdo nechodil na přednášky, to může trvat o něco déle). Zkouška je písemná, jedna velká otázka a 7 menších. Na jedničku je třeba umět všechna klíčová slova k dané otázce.
* výsledná známka = 40% body ze zkoušky, 20% body z dvou písemek, 40% body z úkolů ze cvičení a projektu (včetně bodů ze cvičení, všechny úkoly jsou povinné)
* vypracovat projekt
* celkem je potreba splnit aspon 56%
* terminy v září budou jeden až dva
Line 8: Line 10:
=== Otázky ===
* Co je wordnet?
* Popište systém ASIMUT.
* Podrobně popiště systém MOSAIC.
* Používá MOSAIC syntaktickou analýzu? Proč?
* Co je a na co slouží strukturní index u Chomského gramatiky?
* Pražský závislostní korpus (PDT)
* Unifikační gramatiky - výhody/nevýhody
* Systém Česílko
* Kontrola překlepů
* Co je morfém a jak ho klasifikujeme?
* Nakreslete složkový a závislostní strom pro větu "Ve včerejším závodu startovali výborní skokani."
* Převeďte složkový strom na závislostní
* Co je překladová paměť?
* Co je vyhlazování?
* Brownův korpus
* Co je ontologie a jak se používá?
* Chomskeho teorie
* Co je alomorf?
* Bickel-Schroderova metoda
* PennTreebank
* Sestavy rysu a jejich použití.
* Co je transfér v automatickém překladu – přenos zanalyzované věty z jednoho jazyka do druhého (slovosled, morfologie)
* Jaký je rozdíl mezi interlinguou a pivotním jazykem?
* Co je TAG (velmi stručně popište)
* Popište model zašuměného kanálu.
* Funkční generativní popis stručně
* Statistické metody prekladu
* co je LFG?
* co je Two-Level morphology?
* BLEU
* rozdil intenze/extenze
* transparentní intenzionální logika
* co je ATN? (Augmented transition network)
* Stručně popište Český národní korpus(složení, velikost, typy značek).
* Popište Vauquoisův trojúhelník. (trojúhelník s interlinguou na vrcholu)
* Stručně popište systém METEO.
* Stručně popište rozdíl mezi hloubkovou a povrchovou rovinou analýzy syntaxe.
* rozdil mezi morfologickou analyzou a taggingem
* 3 hlavní přístupy k popisu morfologie
* Q systemy (k comu sluzia, kde su aplikované, ako funguju)
* dělení anafor a jak se řeší algoritmicky
* Co je to lemmatizace a kde se používá?
* ALPAC
* metody kontroly gramatickej spravnosti viet (hlavne javy, specificke javy pre cestinu, implementacia)
* Co je to teorie minimalismu, kdo je autorem a co jí předcházelo
## Zdroje k předmětu ##
Line 55: Line 12:
== Poznámky ==
[[PFL012-poznámky|Nekompletní přepis poznámek]]
* [Stránky předmětu](http://ksvi.mff.cuni.cz/%7Emraz/datamining/index.html)
* <NDBI023%20Shrnutí>
Line 58: Line 15:
* [Wikipedia:Datamining](Wikipedia:Datamining)
* [Statistics Tutorials](http://home.okstate.edu/homepages.nsf/toc/onlinetutorialsstatistics)
* [How to choose a statistical test](http://www.graphpad.com/www/book/choose.htm)
* [Statistical Data Mining Tutorials](http://www.autonlab.org/tutorials/)
* [Data mining in Matlab](http://matlabdatamining.blogspot.cz/)
Line 59: Line 21:
== Materiály ==
Materiály (slajdy a draft skript) posílá přednášející mailem všem, co mají předmět zapsaný. Případně jsou dostupné v SISu na stránce předmětu (po přihlášení). Případně existuje i [http://www.marketa.najevisti.info/dokumenty/Lingvistika-priprava.pdf vypracovaný hangout] od studentů.
### Fisherův test ###
Line 62: Line 23:
== Literatura ==
* Eva Hajičová, Jarmila Panevová, Petr Sgall: Úvod do teoretické a počítačové lingvistiky, I. svazek &ndash; Teoretická lingvistika (Karolinum 2002, ISBN 80-246-0470-1)
** kniha je dostupná ve fakultní knihovně na Malé Straně
* http://en.wikipedia.org/wiki/Fisher%27s_exact_test#Example - odvození, příklad jednostranného
* http://oldweb.izip.cz/ds3/hypertext/JZAAA.htm - příklad česky
* http://www.quantpsy.org/fisher/fisher.htm - hezké vysvětlení jednostranných a oboustranných testů, kalkulačka
* http://graphpad.com/quickcalcs/contingency2/ - ještě jedna kalkulačka pro kontrolu :)
* http://www.stahroun.me.cz/interstat/kategorialni/asociace/fisher/index.htm - spousta zdrojů
Line 66: Line 29:
[[Category:Matematická lingvistika]] ### chi-kvadrát test ###

* http://mathhelpforum.com/advanced-statistics/44800-two-tailed-chi-squared-tests.html - trošku světla na oboustranné testy
* http://stats.stackexchange.com/questions/22347/chi-squared-always-a-one-sided-test - a jeste jednou oboustranné testy
* http://itl.nist.gov/div898/handbook/eda/section3/eda3674.htm - tabulky

## Písemky ##

[NDBI023_Písemky](NDBI023_Písemky)

## Příklady ze cvičení ##

### Algoritmus TDIDT/ID3 ###

* http://ksvi.mff.cuni.cz/~mraz/datamining/Cvicenie_DT.pdf

Zvol jeden atribut jako kořen podstromu

#### Kořen ####

##### Vitamín #####

* B (2+, 3-)

$-\frac{n_+(Vit(B))}{n(Vit(B))}.log_2\frac {n_+(Vit(B))}{n(Vit(B))} - \frac{n_-(Vit(B))}{n(Vit(B))}.log_2\frac {n_-(Vit(B))}{n(Vit(B))} = - \frac{2}{5}.log_2\frac {2}{5} - \frac{3}{5}.log_2\frac {3}{5} = 0.97$

* C (4+, 0-)

$\dots = 0.0$ (z "definície"...)

* D (3+, 2-)

$\dots = 0.97$

Entropia: $H(Vit) = \frac{0.971*5 + 0*4 + 0.971*5}{14} = 0.6936$ (vážený priemer)

##### Velikost rodiny #####

* veľká (2+, 2-)

$-\frac{n_+(Rodina(velka))}{m(Rodina(velka))}.log_2\frac {n_+(Rodina(velka))}{n(Rodina(velka))} - \frac{n_-(Rodina(velka))}{n(Rodina(velka))}.log_2\frac {n_-(Rodina(velka))}{n(Rodina(velka))} = 1$

* stredná (4+, 2-)

$\dots = 0.9183$

* malá (3+, 1-)

$\dots = 0.8113$

Entropia: $H(Rodina)=0.9111$

##### Cvičil #####

* pravidelně (3+, 4-)

$\dots = - \frac{3}{7}.log_2\frac {3}{7} - \frac{4}{7}.log_2\frac {4}{7} = 0.985$

* málo (6+, 1-)

$\dots = - \frac{6}{7}.log_2\frac {6}{7} - \frac{1}{7}.log_2\frac {1}{7} = 0.592$

Entropia: $H(Cvicil) = \frac{0.985*7 + 0.592*7}{14} = 0.7885$

##### Bypass #####

Entropia: $H(Bypass)=0.8922$

... budeme teda pokračovať podľa atribútu Vitamín (najmenšia entropia).

Množinu rozdelíme na 3 skupiny (B,C,D). C-čko všetci prežili, máme dve skupiny pre Bcomplex a D - spočítame znovu strednú entropiu (aby sme vedeli, podľa čoho ďalej štiepiť).

#### B ####

vyberieme riadky s Bcomplex a robíme to isté :)

##### Velikost rodiny #####

* veľká (0, 2-)

$\dots = 0$ (z "definice"...)

* stredná (1+, 1-)

$\dots = 1$

* malá (1+, 0)

$\dots = 0$ (z "definice"...)

Entropia: $H(Rodina) = \frac{0*2 + 1*2 + 0*1}{5} = 0.4$

##### Cvicil #####

$H(Cvicil)=0$

##### Bypass #####

$H(Bypass)=0.9183$

#### C ####

...je jasné, tam nik nezomrel... :)

#### D ####

$H(Rodina)=0.9183$
$H(Cvicil)=0.9183$

$H(Bypass)=0$

...ďalej sa teda bude štiepiť v Bčku podľa "Cvicil" a v Dčku podľa "Bypass"

&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;Vitamin / | \ B/ C| \D Cviceni + Bypassprav./ m.| a| n\ - + - +

### Perceptron ###

* uloha: naucit perceptron rozoznavat body v 2D na 2 skupiny...

* popis perceptronu v matlabe: $p=\[ \begin{matrix} w_1 & w_2 & prah \end{matrix} ]$
&nbsp;&nbsp;&nbsp;&nbsp;* vyhodnoti sa potom... $x=\[\begin{matrix} x_1 & x_2 \end{matrix} ]$ => $perc_{recall} = w_1*x_1 + w_2*x_2 + prah*1$
&nbsp;&nbsp;&nbsp;&nbsp;* ...rozsireny vstupny vektor $x_1'=\[\begin{matrix} x_1 & x_2 & 1 \end{matrix} ]$
&nbsp;&nbsp;&nbsp;&nbsp;* $vystup=hardlim1(p*x_1')$ (hardlim1(<=0)=0; hardlim1(>0)=1)

* inicializacia : $p=\[ \begin{matrix} 1 1 1 \end{matrix} ]$
* vstup: $A=\left\[ \begin{matrix} 1 & 1 & 2 & 3 \\ 1 & 3 & 2 & 1 \end{matrix} \right]$
* vystup (chceme): $ c = \[ \begin{matrix} 1 & 1 & 0 & 0 \end{matrix} ] $

* uciaca konstanta $a=0.2$
* ucenie prebieha takto:
&nbsp;&nbsp;&nbsp;&nbsp;* vezme sa vzor, ak sedi, nic nerobime
&nbsp;&nbsp;&nbsp;&nbsp;* ak najdeme chybu - pricitame/odcitame (pozadovany-skutocny vystup - napr. v priklade $y=hardlim1(p*AA); dif=c(3)-y(3)$) dany vektor k vaham... $(c(3)-y(3))*AA(:,3)$
&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;* dostavam novy perceptron $p1=p+a*((c(3)-y(3))*AA(:,3))'$
&nbsp;&nbsp;&nbsp;&nbsp;* $y1=hardlim1(p1*AA) = \[ \begin{matrix} 1 & 1 & 1 & 1 \end{matrix} ]$
&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;* to je zla matica (ma byt samozrejme \[1 1 0 0])- znovu zopakujeme postup...

****$ p1=\[ \begin{matrix} 0.6 & 0.6 & -0.2 \end{matrix} ] => y1=\[ \begin{matrix} 1 & 1 & 1 & 1 \end{matrix} ]$
****$ p2=\[ \begin{matrix} 0 & 0.4 & -0.4 \end{matrix} ] => y2=\[ \begin{matrix} 0 & 1 & 1 & 0 \end{matrix} ]$

*****teraz budeme skusat prvy vektor (ktory je nespravny)
****$ p3=\[ \begin{matrix} 0.2 & 0.6 & -0.2 \end{matrix} ] => y2=\[ \begin{matrix} 1 & 1 & 1 & 1 \end{matrix} ]$

* ... N iteracii (N=?)

[Category:Informatika](Category:Informatika)