Doğal dil işlemede çizgesel ve olasılık tabanlı bir otomatik öğrenme uygulaması

Agun, Hayri Volkan

Doğal dil işlemede çizgesel ve olasılık tabanlı bir otomatik öğrenme uygulaması

dc.contributor.advisor	Kılıçaslan, Yılmaz
dc.contributor.author	Agun, Hayri Volkan
dc.date.accessioned	2014-04-13T06:34:21Z
dc.date.available	2014-04-13T06:34:21Z
dc.date.issued	2008
dc.department	Enstitüler, Fen Bilimleri Enstitüsü, Bilgisayar Mühendisliği Ana Bilim Dalı	en_US
dc.description	Yüksek Lisans	tr
dc.description.abstract	Bu tez çalışmasında Türkçe'deki sözdizimsel özelliklerin öğrenilmesi için çizge tabanlı bir otomatik öğrenme modeli sunulmaktadır. Çalışmada bir derlem kullanılarak tasarlanan çizge modeli eğitilmiş ve girilen bir cümle için doğru sözdizimsel etiketler bu model aracılığıyla çıkarılmıştır. Modelin tasarımı sırasında, olasılık tabanlı çizge modeli olan Saklı Markov Modelleri ve çizge teorisinden yararlanılmıştır. Sunulan çalışmada diğer olasılık tabanlı etiketleme algoritmalarından ve istatistiksel doğal dil işleme çalışmalarından farklı olarak Türkçe'nin biçimbilimsel özelliklerinin de kullanılabildiği olasılık tabanlı bir çizge modeli geliştirilmiştir. İlk olarak, ODTÜ-Sabancı Ağaç derleminden model için belirlenen bağlantılara göre bir çizge üretilmiş, daha sonra bu çizge üzerinden sözdizimsel öğelerin bulunabileceği Saklı Markov Modeli oluşturulmuş ve bu modelin üzerinde Viterbi algoritması uygulanarak bir cümle için sözdizimsel öğelerin bulunması sağlanmıştır. Modelin testi için N-Kere Çapraz Doğrulama algoritması kullanılarak başarı ölçülmüştür. Karmaşık derlem çizge modelinden Saklı Markov Modelinin bulunması için çizge teorisinde kullanılan Subdue çizge eşleme algoritmasından yararlanılmıştır. Saklı Markov Modeli ve çizge arama algoritmalarını birlikte kullanılarak daha karmaşık ilişkiye sahip öğeleri (sözdizimsel ve biçimbilimsel ilişkiler gibi) öğrenme için gereken model yapısı oluşturulmuştur. Karmaşık ilişkilerin, sonuç çıkarma ve otomatik öğrenme metotlarının bir arada kullanarak öğrenilmesi, ileride kavram uzayının öğrenilmesi doğrultusunda yapılabilecek çalışmalar için bir alt yapı oluşturmaktadır. Tezin organizasyonu şu şeklidedir. İlk bölüm Türkçe'nin karakteristiği ve istatistiksel doğal dil işleme konularını, ikinci bölüm çalışmanın konusu olan çizge algoritmalarını, üçüncü bölüm uygulamada kullanılan Saklı Markov Modellerini ve dördüncü bölüm uygulamayı ve sonuçlarını, beşinci bölüm ise yorumları içermektedir. Anahtar Kelimeler: Saklı Markov Modelleri, Türkçe için Sözdizimsel Etiketleme, Düzleme Teknikleri. Kümeleme, Çizge Madenciliği	en_US
dc.description.abstract	In this thesis, a model based on combinatorial and probabilistic graphical approaches is proposed for learning of syntactic tor m s for Turkish sentences. A Treebank is used to train a designed probabilistic graphical model and syntactic tags are inferred for a Turkish sentence from this model. Hidden Markov Models and Graph Theory constitute the framework for this model and application. In this proposed model, in a way different from other probabilistic tagging methods and statistical natural language processing applications, a probabilistic graphical model has been developed for syntactic tagging based on morphological features of Turkish language. In the application, firstly a graph model has been constructed from METU-Sabanci Treebank based on certain relations; secondly, a Hidden Markov Model which was extracted from the graph model has been created and trained by the Viterbi algorithm in order to find syntactic features of a given sentence. In order to test the model the N-Fold Cross Validation algorithm is used. When extracting the Hidden Markov Model from the complex Treebank graph model the Subdue graph matching algorithm is used. In conclusion, it is observed that graph models and graph mining algorithms can be a new model in learning of complex relations such as syntactic and morphological relations. Since this study offers an exemplary case where discrete mathematical models and machine learning algorithms are used together, it theoretically supports conceptual space learning studies. The organization of the thesis is as follows: First chapter presents the characteristics of Turkish and gives an account of statistical natural language processing applications. The second chapter includes the graph algorithms which are used in this study. The third chapter offers information about Hidden Markov Models and language smoothing techniques. The forth chapter reports on the application and its results. The fifth chapter includes a conclusion	en_US
dc.identifier.uri	https://hdl.handle.net/20.500.14551/556
dc.identifier.yoktezid	179824	en_US
dc.language.iso	tr	en_US
dc.publisher	Trakya Üniversitesi Fen Bilimleri Enstitüsü	en_US
dc.relation.publicationcategory	Tez	en_US
dc.rights	info:eu-repo/semantics/openAccess	en_US
dc.subject	Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol	en_US
dc.subject	Computer Engineering and Computer Science and Control	en_US
dc.subject	Bilim ve Teknoloji	en_US
dc.subject	Science and Technology	en_US
dc.subject	Doğal Dil Sistemi	en_US
dc.subject	Natural Language System	en_US
dc.subject	Olasılık Çıkarımı	en_US
dc.subject	Probability Inference	en_US
dc.subject	Saklı Markov Modeli	en_US
dc.subject	Hidden Markov Model	en_US
dc.title	Doğal dil işlemede çizgesel ve olasılık tabanlı bir otomatik öğrenme uygulaması	en_US
dc.title.alternative	A machine learning application in natural language processing based on probabilistic graph models	en_US
dc.type	Master Thesis	en_US
dc.type.description	No: 0040088	en_US

Dosyalar

Orijinal paket

Listeleniyor 1 - 1 / 1

İsim:: 0071014.pdf
Boyut:: 945.33 KB
Biçim:: Adobe Portable Document Format
Açıklama:: Tam Metin / Full Text

İndir

Lisans paketi

Listeleniyor 1 - 1 / 1

İsim:: license.txt
Boyut:: 1.71 KB
Biçim:: Item-specific license agreed upon to submission
Açıklama:

İndir

Koleksiyon

Fen Bilimleri Enstitüsü Tez Koleksiyonu