İddiaların teyit gerekliliğine göre önceliklendirilmesi / Yavuz Selim Kartal ; thesis advisor Mücahid Kutlu.

By:

Kartal, Yavuz Selim [author]

Contributor(s):

Material type: Text

TextLanguage: Türkçe Publisher: Ankara : TOBB ETÜ Fen Bilimleri Enstitüsü, 2021Description: xvi, 62 pages : illustrations ; 29 cmContent type:

text

Media type:

unmediated

Carrier type:

volume

Other title:

Prioritizing check-worthy claims [Parallel title]

Subject(s):

Dissertation note: Tez (Yüksek Lisans Tezi)--TOBB ETÜ Fen Bilimleri Enstitüsü Mart 2021 Summary: Yanlış bilgiler, internette inanılmaz bir şekilde her gün yayılmaktadır ve toplumlar üzerindeki olumsuz etkileri tehlikeli seviyelere ulaşmıştır. Yanlış bilgilerin en önemli düşmanı doğruluk kontrolü yapanlardır. Ancak yanlış bilgilerin yayılma hızı göz önüne alındığında, doğruluk kontrolü yapmak yavaş olduğundan tüm iddiaların kontrol edilmesi mümkün olmamaktadır. Bu yüzden, iddiaları teyit gerekliliklerine göre önceliklendirerek doğruluk kontrolü yapanlara yardımcı olacak sistemlerin geliştirilmesi ve bu konuda farkındalık oluşturulması büyük önem taşımaktadır. Bu alandaki bir diğer problem ise, geliştirilecek sistemler için kullanılabilecek veri kaynaklarının çoğunlukla İngilizce olmak üzere sınırlı olmasıdır. Bu tez çalışmasında öncelikle Türkçe için ilk teyit gerektiren iddia veri kümesi olan TrClaim-19 hazırlanmıştır. TrClaim-19, 2287 tane etiketli tweet içermenin yanı sıra, teyit gerektirme özelliklerinin daha iyi anlaşılmasını sağlayacak olan teyit gerektirme gerekçeleri de sunulmuştur. Bu gerekçeler, iddiaların konularının ve muhtemel negatif etkilerinin teyit gerektirmeye sebep olan ana etkenler olduğunu öne sürmektedir. Tez çalışmasında ayrıca, iddiaları teyit gerekliliklerine göre önceliklendirmek için BERT modelinin ve çeşitli özniteliklerin kullanıldığı karma bir model de önerilmiştir. Kullanılan öznitelikler, yerel bölgeye özgü tartışmalı konular, kelime vektörleri, POS etiketleri ve daha fazlasını içermektedir. Buna ek olarak, teyit gerektiren verileri artırma, aktif öğrenme ve farklı dillerde verileri kullanma gibi veri kümesi boyutunu artırmanın farklı yolları üzerine çalışmalar yapılmıştır. Kapsamlı deneyler sonucunda, modelimizin, CLEF Check That! Lab 2018 and 2019 test koleksiyonlarındaki en iyi modellerden daha başarılı olduğu gözlemlenmiştir. Modelimiz, eğitim verilerindeki teyit gerektiren örnekler artırıldığında, Check That! Lab 2020'in test koleksiyonu için de şimdiye kadar bildirilen en iyi MAP puanını elde etmiştir. Çok dilli eğitimin ise Arapça ve Türkçe iddiaları önceliklendirmek için etkili olduğu, ancak bunun İngilizce için geçerli olmadığını gözlemlenmiştir.Summary: The massive amount of misinformation spreading on the Internet on a daily basis has enormous negative impacts on societies. In order to combat against misinformation and its negative outcomes, fact-checking websites detect the veracity of claims . However, fact-checking is an extremely time-consuming process and human fact-checkers are not able detect the veracity of all claims spread on the Internet. Therefore, we need systems to help fact-checkers in the combat against misinformation and to raise public awareness of this important problem. Another problem is that available data resources to develop effective systems are limited and the vast majority of them is for English. In this thesis, we introduce TrClaim-19, which is the very first labeled dataset for Turkish check-worthy claims. TrClaim-19 consists of labeled 2287 Turkish tweets with annotator rationales, enabling us to better understand the characteristics of check-worthy claims. The rationales we collected suggest that claims' topics and their possible negative impacts are the main factors affecting their check-worthiness. In this thesis, we also propose a hybrid model which combines BERT model with various features to prioritize claims based on their check-worthiness. Features we use include domain-specific controversial topics, word embeddings, POS tags, and others. In addition, we explore various ways of increasing labeled data size to effectively train the models such as increasing positive samples, active learning, and utilizing labeled data in other languages. In our extensive experiments, we show that our model outperforms all state-of-the-art models in test collections of CLEF Check That! Lab 2018 and 2019. In addition, when positive samples are increased in the training set, our model achieves the best MAP score reported so far for the test collection of Check That! Lab 2020. Furthermore, we show that cross-lingual training is effective for prioritizing Arabic and Turkish claims, but not for English.

Tags from this library: No tags from this library for this title. Log in to add tags.

Average rating: 0.0 (0 votes)

Holdings
Item type	Current library	Home library	Collection	Call number	Copy number	Status	Date due	Barcode
Thesis	Merkez Kütüphane Tez Koleksiyonu / Thesis Collection	Merkez Kütüphane	Tezler	TEZ TOBB FBE BİL YL’21 KAR (Browse shelf(Opens below))	1	Ödünç Verilemez-Tez / Not For Loan-Thesis		TZ01236

Tez (Yüksek Lisans Tezi)--TOBB ETÜ Fen Bilimleri Enstitüsü Mart 2021

Yanlış bilgiler, internette inanılmaz bir şekilde her gün yayılmaktadır ve toplumlar üzerindeki olumsuz etkileri tehlikeli seviyelere ulaşmıştır. Yanlış bilgilerin en önemli düşmanı doğruluk kontrolü yapanlardır. Ancak yanlış bilgilerin yayılma hızı göz önüne alındığında, doğruluk kontrolü yapmak yavaş olduğundan tüm iddiaların kontrol edilmesi mümkün olmamaktadır. Bu yüzden, iddiaları teyit gerekliliklerine göre önceliklendirerek doğruluk kontrolü yapanlara yardımcı olacak sistemlerin geliştirilmesi ve bu konuda farkındalık oluşturulması büyük önem taşımaktadır. Bu alandaki bir diğer problem ise, geliştirilecek sistemler için kullanılabilecek veri kaynaklarının çoğunlukla İngilizce olmak üzere sınırlı olmasıdır. Bu tez çalışmasında öncelikle Türkçe için ilk teyit gerektiren iddia veri kümesi olan TrClaim-19 hazırlanmıştır. TrClaim-19, 2287 tane etiketli tweet içermenin yanı sıra, teyit gerektirme özelliklerinin daha iyi anlaşılmasını sağlayacak olan teyit gerektirme gerekçeleri de sunulmuştur. Bu gerekçeler, iddiaların konularının ve muhtemel negatif etkilerinin teyit gerektirmeye sebep olan ana etkenler olduğunu öne sürmektedir. Tez çalışmasında ayrıca, iddiaları teyit gerekliliklerine göre önceliklendirmek için BERT modelinin ve çeşitli özniteliklerin kullanıldığı karma bir model de önerilmiştir. Kullanılan öznitelikler, yerel bölgeye özgü tartışmalı konular, kelime vektörleri, POS etiketleri ve daha fazlasını içermektedir. Buna ek olarak, teyit gerektiren verileri artırma, aktif öğrenme ve farklı dillerde verileri kullanma gibi veri kümesi boyutunu artırmanın farklı yolları üzerine çalışmalar yapılmıştır. Kapsamlı deneyler sonucunda, modelimizin, CLEF Check That! Lab 2018 and 2019 test koleksiyonlarındaki en iyi modellerden daha başarılı olduğu gözlemlenmiştir. Modelimiz, eğitim verilerindeki teyit gerektiren örnekler artırıldığında, Check That! Lab 2020'in test koleksiyonu için de şimdiye kadar bildirilen en iyi MAP puanını elde etmiştir. Çok dilli eğitimin ise Arapça ve Türkçe iddiaları önceliklendirmek için etkili olduğu, ancak bunun İngilizce için geçerli olmadığını gözlemlenmiştir.

The massive amount of misinformation spreading on the Internet on a daily basis has enormous negative impacts on societies. In order to combat against misinformation and its negative outcomes, fact-checking websites detect the veracity of claims . However, fact-checking is an extremely time-consuming process and human fact-checkers are not able detect the veracity of all claims spread on the Internet. Therefore, we need systems to help fact-checkers in the combat against misinformation and to raise public awareness of this important problem. Another problem is that available data resources to develop effective systems are limited and the vast majority of them is for English. In this thesis, we introduce TrClaim-19, which is the very first labeled dataset for Turkish check-worthy claims. TrClaim-19 consists of labeled 2287 Turkish tweets with annotator rationales, enabling us to better understand the characteristics of check-worthy claims. The rationales we collected suggest that claims' topics and their possible negative impacts are the main factors affecting their check-worthiness. In this thesis, we also propose a hybrid model which combines BERT model with various features to prioritize claims based on their check-worthiness. Features we use include domain-specific controversial topics, word embeddings, POS tags, and others. In addition, we explore various ways of increasing labeled data size to effectively train the models such as increasing positive samples, active learning, and utilizing labeled data in other languages. In our extensive experiments, we show that our model outperforms all state-of-the-art models in test collections of CLEF Check That! Lab 2018 and 2019. In addition, when positive samples are increased in the training set, our model achieves the best MAP score reported so far for the test collection of Check That! Lab 2020. Furthermore, we show that cross-lingual training is effective for prioritizing Arabic and Turkish claims, but not for English.

There are no comments on this title.

to post a comment.