700+ courses, half price
Kurs Açıklaması
İstatistikler, ürün yorumları veya fiyatlar gibi pek çok veriyi, veri analizi için hazır olmayan bir formatta sunan bir web sitesiyle hiç karşılaştın mı? Çoğu zaman, resmi kurumlar ve diğer veri sağlayıcılar verilerini düzenli tablolar halinde yayınlar. Ancak bu sitelerin hepsinde indirme düğmesi bulunmaz; yine de üzülme. Bu kursta, R kullanarak herhangi bir siteden veriyi verimli şekilde toplayıp indireceksin. rvest ve httr paketleriyle Wikipedia’yı kazıma ve ayrıştırma işlemlerini nasıl otomatikleştireceğini öğreneceksin. Uygulamalı egzersizlerle, web sayfalarının yapı taşları olan HTML ve CSS hakkındaki anlayışını derinleştirirken, veri toplama iş akışlarını daha az hataya açık ve daha verimli hale getireceksin.
Ön Koşullar
Müfredat
Kurs planı
1
HTML ve Web Kazımaya Giriş
Bu bölümde, modern web sitelerini yapılandırmak için kullanılan bildirime dayalı bir dil olan Hyper Text Markup Language (HTML) ile tanışacaksın. rvest kütüphanesini kullanarak basit HTML öğelerini nasıl sorgulayacağını ve ilk tablounu nasıl kazıyacağını öğreneceksin.
2
CSS ile Gezinme ve Seçim
Basamaklı Stil Sayfaları (CSS), bir web sayfasında HTML öğelerinin renkler, yazı tipleri ve genel yerleşim dahil olmak üzere nasıl görüntüleneceğini tanımlar. Bu bölümde, CSS seçicilerinin ve birleştiricilerinin web kazıma için neden kritik bileşenler olduğunu öğreneceksin.
3
XPATH ile İleri Düzey Seçimler
Önceki bölümde öğrendiğin CSS seçicileri güçlüdür ancak bazı sınırlamaları vardır. Örneğin, düğümleri onların alt öğelerinin özelliklerine göre seçmek istediğinde. İmdada XPath yetişir! Bu sorgu dilini kullanarak, en sorunlu HTML’lerde bile gezinebilir ve kazıma yapabilirsin.
4
Kazıma En İyi Uygulamaları
Artık web sayfalarından içerik çıkarmayı bildiğine göre, perdenin arkasına bakma zamanı. Bu son bölümde, neden HTTP isteklerinin her kazıma eyleminin temeli olduğunu ve web kazımada en iyi uygulamalara uymak için bu isteklerin nasıl özelleştirilebileceğini öğreneceksin.
R
R ile Web Kazıma
Kurs
Tamamlandı

