Polski
Scrapowanie Google Maps: jak Lead Finder buduje bazę firm
Dlaczego jedno wyszukiwanie zatrzymuje się na około 120 wynikach, jak siatka obejmuje całe miasto i co mówi RODO o danych firmowych.
Na czym polega scrapowanie Google Maps?
Lead Finder to program na komputer, który zbiera publicznie dostępne dane firm z Google Maps i zapisuje je w arkuszu kalkulacyjnym. Scrapowanie oznacza automatyczne przeniesienie do wierszy tego, co i tak widać na mapie: nazwy firmy, numeru telefonu, adresu, współrzędnych, strony internetowej, kategorii, oceny i liczby opinii. Kluczowe ograniczenie dotyczy wszystkich narzędzi: jedno wyszukiwanie w Google Maps zwraca około 120 wyników niezależnie od tego, ile firm faktycznie działa w danym mieście. Limit dotyczy zapytania, a nie obszaru, więc pełne pokrycie wymaga podziału terenu na mniejsze komórki, osobnego wyszukiwania w każdej z nich i połączenia wyników z usunięciem duplikatów po place ID.
Dlaczego jedno wyszukiwanie nie wystarcza
Google Maps zwraca około 120 wyników na zapytanie. Ta liczba nie ma związku z rzeczywistą liczbą firm w mieście: to limit nałożony na pojedyncze wyszukiwanie. W dużej aglomeracji może działać kilka tysięcy restauracji, a jedno wyszukiwanie pokaże tylko ich część i nie zasygnalizuje, że lista jest niepełna.
Rozwiązaniem jest podział obszaru. Teren dzieli się na mniejsze komórki, każdą przeszukuje się osobno, a wyniki łączy się na końcu. Podczas łączenia usuwa się duplikaty na podstawie place ID, ponieważ ta sama firma często pojawia się w sąsiednich komórkach.
RODO a dane firmowe
Dane firm publikowane w Google Maps są udostępniane publicznie przez same przedsiębiorstwa. Regulowane jest nie tyle samo pozyskanie, co późniejsze wykorzystanie, a RODO traktuje dane osób fizycznych inaczej niż dane podmiotu gospodarczego. Numer telefonu spółki nie jest tym samym co numer prywatny.
W praktyce granica bywa nieostra: dane jednoosobowej działalności gospodarczej mogą jednocześnie stanowić dane osobowe przedsiębiorcy. Do tego dochodzą przepisy o komunikacji marketingowej, które wymagają odrębnej podstawy dla kontaktu telefonicznego i elektronicznego. Ta strona nie zastępuje porady prawnej, a przed kampanią warto zweryfikować podstawę przetwarzania.
Jak zachowuje się koszt
Narzędzia chmurowe zwykle rozliczają się za wiersz, więc dokładne pokrycie obszaru kosztuje proporcjonalnie więcej. Przy stałej licencji rocznej test na 500 wierszach i pełne skanowanie 500 000 wierszy kosztują tyle samo.
Praktyczny skutek dotyczy sposobu pracy: zamiast ograniczać zapytania, skanuje się cały region i powtarza co kwartał. Gdy powtórzenie nic nie kosztuje, różnica między dwoma skanami, czyli firmy nowo otwarte i zamknięte, staje się cenniejsza niż pojedyncze zestawienie.