Scraper
Zlecę przygotowanie scrapera do cen.
Posiadam listę feedów dla kilku witryn xml, a więc nie trzeba robić crawlera. W feedach są oczywiście ceny i można byłoby to sparsować, ale produkty mają różne ceny, zależne od kanału wejścia na www (te rozpoznawane są na bazie adresów z utm, które są z a adresach z feedu).
Scraper ma odpytywać raz dziennie adresy bez parametrów i wysyłać EAN i cenę po API do bazy. Scraper powinien być odporny na zabezpieczenie Cloudflare, etc.
Nie mówimy więc tylko o ekstrakcji danych z xml (bo te nie mają zabezpieczeń), a odpytaniu adresów wyekstraktowanych z feedów i scrapowaniu cen z www.
Przed przystąpieniem do realizacji zależy mi na wskazaniu planowanej metodologii technologicznej i doborze narzędzi np. biblioteki python + proxy, wykorzystanie crawlerów typu crawl4ai, etc.
Szukam efektywnego rozwiązania pod kątem utrzymania skali i niezawodności.