Over de Human vacaturedata-crawler
Als je deze pagina in je serverlogs hebt gevonden, heeft een verzoek van onze vacaturedata-crawler je site bereikt. Deze pagina legt uit wie we zijn, wat de crawler doet en hoe je hem kunt vertragen, stoppen of een vacature kunt laten verwijderen.
De crawler identificeert zich in elk verzoek met het User-Agent-token jobdata-crawler
jobdata-crawler/0.1 (+https://meetthehuman.com/crawler; contact support@meetthehuman.com)Wie hem beheert
De crawler wordt beheerd door Human (HumanHQ LLC), het bedrijf achter meetthehuman.com. Human is een wervingsplatform dat kandidaten helpt open functies te vinden en werkgevers helpt mensen aan te nemen.
Vragen, klachten en verzoeken over de crawler gaan naar support@meetthehuman.com
Wat hij verzamelt
De crawler verzamelt openbaar beschikbare vacatures zodat kandidaten op Human open functies kunnen ontdekken, inclusief functies met relocatie- of visumondersteuning.
- Hij leest alleen vacatures die al openbaar op het web staan, van openbare vacaturepagina's van sollicitantvolgsystemen en hun openbare API's (bijvoorbeeld Greenhouse, Lever, Ashby, Workable en Recruitee) en van gelicentieerde vacaturedata-API's.
- Hij verzamelt geen persoonsgegevens van kandidaten of sollicitanten. Hij leest nooit sollicitatieformulieren, sollicitantprofielen of iets achter een login.
- Hij maakt geen accounts aan, logt niet in, verstuurt geen formulieren en voert geen JavaScript uit. Hij stuurt uitsluitend gewone HTTP GET-verzoeken.
- Elke vacature wordt opgeslagen zoals gepubliceerd, zodat we kunnen zien wanneer een functie opengaat en wanneer deze sluit. Die geschiedenis houdt ons aanbod accuraat.
Hoe hij zich gedraagt
- Hij haalt robots.txt op met zijn eigen User-Agent, slaat die per site 24 uur op en respecteert die. Een URL die je robots.txt voor deze crawler blokkeert, wordt nooit opgevraagd.
- Hij respecteert Crawl-delay. Wanneer je robots.txt om een lager tempo vraagt dan onze standaard, wint de langzamere waarde.
- Hij stuurt maximaal één verzoek per twee seconden naar één domein. Verzoeken aan dezelfde site worden gespreid en nooit in pieken verstuurd.
- Als je robots.txt niet kan worden opgehaald door een serverfout of een time-out, crawlt hij je site niet. Stilte wordt niet als toestemming gezien.
- Hij identificeert zich altijd met de hierboven getoonde User-Agent en doet zich nooit voor als een browser of een andere crawler.
Zo sluit je hem uit
Om de crawler van je hele site te weren, voeg je deze twee regels toe aan je robots.txt:
User-agent: jobdata-crawler
Disallow: /De crawler leest robots.txt hoogstens elke 24 uur opnieuw, dus een nieuwe regel geldt uiterlijk bij de eerstvolgende verzamelronde daarna.
Om de crawler te behouden maar te vertragen, stel je in plaats daarvan een Crawl-delay in seconden in. Bijvoorbeeld één verzoek per tien seconden:
User-agent: jobdata-crawler
Crawl-delay: 10Je kunt ook mailen naar support@meetthehuman.com met je domein, dan sluiten we het handmatig uit. Berichten over de crawler gaan naar een engineer, niet naar een standaardantwoord.
Verwijdering van een vacature aanvragen
Om een specifieke vacature van Human te laten verwijderen, mail je naar support@meetthehuman.com met de URL van de vacature. We verwijderen deze uit ons aanbod en verzamelen deze niet meer.
Verzoeken van de werkgever die de vacature heeft gepubliceerd, of van de beheerder van de site waarvan deze is verzameld, worden als eerste behandeld. Vermeld daarom welke van de twee je bent.