Web Scraping für öffentliche Daten in großem Umfang
Preise, Inserate, Verzeichnisse, Suchergebnisse, Firmendaten. Ich entwickle Scraper und Datenpipelines, die öffentliche Daten zuverlässig sammeln, bereinigen und dort abliefern, wo sie gebraucht werden. Ich arbeite für Unternehmen ohne eigene Entwickler und für Teams, die einen Scraper brauchen, der dauerhaft läuft.
KI gehört fest zu meiner Arbeit, deshalb geht es schnell. Bei der Datenqualität und bei den Regeln der Websites bleibe ich sorgfältig.
Antwort innerhalb eines Werktags.
Was ich entwickle
Vom einzelnen Scraper bis zur Pipeline, die von selbst läuft.
Scraper für eine Quelle
Preise, Inserate, Produktdaten oder Einträge aus einem Verzeichnis. Die Daten kommen strukturiert an, als CSV, JSON oder direkt in der Datenbank.
Daten in großem Umfang
Viele Quellen, Millionen Seiten, Queues und mehrere Server. Meine eigenen Plattformen sammeln Daten in dieser Größenordnung.
Headless Browser
Websites, die ihre Inhalte per JavaScript laden, brauchen einen vollständigen Browser. Headless Browser setze ich dort ein, wo einfache Abrufe nicht reichen.
Proxys und Zuverlässigkeit
Wiederholungen, Proxy-Rotation, Ratenbegrenzung und Alarme, wenn eine Website ihr Layout ändert.
Bereinigen und Abgleichen
Ich entferne Dubletten, vereinheitliche Felder und gleiche Datensätze mit den eigenen Daten ab. KI hilft bei unordentlichem Text, zum Beispiel um Preise oder Maße aus Beschreibungen zu lesen.
Pipelines und Auslieferung
Geplante Läufe, Erkennung von Änderungen und Auslieferung in die Datenbank, eine Tabelle, eine API oder den Admin-Bereich der eigenen Anwendung.
So arbeite ich
Viele meiner Kunden kommen mit einer Idee, einem Repository, einem kurzen Video oder einer Liste von Problemen zu mir. Mehr braucht es am Anfang nicht. Ich sehe mir an, was vorhanden ist, mache daraus einen Plan und setze ihn um.
Mit Claude Code, Codex und eigenen Agent-Workflows lese ich mich in Code ein, plane Änderungen, schreibe Tests, refaktoriere und suche Fehler. Das ist kein Vibe Coding, sondern erfahrene Softwareentwicklung in deutlich höherem Tempo.
KI zuerst, mit öffentlichen Daten
Claude Code und Codex schreiben Parser schnell und passen sie an, wenn sich eine Website ändert. Was gesammelt wird, entscheide ich, und die Daten prüfe ich. Ich halte mich an öffentliche Daten, die Nutzungsbedingungen der Websites und das Gesetz.
Die Kontrolle bleibt bei mir
KI schreibt einen großen Teil meines Codes. Die technischen Entscheidungen treffe ich trotzdem selbst. Jede Änderung lese und teste ich, bevor sie live geht. So bin ich schnell und bleibe dabei sorgfältig.
So, wie es für den Kunden passt
Manche Kunden wollen jede Änderung sehen, bevor sie live geht, andere überlassen mir das Deployment. Manche möchten regelmäßig telefonieren, die meisten bekommen lieber schriftliche Updates. Ich arbeite gerne asynchron und stelle die wichtigen Fragen trotzdem, sobald sie auftauchen.
Mit dem Blick eines Unternehmers
Ich betreibe selbst mehrere Online-Angebote. Deshalb denke ich bei jedem Projekt Traffic, Conversion, Umsatz und Support mit, und ich sage offen, wenn sich etwas nicht lohnt.
So können wir zusammenarbeiten
Zum Festpreis, als monatliche Pauschale oder nach Stunden. In jedem Fall arbeite ich persönlich am Projekt, ohne Agentur dazwischen. Wenn noch unklar ist, welches Modell passt, reicht eine kurze Beschreibung des Projekts. Ich schlage dann eines vor.
Beispiele aus meiner Arbeit
Scraping und Datenpipelines in meinen eigenen Plattformen und in Kundenprodukten.
Millionen potenzielle Kontakte im Monat
Eine Laravel-Plattform auf mehr als 30 Servern, die Websites findet, Kontaktdaten ermittelt und die Ansprache selbstständig abwickelt. Die Scraping-Engine nutzt Headless Browser und Proxy-Rotation.
Suchergebnisse für KI-Agenten
Scraping von Suchmaschinen und anderen Webquellen als Grundlage für die Workflows der KI-Agenten, verarbeitet über Queues mit Redis und Horizon.
Datenpipelines von TMDb
Pipelines, die Film- und Seriendaten von TMDb abrufen, neue Veröffentlichungen und Änderungen erkennen und eine KI-Content-Engine versorgen.
Das sagen meine Kunden
"What stood out about working with Vincent was how methodical and efficient he was."
"You have a chat, you express what you need, and he comes back with what you asked for."
"Vincent is one of those rare developers who can jump into a complex codebase, become useful immediately, and solve real problems without hand-holding."
Fragen und Antworten
Ist Web Scraping legal?
Das Sammeln öffentlicher Daten ist in vielen Fällen erlaubt. Es hängt aber von den Daten, den Nutzungsbedingungen der Website und dem Land ab. Personenbezogene Daten brauchen nach der DSGVO besondere Sorgfalt. Ich sage, wo ich ein Problem sehe. Eine rechtliche Auskunft gibt nur ein Anwalt.
Was passiert, wenn sich die Website ändert?
Scraper brechen, wenn sich das Layout ändert. Ich richte Prüfungen ein, die fehlende Daten bemerken, und passe den Scraper dann an.
In welcher Form kommen die Daten an?
Als CSV- oder JSON-Datei, in der eigenen Datenbank, über eine API oder in einem Admin-Bereich, in dem das Team suchen kann.
Geht das auch bei Websites mit Login?
Nur mit einem Konto, das dafür genutzt werden darf, und nur, wenn die Nutzungsbedingungen es erlauben.
In welcher Sprache entstehen die Scraper?
Meist in Laravel und PHP. Python oder Node.js nehme ich, wenn dort eine Bibliothek besser passt.
Wie wird abgerechnet?
Zum Festpreis, wenn das Ziel klar ist, als monatliche Pauschale für laufende Arbeit oder nach Stunden. Ein paar Sätze zum Vorhaben genügen, dann schlage ich ein Modell vor.
Projekt anfragen
Welche Websites, welche Daten, wie oft und wohin die Daten sollen. Ein paar Sätze genügen. In meiner Antwort steht, was ich tun würde und was es kostet.
Lieber kurz telefonieren? 30 Minuten buchen. Eine E-Mail an contact@vincentschmalbach.com geht auch.