Web Scraping

Web Scraping für öffentliche Daten in großem Umfang

Preise, Inserate, Verzeichnisse, Suchergebnisse, Firmendaten. Ich entwickle Scraper und Datenpipelines, die öffentliche Daten zuverlässig sammeln, bereinigen und dort abliefern, wo sie gebraucht werden. Ich arbeite für Unternehmen ohne eigene Entwickler und für Teams, die einen Scraper brauchen, der dauerhaft läuft.

KI gehört fest zu meiner Arbeit, deshalb geht es schnell. Bei der Datenqualität und bei den Regeln der Websites bleibe ich sorgfältig.

Antwort innerhalb eines Werktags.

Vincent Schmalbach

Was ich entwickle

Vom einzelnen Scraper bis zur Pipeline, die von selbst läuft.

Scraper für eine Quelle

Preise, Inserate, Produktdaten oder Einträge aus einem Verzeichnis. Die Daten kommen strukturiert an, als CSV, JSON oder direkt in der Datenbank.

Daten in großem Umfang

Viele Quellen, Millionen Seiten, Queues und mehrere Server. Meine eigenen Plattformen sammeln Daten in dieser Größenordnung.

Headless Browser

Websites, die ihre Inhalte per JavaScript laden, brauchen einen vollständigen Browser. Headless Browser setze ich dort ein, wo einfache Abrufe nicht reichen.

Proxys und Zuverlässigkeit

Wiederholungen, Proxy-Rotation, Ratenbegrenzung und Alarme, wenn eine Website ihr Layout ändert.

Bereinigen und Abgleichen

Ich entferne Dubletten, vereinheitliche Felder und gleiche Datensätze mit den eigenen Daten ab. KI hilft bei unordentlichem Text, zum Beispiel um Preise oder Maße aus Beschreibungen zu lesen.

Pipelines und Auslieferung

Geplante Läufe, Erkennung von Änderungen und Auslieferung in die Datenbank, eine Tabelle, eine API oder den Admin-Bereich der eigenen Anwendung.

So arbeite ich

Viele meiner Kunden kommen mit einer Idee, einem Repository, einem kurzen Video oder einer Liste von Problemen zu mir. Mehr braucht es am Anfang nicht. Ich sehe mir an, was vorhanden ist, mache daraus einen Plan und setze ihn um.

Mit Claude Code, Codex und eigenen Agent-Workflows lese ich mich in Code ein, plane Änderungen, schreibe Tests, refaktoriere und suche Fehler. Das ist kein Vibe Coding, sondern erfahrene Softwareentwicklung in deutlich höherem Tempo.

KI zuerst, mit öffentlichen Daten

Claude Code und Codex schreiben Parser schnell und passen sie an, wenn sich eine Website ändert. Was gesammelt wird, entscheide ich, und die Daten prüfe ich. Ich halte mich an öffentliche Daten, die Nutzungsbedingungen der Websites und das Gesetz.

Die Kontrolle bleibt bei mir

KI schreibt einen großen Teil meines Codes. Die technischen Entscheidungen treffe ich trotzdem selbst. Jede Änderung lese und teste ich, bevor sie live geht. So bin ich schnell und bleibe dabei sorgfältig.

So, wie es für den Kunden passt

Manche Kunden wollen jede Änderung sehen, bevor sie live geht, andere überlassen mir das Deployment. Manche möchten regelmäßig telefonieren, die meisten bekommen lieber schriftliche Updates. Ich arbeite gerne asynchron und stelle die wichtigen Fragen trotzdem, sobald sie auftauchen.

Mit dem Blick eines Unternehmers

Ich betreibe selbst mehrere Online-Angebote. Deshalb denke ich bei jedem Projekt Traffic, Conversion, Umsatz und Support mit, und ich sage offen, wenn sich etwas nicht lohnt.

Beispiele aus meiner Arbeit

Scraping und Datenpipelines in meinen eigenen Plattformen und in Kundenprodukten.

Outreach-Plattform

Millionen potenzielle Kontakte im Monat

Eine Laravel-Plattform auf mehr als 30 Servern, die Websites findet, Kontaktdaten ermittelt und die Ansprache selbstständig abwickelt. Die Scraping-Engine nutzt Headless Browser und Proxy-Rotation.

KI-Content-SaaS

Suchergebnisse für KI-Agenten

Scraping von Suchmaschinen und anderen Webquellen als Grundlage für die Workflows der KI-Agenten, verarbeitet über Queues mit Redis und Horizon.

Film-Blognetzwerk

Datenpipelines von TMDb

Pipelines, die Film- und Seriendaten von TMDb abrufen, neue Veröffentlichungen und Änderungen erkennen und eine KI-Content-Engine versorgen.

Das sagen meine Kunden

"What stood out about working with Vincent was how methodical and efficient he was."

Philipp Toepelmann, Digital Investments GmbH

"You have a chat, you express what you need, and he comes back with what you asked for."

Ariel Ozick, Wired Rhino, Inc.

"Vincent is one of those rare developers who can jump into a complex codebase, become useful immediately, and solve real problems without hand-holding."

Yash Chandra, Academy of Mine

Fragen und Antworten

Ist Web Scraping legal?

Das Sammeln öffentlicher Daten ist in vielen Fällen erlaubt. Es hängt aber von den Daten, den Nutzungsbedingungen der Website und dem Land ab. Personenbezogene Daten brauchen nach der DSGVO besondere Sorgfalt. Ich sage, wo ich ein Problem sehe. Eine rechtliche Auskunft gibt nur ein Anwalt.

Was passiert, wenn sich die Website ändert?

Scraper brechen, wenn sich das Layout ändert. Ich richte Prüfungen ein, die fehlende Daten bemerken, und passe den Scraper dann an.

In welcher Form kommen die Daten an?

Als CSV- oder JSON-Datei, in der eigenen Datenbank, über eine API oder in einem Admin-Bereich, in dem das Team suchen kann.

Geht das auch bei Websites mit Login?

Nur mit einem Konto, das dafür genutzt werden darf, und nur, wenn die Nutzungsbedingungen es erlauben.

In welcher Sprache entstehen die Scraper?

Meist in Laravel und PHP. Python oder Node.js nehme ich, wenn dort eine Bibliothek besser passt.

Wie wird abgerechnet?

Zum Festpreis, wenn das Ziel klar ist, als monatliche Pauschale für laufende Arbeit oder nach Stunden. Ein paar Sätze zum Vorhaben genügen, dann schlage ich ein Modell vor.

Projekt anfragen

Welche Websites, welche Daten, wie oft und wohin die Daten sollen. Ein paar Sätze genügen. In meiner Antwort steht, was ich tun würde und was es kostet.

Lieber kurz telefonieren? 30 Minuten buchen. Eine E-Mail an contact@vincentschmalbach.com geht auch.

Antwort innerhalb eines Werktags.