DE · EN
STATISTIK · DATA SCIENCE · WIRKUNGSEVALUATION · DATA ENGINEERING

Daten rein.
Entscheidungen
raus.

Statistik, Kausalanalyse & Prognosen — ausgeliefert als lauffähige R-Software (Shiny, ETL & APIs, automatisiertes Reporting), die bei Ihnen weiterläuft. Berlin, seit 2015.
ERSTGESPRÄCH ANFRAGEN → 15-MIN-TERMIN BUCHEN →
SOVE.IT
FROM DATA TO DECISIONS

01 PROGNOSE & PREDICTIVE

GLM/GAM, Random Forest/XGBoost, Zeitreihen, Klassifikation & Scoring — Vorhersagen mit quantifizierter Unsicherheit statt Punktschätzung ins Blaue.

02 DATENVISUALISIERUNG & APPS

Analyse wird sichtbar: publikationsreife Grafiken (ggplot2), interaktive Analyse-Apps und Dashboards (R Shiny), automatisiertes Reporting — läuft bei Ihnen weiter.

03 DATA ENGINEERING & ETL

Robuste Datenpipelines, Schnittstellen & APIs, SQL-Datenmodellierung, Web-Crawling & OCR — Datenqualität, auf die Analyse bauen kann.

04 STATISTIK & EMPIRIE

Das Fundament: Studiendesign, Stichproben, saubere Erhebung und Auswertung — Regression, Survival-Analysen, Conjoint. Damit die Zahl am Ende die Frage beantwortet, die Sie gestellt haben.

05 KAUSALITÄT & WIRKUNG

Wirkt es wirklich – oder sieht es nur so aus? Propensity-Score-Matching, Diff-in-Diff, Programmevaluation — sauber identifiziert und belastbar.

06 PROJEKTLEITUNG & ENABLEMENT

Technische Projektleitung, Methoden-Review und Statistik-Schulung — am Ende kann Ihr Team es selbst.
AUS DER PRAXIS

Methoden, die tragen.

Kein Buzzword-Katalog: jede Methodenfamilie haben wir in realen Projekten produktiv eingesetzt — von der Onkologie bis zur Instandhaltung.
PROGNOSE & ML
SURVIVAL
KAUSALITÄT
CHURN & SEGMENTE
CHOICE
ETL & PIPELINES
AUTOMATISIERUNG
AI & LLM
heutebeobachtetprognose
GAM: s(zeit) + s(temp), REML90 %-prognoseintervall öffnet sichΔRMSE −0.31 vs. Baseline
prognose.R
glm(faelle ~ ., family = quasipoisson, data = d) mgcv::gam(y ~ s(zeit) + s(temp), method = "REML", data = d) xgb.train(params, dtrain, nrounds = 500) shapviz(fit, X_pred = X) # erklärbarkeit
Pakete: mgcv (GAM) · xgboost (Boosting) · shapviz (SHAP)
GLM/GAM, Splines, Random Forest/XGBoost, Zeitreihen und Klassifikation (Scoring, ROC/AUC) — mit SHAP-Werten erklärbar gemacht: nicht nur was das Modell vorhersagt, sondern warum.
→ u. a. Predictive Maintenance Schienenverkehr
REFERENZEN

Projekte, die laufen.

SCHIENENVERKEHR
Infrastrukturbetreiber
Predictive Maintenance und technische Projektleitung.
PHARMA & GESUNDHEIT
Onkologie-Informationsdienst
Biostatistik und Survival-Analysen für Register-Daten.
PHARMA
Pharmaunternehmen (CH)
Statistische Datenanalyse klinischer Fragestellungen.
WISSENSCHAFT
Leibniz-Institut
Wissenschaftliche Auswertungen im EU-Forschungsprojekt.
ENTWICKLUNGSZUSAMMENARBEIT
Internationale Organisation
Programmevaluation und qualitative Wirkungsstudie.
E-COMMERCE & FINANZEN
Handels- & Finanzunternehmen
KPI-Reporting, Dashboards und CRM-Datenanalyse.
Kundennamen auf Anfrage — Referenzen aus Vertraulichkeitsgründen anonymisiert.
Nico Schäfer — Statistiker & Data Scientist, sove.it e.K. (Berlin)
„Wir helfen, die richtigen Fragen zu stellen — und aus Daten die strategisch richtigen Entscheidungen abzuleiten.“
INHABER
Nico Schäfer
M.A. Soziologie (Universität Bonn), Herkunft am Lehrstuhl für Methoden der empirischen Sozialforschung. Seit 2015 selbständig als Statistiker und Data Engineer; für größere Vorhaben eingespieltes Netzwerk externer Fachexperten.
10+
Jahre Projekterfahrung
2015
gegründet, Berlin
R · Shiny · SQL
Kern-Stack
FÜR VERMITTLER & RECRUITER

Profil auf einen Blick.

ROLLE / TITEL
Statistiker & Data Scientist · freiberuflich. Synonyme: Statistiker, Data Scientist, Biostatistiker, Quantitative Analyst, Statistical Programmer, R-Entwickler / R-Shiny-Entwickler.
KERN-STACK & METHODEN
R · R Shiny · SQL (PostgreSQL / MS SQL) · ETL & Data Engineering · Predictive Analytics / ML · Panel- & Mixed Models · Survival- & Kausalanalyse · Wirkungsevaluation · SPSS / PSPP · Power BI / DAX · Tableau · Git · targets / Quarto
VERFÜGBARKEIT & KONDITIONEN
Remote (Sitz Berlin), bundesweit · projekt- oder betriebsbezogen · Rate auf Anfrage · CV & Skills-Matrix auf Anfrage.
EINSATZFELDER
Öffentliche Hand & Evaluation · Pharma / Klinik / Biostatistik · Industrie & Instandhaltung · E-Commerce & Finanzen.
HÄUFIGE FRAGEN

Fragen & Antworten.

Was kostet eine Auswertung oder ein Projekt?
Die Vergütung richtet sich nach Umfang und Laufzeit. Üblich sind drei Modelle: eine abgegrenzte Kompaktanalyse, ein Projekt mit definiertem Liefergegenstand oder ein Betriebs-Retainer für laufende Auswertungen und Pipelines. Konkrete Sätze folgen nach einem kurzen Erstgespräch.
Wie läuft die Zusammenarbeit ab?
In vier Schritten: Erstgespräch zur Klärung der Fragestellung, Scoping mit Angebot und Zeitplan, Umsetzung und Übergabe. Auf Wunsch bleibt die Lösung im Betrieb und wird weiter gepflegt.
Wie wird mit sensiblen oder personenbezogenen Daten umgegangen?
Die Verarbeitung erfolgt DSGVO-konform: Auftragsverarbeitungsvertrag, Pseudonymisierung wo möglich, Hosting in der EU. Bei Verfahren mit Sprachmodellen wird der Datenfluss vorab geklärt (EU-Hosting oder lokale Modelle); besonders schützenswerte Daten nach Art. 9 DSGVO werden entsprechend behandelt.
Womit wird gearbeitet?
Kern ist R einschließlich R Shiny sowie SQL (PostgreSQL, MS SQL); hinzu kommen ETL und Data Engineering, Predictive Analytics und Machine Learning, Panel- und Mixed-Models sowie Survival- und Kausalanalyse. Das Reporting ist über targets und Quarto reproduzierbar.
Für welche Branchen?
Öffentliche Hand und Evaluation, Pharma, Klinik und Biostatistik, Industrie und Instandhaltung sowie E-Commerce und Finanzen.
Erhalte ich nur eine einmalige Auswertung?
Nein. Auf Wunsch entsteht eine Lösung, die produktiv weiterläuft — eine interaktive Anwendung, eine automatisierte Pipeline oder ein Report, der sich mit neuen Daten per Knopfdruck aktualisiert.
KONTAKT

Reden wir über Ihre Daten.

Im Erstgespräch klären wir Fragestellung, Datenlage und den kürzesten Weg zur belastbaren Entscheidung — unverbindlich, 15 Minuten.
Weserstraße 37 · 12045 Berlin