Df Sum Sq Mean Sq F value Pr(>F)
dosis_fac 1 6834 6834 167.1 9.38e-12 ***
Residuals 22 900 41
---
Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

DS3 - Vom experimentellen Design zur
explorativen Datenanalyse & Data Mining
Saskia Otto & Monika Eberhard
Universität Hamburg, IMF
Wintersemester

![]()
Das Modul wird als vollständig abgeschlossen betrachtet, sobald beide Komponenten erfolgreich absolviert wurden.
| VL | Thema | Übung | |
|---|---|---|---|
| 1 | Moduleinführung und Wiederholung DS2 | → Übung 1 | |
| 2 | 2-faktorielle, gekreuzte Varianzanalyse (ANOVA) | → Übung 2 | |
| 3 | Kovarianzanalyse (ANCOVA) | → Übung 3 | |
| 4 | Lineare Gemischte Modelle und verschachtelte ANOVA | → Übung 4 | |
| 5 | Multiple lineare Regression | ||
| 6 | ONLINE: Open Science und R Markdown/Quarto | ||
| - | Weihnachtsferien | ||
| 7 | Resampling-Techniken | → Übung 5 | |
| 8 | Unsupervised Learning 1: Clusteranalyse | → Übung 6 | |
| 9 | Unsupervised Learning 2: PCA | → Übung 7 | |
| 10 | Wiederholung |
Eine Übersicht der Übungsgruppen gibt es auf Moodle.


Positron ist die neue, kostenlose Data-Science-IDE von Posit (den Entwicklern von RStudio):
Positron ist optional. Alles aus dem Modul funktioniert genauso in RStudio.
Website: https://positron.posit.co/


Links: Download · Erste Schritte · Umstieg von RStudio · Positron Assistant
Website: https://positron.posit.co/
KI-Assistenten machen häufig Fehler bei Testauswahl und Interpretation. Sie müssen die Ergebnisse selbst verstehen und begründen können, denn genau das wird in den Moodle-Quizzen geprüft.

Vorteil gegenüber ChatGPT & Co. im Browser:
In beiden IDEs verfügbar, man muss sich nur mit einem Anbieter verbinden (per Anmeldung oder API-Key):
Kosten: Posit AI Pass 30 Tage frei, danach 20 $/Monat. Dauerhaft kostenlos für Studierende: GitHub Copilot über das Student Developer Pack, allerdings nur in Positron. Daten und Code werden an den Anbieter geschickt, also keine sensiblen Daten!
Der Posit Assistant erkennt anhand der geladenen Daten, dass die Spalte laenge klein geschrieben ist.
Weitere Fragen?
Image by starline on Freepik
Die Explorative Datenanalyse (EDA) und Data Mining sind zwei verschiedene, jedoch miteinander verbundene Konzepte im Bereich der Datenanalyse:
Die Explorative Datenanalyse (EDA) und Data Mining sind zwei verschiedene, jedoch miteinander verbundene Konzepte im Bereich der Datenanalyse:













→ Die Wissenschaft des Lernens spielt eine Schlüsselrolle in den Bereichen Statistik, Data Mining und künstliche Intelligenz und überschneidet sich mit Bereichen der Ingenieurwissenschaften und anderen Disziplinen.

![]()


Bildquelle: Morimoto & Ponton (2021): Virtual reality in biology: could we become virtual naturalists?

Bildquelle: James et al. (2013): Introduction to Statistical Learning

Die Trainingsfehlerrate (MSE_{train}) unterscheidet sich oft erheblich von der Testfehlerrate (MSE_{test}). Insbesondere bei sehr flexiblen Modellen kann die Trainingsfehlerrate die Testfehlerrate drastisch unterschätzen.
Bildquelle: James et al. (2013): Introduction to Statistical Learning

Download-link dieses Cheatsheets: [datacamp.com](https://www.datacamp.com/cheat-sheet/)

Aber fangen wir erstmal wieder mit kleineren Datensätzen aus (eigenen) Datenerhebungen an …

| Fragen, die Sie sich stellen sollten | Fest | Zufällig |
|---|---|---|
| Interessiert an den Unterschieden zwischen den Faktorstufen? | ☑️︎ | |
| Ist der Faktor ein Behandlungseffekt? | ☑️ | |
| Sind die Faktorstufen informativ? | ☑️ | |
| Repräsentieren die Faktorstufen experimentelle Interventionen? | ☑️ | |
| Sind die Faktorstufen speziell ausgewählt? | ☑️ | |
| Kommen alle Stufen des Faktors im Experiment vor? | ☑️ | |
| Kommen die Faktorstufen von der gleichen Population? | ☑️ | |
| Gibt es viele Faktorstufen? | ☑️ | |
| Soll auf andere Faktorstufen, die nicht im Experiment vorkommen, verallgemeinert werden? | ☑️ | |
| Gibt es ein verschachteltes (nested) oder hierarchisches (Sub)sampling? | ☑️ |
Quelle: Lazic (2016) Experimental Design for Laboratory Biologists
Alle experimentellen Einheiten sind unabhängig und können zufällig allen Kombinationen von Behandlungsstufen zugeteilt werden.

\begin{align*} \text{Ergebnis} &= \text{Dosis} + \text{Fehler}\\ \text{(N - 1)} &= \text{(p - 1)} + \text{(N - p)}\\ \text{(7)} &= \text{(1)} + \text{(6)} \end{align*}

![]()
Df Sum Sq Mean Sq F value Pr(>F)
dosis_fac 1 6834 6834 167.1 9.38e-12 ***
Residuals 22 900 41
---
Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
![]()
1-faktorielle ANOVA mit gemittelten Unterprobewerten
Df Sum Sq Mean Sq F value Pr(>F)
dosis_fac 1 2278 2278.1 83.87 9.54e-05 ***
Residuals 6 163 27.2
---
Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

![]()

Alle Aufgaben der Übungswoche finden Sie im Handbuch, gegliedert in drei Abschnitte:
→ Die Vorbereitung bearbeiten Sie bitte vor der Übungsstunde.
Dann testen Sie doch Ihr Wissen in folgendem Abschlussquiz…
![]()
Bei weiteren Fragen: saskia.otto(at)uni-hamburg.de

Diese Arbeit is lizenziert unter einer Creative Commons Attribution-ShareAlike 4.0 International License mit Ausnahme der entliehenen und mit Quellenangabe versehenen Abbildungen.
Kurswebseite: Data Science 3