Digitale Bildverarbeitung – Einführung (Vorlesung 1)
Motivation der digitalen Bildverarbeitung
- Ziel: Lösung realer, praxisbezogener Probleme mittels Computer-Vision-Ansätzen
- Kommerzielle Chancen in Medizin, Industrie, Überwachung, Mobilität u. v. m.
- Wachsender Datenstrom: zig-Tausende neu erzeugte Bilder pro Tag in sozialen Medien, ständig steigende Anzahl öffentlich installierter Kameras
- Hoher Bedarf an Vision-Expert*innen → zunehmende Anzahl nationaler & internationaler Konferenzen
- Kognitive Grundlage: Unser Gehirn interpretiert Bilder mithilfe von Heuristiken → optische Täuschungen verdeutlichen Grenzen & Chancen automatischer Systeme
Begriffsabgrenzung
- Bildverarbeitung (Image Processing)
- Low-Level-Vorgänge (Pixel-Domäne)
- Ziel: verbessertes/optimiertes Bild
- Beispiele: Entrauschen, Entschärfen, Farb- & Schattenentfernung, Kontraststeigerung
- Bildanalyse (Image Analysis)
- Mid-Level-Vorgänge
- Extraktion spezifischer Bildmerkmale (Kanten, Regionen, Formen)
- Maschinelles Sehen / Computer Vision / KI
- High-Level-Vorgänge (Semantik)
- Kontext-, Objekt- & Szenenerkennung; Entscheidung & Handlungsplanung
Anwendungsgebiete
- Medizin: MRT, CT, Röntgen, Ultraschall, Telemedizin-Workflows
- Geowissenschaften & Fernerkundung: Satelliten-Imaging, Ozean- & Landbeobachtung, Wettervorhersage
- Militär & Sicherheit: Zielerfassung, Drohnensicht, Überwachung, Nachtbildsysteme
- Kunst & Multimedia: Film, Fotografie, visuelle Effekte, Restaurierung
- Industrie: Robotik-Sehen, Messtechnik, Qualitätssicherung, Prozessautomatisierung
Bildqualität & -verbesserung
- Grundfrage: „Wie misst man Bildqualität?“
- Subjektive Wahrnehmung (visuelle Tests)
- Objektive Metriken (MSE, PSNR, SSIM, NIQE …)
- Typische Verfahren:
- Histogramm-Equalisation, CLAHE
- Kontrast-Stretching, Tonemapping, Weißabgleich
- Filter: Median, Gaussian, Bilateral (Entrauschen, Entschärfen)
- Farbkorrektur, Schattenentfernung
- Beispiel „Kontrast“: visuelle Steigerung der Helligkeitsdynamik (vgl. Folienabbildungen)
Menschliches Sehen
- Optische Täuschungen zeigen: Wahrnehmung ≠ physikalische Realität (vgl. Quellen [1], [2])
- Lesebeispiel mit permutierten Buchstaben („Ehct ksras…“) → Gehirn interpretiert ganze Wortformen
- Sichtbarer Bereich des elektromagnetischen Spektrums: 400 nm (Violett) – 750 nm (Rot)
- Anatomie & Funktion
- Zwei Augen → Fusion korrelierter Retina-Information → binokulares Sehen
- Fovea (≈ 1,5 mm) an Sehachse, dicht gepackte Zapfen, verantwortlich für scharfes Farbsehen
- Blinder Fleck an Optikus-Austritt, keine Rezeptoren
- Photorezeptoren
- Zapfen: ≈ 5 Mio, Tag-/Farbsehen, jeder Zapfen indiv. Nervenanbindung
- Stäbchen: ≈ 100–150 Mio, Nacht- & Periphersehen, 10 : 1-Verschaltung
- Beleuchtungsstärken (in Lux = lm/m²)
- Sonniger Tag ≈ 100000
- Bewölkt ≈ 10000
- Büro ≈ 1000
- Vollmond ≈ 0.1
Herausforderungen des Sehens
- 3D → 2D-Projektion verliert Tiefen- & Skalierungsinformationen
- Bilder können verrauscht, schlecht beleuchtet, mehrdeutig sein
- Mensch & Algorithmus benötigen:
- Geometrie-/Physik-Verständnis
- Mathematische Modelle für Anhaltspunkte & Vorwissen
- Rechenmodelle/Algorithmen zur Zustandsschätzung der Welt
Digitale Bilddarstellung
- Kontinuierliche Szene f(x,y) → diskretisierte Matrix f[m,n]
- Grauwert-Beispiel: f(x,y)→[0,127] (7-Bit, demonstriert auf Folie)
- Ursprung bei f(0,0)
- RGB-Representation
- Drei Kanäle Red, Green, Blue
- Pixelindex p(w,h,c) mit Breite w, Höhe h, Kanal c∈R,G,B
Rasterung & Quantisierung
- Rasterung: Diskretisierung der kontinuierlichen Koordinaten x,y → Gitterpunkte m,n
- f[m,n]≈f(x,y)
- Quantisierung: Zuordnung kontinuierlicher Intensitäten zu endlichem Wertebereich V1=0,1,…,126,127
- Umsetzung: Sensor-Array projiziert Szene → Matrix vordefinierter Pixel
- Farbreduktion Beispiel: 256 → 8 → 4 Graustufen
Nachbarschaftsbeziehungen
- 4-Nachbarschaft: horizontale/vertikale Pixel (x±1,y), (x,y±1)
- 8-Nachbarschaft: zusätzliche Diagonalen (x±1,y±1)
- Definition: Pixel Q ist 8-Nachbar von P ↔ gemeinsame Kante oder Ecke
Entfernungsmetriken
- Metrik-Eigenschaften
- D(p,q)≥0∧D(p,q)=0fu¨rp=q
- Symmetrie D(p,q)=D(q,p)
- Dreiecksungleichung D(p,r)≤D(p,q)+D(q,r)
- Allgemein: D<em>k(p,q)=(∣m</em>p−m<em>q∣k+∣n</em>p−nq∣k)1/k
- Spezielle Fälle
- Stadtblock/Manhattan: D<em>1(p,q)=∣m</em>p−m<em>q∣+∣n</em>p−nq∣
- Euklidisch: D<em>2(p,q)=(m</em>p−m<em>q)2+(n</em>p−nq)2
- Schachbrett/Chebyshev: D<em>∞(p,q)=max(∣m</em>p−m<em>q∣,∣n</em>p−nq∣)
Grundlegende Bildoperationen
- Arithmetische Pixel-Operationen (elementweise)
- Addition, Subtraktion, Multiplikation, Division
- Subtraktion → Differenzbild zur Bewegungserkennung
- Logische Pixel-Operationen
- NOT, AND, OR, XOR
- Einsatz: Maskierung, Morphologische Verfahren, ROI-Extraktion
Stand der Technik (Auswahl)
- Gesichtserkennung (u. a. Canon Face Detection)
- Posen-Schätzung: Kinect, OpenPose
- Erd- & Straßenbild-Analyse: Google Earth/Street View
- OCR & Nummernschilder: LeNet-5, LPR-Systeme
- Datensätze: SVHN (≈ 600 k RGB-Bilder, 32×32 Pixel, Hausnummern 0–9)
- Objektdetektion & ‑segmentierung: YOLOv8, Mask R-CNN
- Fahrerassistenz: Verkehrszeichenerkennung (Opel), Active Suspension (Daimler), Tesla Autopilot
- 3D-Szenenrekonstruktion: NeRF (Neural Radiance Fields, ECCV 2020)
- Robotik: Boston Dynamics – visuell gesteuerte Lokomotion
Relevanz des Moduls für Studierende
- Hohe wirtschaftliche Bedeutung & interdisziplinäre Anwendbarkeit
- Kombination aus Mathematik, Physik, Informatik & Kognition
- Praktische Projektmöglichkeiten mit unmittelbarem Nutzen
Zusammenfassung der heutigen Sitzung
- Motivation & Anwendungsfelder digitaler Bildverarbeitung
- Strukturelle Einordnung: Bildverarbeitung ↔ Bildanalyse ↔ Computer Vision
- Grundlagen des menschlichen Sehens: Anatomie, Wahrnehmungsphänomene, Licht & Intensität
- Digitale Bildrepräsentation: Rasterung, Quantisierung, Farbkanäle
- Nachbarschaften & Distanzmetriken als Basis für Segmentierung & Morphologie
- Elementare arithmetische & logische Bildoperationen
- Überblick moderner CV-Systeme & Forschungsstände
Offene Fragen
- Wie lassen sich subjektive und objektive Bildqualitätsmetriken korrelieren?
- Welche Rolle spielen tiefenabhängige Hinweise (Stereo, Motion-Parallaxe) bei 2D-Systemen?
- Wie können wir interpretierbare KI-Modelle für sicherheitskritische Anwendungen garantieren?
Literatur (Auswahl der in der Vorlesung zitierten Quellen)
- Karrierebibel – Optische Täuschungen
- Wissenschaft-X – Optical Illusion Tricks
- LEIFIphysik – Elektromagnetisches Spektrum
- Filmscanner – Farbwahrnehmung
- Uni Heidelberg – Stäbchen & Zapfen
- pinlight.eu – Lichtstrom
- FAZ – Venedig, Himmel oder Hölle?
- TheClickReader – Convolution/Pooling für RGB
- DataHacker – Image Arithmetic & Logical Ops (OpenCV)
- Gonzalez & Wintz – Digital Image Processing (Buch)
- TheAILearner – Bildkontrast
- NeRF Veröffentlichungen & Website
- Ultralytics YOLOv8 Dokumentation
- Queensland X-Ray – Medical Imaging
- OpenAerialMap – Satellitenbilder
- Olympus LifeScience – Human Vision
- YouTube Thumbnail („i7MNiBDFbFQ“)
- twinkl – Mathematik-Symbole
- Vinc Mazet – Image-Operations Tutorial