Digitale Bildverarbeitung – Einführung (Vorlesung 1)

Motivation der digitalen Bildverarbeitung

  • Ziel: Lösung realer, praxisbezogener Probleme mittels Computer-Vision-Ansätzen
    • Kommerzielle Chancen in Medizin, Industrie, Überwachung, Mobilität u. v. m.
    • Wachsender Datenstrom: zig-Tausende neu erzeugte Bilder pro Tag in sozialen Medien, ständig steigende Anzahl öffentlich installierter Kameras
    • Hoher Bedarf an Vision-Expert*innen → zunehmende Anzahl nationaler & internationaler Konferenzen
  • Kognitive Grundlage: Unser Gehirn interpretiert Bilder mithilfe von Heuristiken → optische Täuschungen verdeutlichen Grenzen & Chancen automatischer Systeme

Begriffsabgrenzung

  • Bildverarbeitung (Image Processing)
    • Low-Level-Vorgänge (Pixel-Domäne)
    • Ziel: verbessertes/optimiertes Bild
    • Beispiele: Entrauschen, Entschärfen, Farb- & Schattenentfernung, Kontraststeigerung
  • Bildanalyse (Image Analysis)
    • Mid-Level-Vorgänge
    • Extraktion spezifischer Bildmerkmale (Kanten, Regionen, Formen)
  • Maschinelles Sehen / Computer Vision / KI
    • High-Level-Vorgänge (Semantik)
    • Kontext-, Objekt- & Szenenerkennung; Entscheidung & Handlungsplanung

Anwendungsgebiete

  • Medizin: MRT, CT, Röntgen, Ultraschall, Telemedizin-Workflows
  • Geowissenschaften & Fernerkundung: Satelliten-Imaging, Ozean- & Landbeobachtung, Wettervorhersage
  • Militär & Sicherheit: Zielerfassung, Drohnensicht, Überwachung, Nachtbildsysteme
  • Kunst & Multimedia: Film, Fotografie, visuelle Effekte, Restaurierung
  • Industrie: Robotik-Sehen, Messtechnik, Qualitätssicherung, Prozessautomatisierung

Bildqualität & -verbesserung

  • Grundfrage: „Wie misst man Bildqualität?“
    • Subjektive Wahrnehmung (visuelle Tests)
    • Objektive Metriken (MSE, PSNR, SSIM, NIQE …)
  • Typische Verfahren:
    • Histogramm-Equalisation, CLAHE
    • Kontrast-Stretching, Tonemapping, Weißabgleich
    • Filter: Median, Gaussian, Bilateral (Entrauschen, Entschärfen)
    • Farbkorrektur, Schattenentfernung
    • Beispiel „Kontrast“: visuelle Steigerung der Helligkeitsdynamik (vgl. Folienabbildungen)

Menschliches Sehen

  • Optische Täuschungen zeigen: Wahrnehmung ≠ physikalische Realität (vgl. Quellen [1], [2])
  • Lesebeispiel mit permutierten Buchstaben („Ehct ksras…“) → Gehirn interpretiert ganze Wortformen
  • Sichtbarer Bereich des elektromagnetischen Spektrums: 400 nm (Violett) – 750 nm (Rot)
  • Anatomie & Funktion
    • Zwei Augen → Fusion korrelierter Retina-Information → binokulares Sehen
    • Fovea (≈ 1,5 mm) an Sehachse, dicht gepackte Zapfen, verantwortlich für scharfes Farbsehen
    • Blinder Fleck an Optikus-Austritt, keine Rezeptoren
    • Photorezeptoren
    • Zapfen: ≈ 5 Mio, Tag-/Farbsehen, jeder Zapfen indiv. Nervenanbindung
    • Stäbchen: ≈ 100–150 Mio, Nacht- & Periphersehen, 10 : 1-Verschaltung
  • Beleuchtungsstärken (in Lux = lm/m²)
    • Sonniger Tag ≈ 100000100\,000
    • Bewölkt ≈ 1000010\,000
    • Büro ≈ 10001\,000
    • Vollmond ≈ 0.10.1

Herausforderungen des Sehens

  • 3D → 2D-Projektion verliert Tiefen- & Skalierungs­informationen
  • Bilder können verrauscht, schlecht beleuchtet, mehrdeutig sein
  • Mensch & Algorithmus benötigen:
    • Geometrie-/Physik-Verständnis
    • Mathematische Modelle für Anhaltspunkte & Vorwissen
    • Rechenmodelle/Algorithmen zur Zustands­schätzung der Welt

Digitale Bilddarstellung

  • Kontinuierliche Szene f(x,y)f(x,y) → diskretisierte Matrix f[m,n]f[m,n]
  • Grauwert-Beispiel: f(x,y)[0,127]f(x,y)\to[0,127] (7-Bit, demonstriert auf Folie)
  • Ursprung bei f(0,0)f(0,0)
  • RGB-Representation
    • Drei Kanäle Red, Green, Blue
    • Pixelindex p(w,h,c)p(w,h,c) mit Breite ww, Höhe hh, Kanal cR,G,Bc \in {R,G,B}

Rasterung & Quantisierung

  • Rasterung: Diskretisierung der kontinuierlichen Koordinaten x,yx,y → Gitterpunkte m,nm,n
    • f[m,n]f(x,y)f[m,n] \approx f(x,y)
  • Quantisierung: Zuordnung kontinuierlicher Intensitäten zu endlichem Wertebereich V1=0,1,,126,127V_1 = {0,1,\dots,126,127}
  • Umsetzung: Sensor-Array projiziert Szene → Matrix vordefinierter Pixel
  • Farbreduktion Beispiel: 256 → 8 → 4 Graustufen

Nachbarschaftsbeziehungen

  • 4-Nachbarschaft: horizontale/vertikale Pixel (x±1,y)(x\pm1,y), (x,y±1)(x,y\pm1)
  • 8-Nachbarschaft: zusätzliche Diagonalen (x±1,y±1)(x\pm1,y\pm1)
  • Definition: Pixel QQ ist 8-Nachbar von PP ↔ gemeinsame Kante oder Ecke

Entfernungsmetriken

  • Metrik-Eigenschaften
    • D(p,q)0    D(p,q)=0  fu¨r  p=qD(p,q) \ge 0 \;\wedge\; D(p,q)=0 \;\text{für}\; p=q
    • Symmetrie D(p,q)=D(q,p)D(p,q)=D(q,p)
    • Dreiecksungleichung D(p,r)D(p,q)+D(q,r)D(p,r)\le D(p,q)+D(q,r)
  • Allgemein: D<em>k(p,q)=(m</em>pm<em>qk+n</em>pnqk)1/kD<em>k(p,q)=\big(|m</em>p-m<em>q|^k + |n</em>p-n_q|^k\big)^{1/k}
  • Spezielle Fälle
    • Stadtblock/Manhattan: D<em>1(p,q)=m</em>pm<em>q+n</em>pnqD<em>1(p,q)=|m</em>p-m<em>q|+|n</em>p-n_q|
    • Euklidisch: D<em>2(p,q)=(m</em>pm<em>q)2+(n</em>pnq)2D<em>2(p,q)=\sqrt{(m</em>p-m<em>q)^2+(n</em>p-n_q)^2}
    • Schachbrett/Chebyshev: D<em>(p,q)=max(m</em>pm<em>q,n</em>pnq)D<em>\infty(p,q)=\max(|m</em>p-m<em>q|,|n</em>p-n_q|)

Grundlegende Bildoperationen

  • Arithmetische Pixel-Operationen (elementweise)
    • Addition, Subtraktion, Multiplikation, Division
    • Subtraktion → Differenzbild zur Bewegungserkennung
  • Logische Pixel-Operationen
    • NOT, AND, OR, XOR
    • Einsatz: Maskierung, Morphologische Verfahren, ROI-Extraktion

Stand der Technik (Auswahl)

  • Gesichtserkennung (u. a. Canon Face Detection)
  • Posen-Schätzung: Kinect, OpenPose
  • Erd- & Straßenbild-Analyse: Google Earth/Street View
  • OCR & Nummernschilder: LeNet-5, LPR-Systeme
  • Datensätze: SVHN (≈ 600 k RGB-Bilder, 32×3232\times32 Pixel, Hausnummern 0–9)
  • Objekt­detektion & ‑segmentierung: YOLOv8, Mask R-CNN
  • Fahrerassistenz: Verkehrszeichenerkennung (Opel), Active Suspension (Daimler), Tesla Autopilot
  • 3D-Szenenrekonstruktion: NeRF (Neural Radiance Fields, ECCV 2020)
  • Robotik: Boston Dynamics – visuell gesteuerte Lokomotion

Relevanz des Moduls für Studierende

  • Hohe wirtschaftliche Bedeutung & interdisziplinäre Anwendbarkeit
  • Kombination aus Mathematik, Physik, Informatik & Kognition
  • Praktische Projektmöglichkeiten mit unmittelbarem Nutzen

Zusammenfassung der heutigen Sitzung

  • Motivation & Anwendungsfelder digitaler Bildverarbeitung
  • Strukturelle Einordnung: Bildverarbeitung ↔ Bildanalyse ↔ Computer Vision
  • Grundlagen des menschlichen Sehens: Anatomie, Wahrnehmungs­phänomene, Licht & Intensität
  • Digitale Bildrepräsentation: Rasterung, Quantisierung, Farbkanäle
  • Nachbarschaften & Distanzmetriken als Basis für Segmentierung & Morphologie
  • Elementare arithmetische & logische Bildoperationen
  • Überblick moderner CV-Systeme & Forschungsstände

Offene Fragen

  • Wie lassen sich subjektive und objektive Bildqualitäts­metriken korrelieren?
  • Welche Rolle spielen tiefenabhängige Hinweise (Stereo, Motion-Parallaxe) bei 2D-Systemen?
  • Wie können wir interpretierbare KI-Modelle für sicherheitskritische Anwendungen garantieren?

Literatur (Auswahl der in der Vorlesung zitierten Quellen)

  1. Karrierebibel – Optische Täuschungen
  2. Wissenschaft-X – Optical Illusion Tricks
  3. LEIFIphysik – Elektromagnetisches Spektrum
  4. Filmscanner – Farbwahrnehmung
  5. Uni Heidelberg – Stäbchen & Zapfen
  6. pinlight.eu – Lichtstrom
  7. FAZ – Venedig, Himmel oder Hölle?
  8. TheClickReader – Convolution/Pooling für RGB
  9. DataHacker – Image Arithmetic & Logical Ops (OpenCV)
  10. Gonzalez & Wintz – Digital Image Processing (Buch)
  11. TheAILearner – Bildkontrast
  12. NeRF Veröffentlichungen & Website
  13. Ultralytics YOLOv8 Dokumentation
  14. Queensland X-Ray – Medical Imaging
  15. OpenAerialMap – Satellitenbilder
  16. Olympus LifeScience – Human Vision
  17. YouTube Thumbnail („i7MNiBDFbFQ“)
  18. twinkl – Mathematik-Symbole
  19. Vinc Mazet – Image-Operations Tutorial