Lerne, NLP- und LLM-Anwendungen skalierbar und sicher zu betreiben und performante Inference-Services, RAG-Pipelines und Streaming-Anwendungen umzusetzen.
Steckbrief
- Abschluss
- Short Advanced Studies (SAS)
- Lernsetting
- Präsenz
- ECTS-Punkte
- 3
- Nächster Start
- 5.3.2027
- Dauer
- 4 Unterrichtstage
- Durchführungsort
- Brugg-Windisch
- Preis
- CHF 1800.-
Ziele und Nutzen
Der produktive Betrieb moderner NLP- und LLM-Anwendungen stellt besondere Anforderungen an Architektur, Skalierung und Ressourcennutzung. In diesem Modul lernst du, robuste Inference-Services aufzubauen und Anwendungen so zu gestalten, dass sie auch unter Last zuverlässig funktionieren. Dabei beschäftigst du dich mit API-Architekturen, asynchroner Verarbeitung, Queues, Worker-Patterns und Load Balancing sowie mit Batch- und Streaming-Verfahren.
Ein weiterer Schwerpunkt liegt auf dem effizienten Betrieb von Large Language Models. Du lernst zentrale Konzepte moderner LLM-Inference kennen und setzt dich mit Technologien wie vLLM, KV-Caching und Quantisierung auseinander. Zudem entwickelst du ein Verständnis dafür, wie RAG-Systeme mit Embeddings und Vector Stores operationalisiert und Anwendungen gezielt hinsichtlich Latenz, Durchsatz und Hardware-Ressourcen optimiert werden können.
Neben Performance und Skalierbarkeit spielt auch die Betriebssicherheit eine wichtige Rolle. Du lernst typische Risiken von LLM-Anwendungen kennen und erfährst, wie Guardrails gegen Prompt Injection und unerwünschte Ausgaben eingesetzt werden können. Anhand einer integrierten, containerisierten Anwendung verbindest du die einzelnen Komponenten zu einem realitätsnahen NLP-System.
Aufbau und Inhalte
Du kannst:
- skalierbare Inference-Architekturen mit APIs, Queues und Worker-Patterns entwerfen und umsetzen.
- NLP-Services als REST-APIs implementieren und Requests von der eigentlichen Verarbeitung entkoppeln.
- Streaming- und Batch-Verfahren für unterschiedliche Anwendungsszenarien einsetzen.
- RAG-Pipelines mit Embeddings, Vector Stores und Ähnlichkeitssuche operationalisieren.
- NLP-Komponenten in einer containerisierten Umgebung zu einem lauffähigen Gesamtsystem zusammenführen.
Du kennst:
- zentrale Architektur- und Skalierungsmuster für den produktiven Betrieb von NLP- und LLM-Anwendungen.
- moderne Serving-Technologien und Konzepte wie vLLM, Paged Attention und KV-Caching.
- Quantisierungsverfahren zur effizienteren Nutzung von Rechenleistung und GPU-Speicher.
- typische Sicherheitsrisiken von LLM-Anwendungen sowie geeignete Guardrail-Mechanismen.
- die grundlegenden Komponenten einer Voice-Pipeline aus Speech-to-Text, LLM und Text-to-Speech.
Du weisst:
- wie sich Latenz, Durchsatz und Kosten gegenseitig beeinflussen und welche Trade-offs bei der Systemauslegung entstehen.
- welche Faktoren für die Wahl zwischen lokalem und cloudbasiertem LLM-Betrieb relevant sind.
- wie sich Inference-Systeme gezielt auf hohen Durchsatz oder kurze Antwortzeiten optimieren lassen.
- wie Guardrails für Prompt-Injection-Schutz, Output-Filtering und Content Policies eingesetzt werden.
Du verstehst:
- weshalb die Skalierung von NLP- und LLM-Services andere Anforderungen stellt als die reine Modellentwicklung.
- wie Streaming, Batching und asynchrone Verarbeitung das Verhalten eines Inference-Systems beeinflussen.
- welche Rolle Hardware-Auslastung und VRAM bei der Bereitstellung grosser Sprachmodelle spielen.
weshalb insbesondere bei interaktiven und sprachbasierten Anwendungen eine geringe Time-to-First-Token entscheidend ist.
Dozierende
Die Dozierenden kommen aus dem FHNW Institut für Interaktive Technologien IIT, aus der angewandten Forschung sowie aus der Praxis. Dadurch erhältst du nicht nur theoretisch fundiertes Wissen, sondern auch eine Einordnung, welche Ansätze sich in produktiven Projekten tatsächlich bewähren.
Tritt mit uns in Kontakt
Dr. Erion Elmasllari
- Telefon
- +41 56 202 84 95 (Direkt)
- erion.elmasllari@fhnw.ch
Info-Anlässe
Loading...
