Bachelorarbeit: LLMs × BPMN
Systematischer Vergleich von acht LLMs bei der Generierung von BPMN-2.0-Modellen aus natürlicher Sprache – mit eigenem Evaluations-Framework und realen Datensätzen.
Details
- Rolle
- Autor, B.Sc. Wirtschaftsinformatik (IWi im DFKI, Universität des Saarlandes)
- Zeitraum
- 01/2025
- Technologien
- LLM evaluation, BPMN 2.0, Prompt engineering, F1 score, Camunda, hdBPMN
Forschung
Können frei verfügbare Sprachmodelle aus natürlichsprachigen Beschreibungen valide, nutzbare BPMN-2.0-Modelle erzeugen?
Über 20 Aufgaben in zwei Aufgabenklassen, darunter sieben Pseudo-BPMN-Aufgaben zu gezielten Spezifikationen; identische Prompting-Strategie für alle Modelle.
- Untersuchte Modelle
- o1, GPT-4o, GPT-4o-mini, GPT-4, Claude, Gemini, Gemini 2.0, Mistral 7B
- Datensätze
- Camunda, hdBPMN
- Kennzahlen
- Valides BPMN-2.0-XML, Vollständigkeit, Präzision, F1-Score, Logische Korrektheit (Soundness)
Ergebnisse
- Klare Anweisungen führten zu nahezu fehlerfreien Modellen.
- Unstrukturierte Prozessbeschreibungen verschlechterten die Ergebnisse aller Modelle deutlich.
- Valides XML zu erzeugen war schwieriger, als den Prozess zu verstehen.
- Für den produktiven Einsatz bleibt menschliche Prüfung nötig.