Bachelorarbeit: LLMs × BPMN

Forschung · 01/2025

Systematischer Vergleich von acht LLMs bei der Generierung von BPMN-2.0-Modellen aus natürlicher Sprache – mit eigenem Evaluations-Framework und realen Datensätzen.

Details

Rolle
Autor, B.Sc. Wirtschaftsinformatik (IWi im DFKI, Universität des Saarlandes)
Zeitraum
01/2025
Technologien
LLM evaluation, BPMN 2.0, Prompt engineering, F1 score, Camunda, hdBPMN

Forschung

Können frei verfügbare Sprachmodelle aus natürlichsprachigen Beschreibungen valide, nutzbare BPMN-2.0-Modelle erzeugen?

Über 20 Aufgaben in zwei Aufgabenklassen, darunter sieben Pseudo-BPMN-Aufgaben zu gezielten Spezifikationen; identische Prompting-Strategie für alle Modelle.

Untersuchte Modelle
o1, GPT-4o, GPT-4o-mini, GPT-4, Claude, Gemini, Gemini 2.0, Mistral 7B
Datensätze
Camunda, hdBPMN
Kennzahlen
Valides BPMN-2.0-XML, Vollständigkeit, Präzision, F1-Score, Logische Korrektheit (Soundness)

Ergebnisse

  • Klare Anweisungen führten zu nahezu fehlerfreien Modellen.
  • Unstrukturierte Prozessbeschreibungen verschlechterten die Ergebnisse aller Modelle deutlich.
  • Valides XML zu erzeugen war schwieriger, als den Prozess zu verstehen.
  • Für den produktiven Einsatz bleibt menschliche Prüfung nötig.

← Zurück zur Übersicht