Ein Black-Box-Modell ist ein Modell, dessen interne Schlussfolgerungs- oder Entscheidungsprozesse für Menschen schwer oder unmöglich direkt zu verstehen sind. Nutzer können Eingaben und Ausgaben beobachten, aber der Weg von der einen zur anderen bleibt intransparent oder nicht interpretierbar. Viele Deep-Learning-Modelle und große Sprachmodelle werden für Governance-Zwecke als Black-Box-Systeme behandelt.
A model whose "reasoning" is impossible or difficult for humans to understand. That is, although humans can see how prompts affect responses, humans can't determine exactly how a black box model determines the response. In other words, a black box model is lacking interpretability. Most deep models and large language models are black boxes.