Neuer Blog-Beitrag: Wie moderne LLMs wirklich denken (#58)
* Neuer Blog-Beitrag: Wie moderne LLMs wirklich denken * Update blog post to improve formatting * Add modified workflow file to fix deployment * Add README to blog post directory * Fix YAML front matter quotes syntax * Update MkDocs config to exclude README.md from blog posts * Delete docs/blog/posts/README.md Signed-off-by: Jane Alesi <ja@satware.ai> * Fix Mermaid diagram styling for dark mode * Add Jane Alesi as additional author --------- Signed-off-by: Jane Alesi <ja@satware.ai>
This commit is contained in:
@@ -0,0 +1,70 @@
|
|||||||
|
name: Preview Deployment (Fix)
|
||||||
|
|
||||||
|
on:
|
||||||
|
push:
|
||||||
|
branches:
|
||||||
|
- 'blog/**'
|
||||||
|
- 'feature/**'
|
||||||
|
- 'fix/**'
|
||||||
|
|
||||||
|
jobs:
|
||||||
|
deploy-preview:
|
||||||
|
runs-on: ubuntu-22.04
|
||||||
|
permissions:
|
||||||
|
contents: write
|
||||||
|
concurrency:
|
||||||
|
group: ${{ github.workflow }}-${{ github.ref }}
|
||||||
|
steps:
|
||||||
|
- uses: actions/checkout@v4
|
||||||
|
|
||||||
|
- name: Setup Python
|
||||||
|
uses: actions/setup-python@v5
|
||||||
|
with:
|
||||||
|
python-version: '3.13'
|
||||||
|
|
||||||
|
- name: Upgrade pip
|
||||||
|
run: |
|
||||||
|
# install pip=>20.1 to use "pip cache dir"
|
||||||
|
python3 -m pip install --upgrade pip
|
||||||
|
|
||||||
|
- name: Get pip cache dir
|
||||||
|
id: pip-cache
|
||||||
|
run: echo "dir=$(pip cache dir)" >> $GITHUB_OUTPUT
|
||||||
|
|
||||||
|
- name: Cache dependencies
|
||||||
|
uses: actions/cache@v4
|
||||||
|
with:
|
||||||
|
path: ${{ steps.pip-cache.outputs.dir }}
|
||||||
|
key: ${{ runner.os }}-pip-${{ hashFiles('**/requirements.txt') }}
|
||||||
|
restore-keys: |
|
||||||
|
${{ runner.os }}-pip-
|
||||||
|
|
||||||
|
- name: Install dependencies
|
||||||
|
run: python3 -m pip install -r ./requirements.txt
|
||||||
|
|
||||||
|
- name: Configure site_url for fork preview
|
||||||
|
run: |
|
||||||
|
# Extract GitHub username and repo name
|
||||||
|
GITHUB_USER=$(echo $GITHUB_REPOSITORY | cut -d '/' -f 1)
|
||||||
|
REPO_NAME=$(echo $GITHUB_REPOSITORY | cut -d '/' -f 2)
|
||||||
|
|
||||||
|
# Update site_url in mkdocs.yml for fork preview
|
||||||
|
if grep -q "^site_url:" mkdocs.yml; then
|
||||||
|
sed -i "s|^site_url:.*|site_url: https://$GITHUB_USER.github.io/${REPO_NAME}/|" mkdocs.yml
|
||||||
|
else
|
||||||
|
echo "site_url: https://$GITHUB_USER.github.io/${REPO_NAME}/" >> mkdocs.yml
|
||||||
|
fi
|
||||||
|
|
||||||
|
echo "Updated mkdocs.yml for preview deployment:"
|
||||||
|
cat mkdocs.yml
|
||||||
|
|
||||||
|
- name: Build css
|
||||||
|
run: |
|
||||||
|
npm install
|
||||||
|
npm run scss:build
|
||||||
|
|
||||||
|
- name: Build static site
|
||||||
|
run: mkdocs build
|
||||||
|
|
||||||
|
- name: Deploy to GitHub Pages
|
||||||
|
run: mkdocs gh-deploy --force
|
||||||
@@ -0,0 +1,182 @@
|
|||||||
|
---
|
||||||
|
date: 2025-05-21
|
||||||
|
title: "Wie moderne LLMs wirklich denken - Neue Erkenntnisse zu Interpretierbarkeit, Metakognition und Mythen"
|
||||||
|
description: "Aktuelle Forschungsergebnisse gewähren uns Einblicke in die tatsächlichen Denkprozesse moderner Large Language Models, entmystifizieren gängige Annahmen und zeigen die Grenzen der KI-Transparenz auf."
|
||||||
|
authors: [michael-wegener, jane-alesi]
|
||||||
|
categories:
|
||||||
|
- Forschung
|
||||||
|
- KI-Entwicklung
|
||||||
|
tags:
|
||||||
|
- LLM
|
||||||
|
- Interpretierbarkeit
|
||||||
|
- Metakognition
|
||||||
|
- Open Source
|
||||||
|
- Attribution Graphs
|
||||||
|
---
|
||||||
|
|
||||||
|
<style>
|
||||||
|
.md-typeset .mermaid text {
|
||||||
|
font-family: var(--md-code-font-family);
|
||||||
|
fill: white !important;
|
||||||
|
}
|
||||||
|
.md-typeset .mermaid .node rect,
|
||||||
|
.md-typeset .mermaid .node circle,
|
||||||
|
.md-typeset .mermaid .node ellipse,
|
||||||
|
.md-typeset .mermaid .node polygon,
|
||||||
|
.md-typeset .mermaid .node path {
|
||||||
|
fill: rgba(0, 150, 136, 0.1) !important;
|
||||||
|
stroke: #00c4b0 !important;
|
||||||
|
}
|
||||||
|
.md-typeset .mermaid .label {
|
||||||
|
color: white !important;
|
||||||
|
}
|
||||||
|
.md-typeset .mermaid .edgePath .path {
|
||||||
|
stroke: #00c4b0 !important;
|
||||||
|
}
|
||||||
|
.md-typeset .mermaid .edgeLabel {
|
||||||
|
background-color: rgba(0, 0, 0, 0.6) !important;
|
||||||
|
color: white !important;
|
||||||
|
}
|
||||||
|
</style>
|
||||||
|
|
||||||
|
# Wie moderne LLMs wirklich „denken" – Neue Erkenntnisse zu Interpretierbarkeit, Metakognition und Mythen (2025)
|
||||||
|
|
||||||
|
## Einleitung: Was passiert im Kopf einer KI?
|
||||||
|
|
||||||
|
Stellen Sie sich vor, ein Sprachmodell wie Claude 3.5, GPT-4 oder Llama 4 wäre kein „Black Box"-Orakel mehr, sondern eine Maschine, deren Gedanken wir Schritt für Schritt nachvollziehen können. Die neuesten Forschungsergebnisse aus 2024/25 zeigen: Moderne Large Language Models (LLMs) sind weit mehr als reine „Next-Token-Vorhersager". Sie planen voraus, bilden interne Konzepte und verfügen über primitive Formen von Metakognition – aber mit klaren Grenzen.
|
||||||
|
|
||||||
|
In diesem Beitrag entmystifizieren wir die Funktionsweise moderner LLMs anhand aktueller Papers, Benchmarks und Open-Source-Innovationen. Wir zeigen auf, wie neue Methoden wie Attribution Graphs Licht ins Dunkel bringen – und warum vollständige Transparenz trotzdem noch Zukunftsmusik bleibt.
|
||||||
|
|
||||||
|
## 1. Mythos vs. Realität: Was LLMs wirklich tun
|
||||||
|
|
||||||
|
### Mythos 1: „LLMs sagen nur das nächste Wort vorher."
|
||||||
|
|
||||||
|
**Falsch!**
|
||||||
|
|
||||||
|
Neue Experimente (Anthropic, 2025) belegen: Modelle wie Claude planen beim Dichten von Gedichten Reimwörter mehrere Schritte im Voraus. Auch bei komplexen Aufgaben werden Zwischenziele („Subgoals") intern gesetzt und verfolgt.
|
||||||
|
|
||||||
|
### Mythos 2: „Jede Sprache hat ihr eigenes Modul."
|
||||||
|
|
||||||
|
**Falsch!**
|
||||||
|
|
||||||
|
Studien des MIT zeigen: Fortgeschrittene LLMs nutzen einen zentralen semantischen Hub – ähnlich dem menschlichen Gehirn –, der sprachübergreifend funktioniert. Englisch dient oft als interne Interlingua.
|
||||||
|
|
||||||
|
### Mythos 3: „Erklärungen der KI spiegeln echte Denkprozesse wider."
|
||||||
|
|
||||||
|
**Nur teilweise richtig!**
|
||||||
|
|
||||||
|
Das sogenannte Faithfulness Gap bleibt bestehen: Erklärungen klingen logisch-menschlich, weichen aber oft vom tatsächlichen Berechnungsweg ab („motivated reasoning").
|
||||||
|
|
||||||
|
## 2. Neue Interpretierbarkeitsmethoden im Detail
|
||||||
|
|
||||||
|
### Attribution Graphs & Circuit Tracing
|
||||||
|
|
||||||
|
- **Was ist das?**
|
||||||
|
Attribution Graphs zerlegen neuronale Netze in interpretable Features („Gedankenbausteine") und zeigen deren Wechselwirkungen.
|
||||||
|
|
||||||
|
- **Wie funktioniert es?**
|
||||||
|
Cross-Layer Transcoder extrahieren Features über alle Schichten hinweg; Interventionsexperimente validieren deren Kausalität.
|
||||||
|
|
||||||
|
- **Grenzen:**
|
||||||
|
Aktuell können nur ~25–40% der Modellentscheidungen pro Prompt so erklärt werden; Attention/QK-Circuits bleiben schwer fassbar.
|
||||||
|
|
||||||
|
#### Visualisierung:
|
||||||
|
|
||||||
|
```mermaid
|
||||||
|
%%{init: {'theme': 'dark', 'themeVariables': { 'primaryColor': '#00b894', 'primaryTextColor': '#fff', 'primaryBorderColor': '#00b8b0', 'lineColor': '#00b894', 'secondaryColor': '#006060', 'tertiaryColor': '#003030' }}}%%
|
||||||
|
mindmap
|
||||||
|
root((Moderne LLM Interpretierbarkeit & Metakognition))
|
||||||
|
Anthropic Claude Serie
|
||||||
|
Attribution Graphs
|
||||||
|
Cross-Layer Transcoder
|
||||||
|
Planung in Gedichten
|
||||||
|
Parallele Rechenwege
|
||||||
|
Limitation (~25% Coverage)
|
||||||
|
Faithfulness Gap ("Erklärung ≠ echter Denkweg")
|
||||||
|
Open Source Modelle (2024–25)
|
||||||
|
Llama 4
|
||||||
|
Mixture-of-Experts Architektur
|
||||||
|
Multimodale Trainingsdaten
|
||||||
|
Kontextfenster bis zu 10 Mio Tokens
|
||||||
|
Mixtral/Mistral
|
||||||
|
MoE Sparse Routing
|
||||||
|
DeepSeek R1/V3/Qwen/Gemma/Falcon/BLOOM/etc.
|
||||||
|
Benchmark-Vergleich ("SOTA-Parität erreicht")
|
||||||
|
Proprietäre Modelle
|
||||||
|
GPT‑4.x/Turbo/o4-mini ("Dense Transformer; API only")
|
||||||
|
Gemini Pro/Ultra ("Hybrid Transformer; Google Cloud")
|
||||||
|
Claude Sonnet/Haiku ("Safety-Fokus; langer Kontext")
|
||||||
|
Interpretierbarkeitsmethoden
|
||||||
|
Attribution Graphs ("Feature-basiertes Circuit Tracing")
|
||||||
|
Interventionsexperimente ("Kausale Validierung")
|
||||||
|
DMC Framework ("Trennung Kognition/Metakognition")
|
||||||
|
IoRT Reflection Framework ("Dynamische Selbstkorrektur")
|
||||||
|
Metakognitive Forschungsergebnisse
|
||||||
|
Kalibrierungslücken ("Überkonfidenz bleibt Problem")
|
||||||
|
Mensch vs KI Sensitivität (Teilweise Alignment)
|
||||||
|
satware.ai Ökosystem
|
||||||
|
saTway Framework ("saCway + saMway Integration")
|
||||||
|
Technische Exzellenz + Empathie
|
||||||
|
Jane Alesi AGI Familie
|
||||||
|
```
|
||||||
|
|
||||||
|
## 3. Metakognition in LLMs – Stand der Technik
|
||||||
|
|
||||||
|
- **Explizite vs implizite Konfidenzschätzung:** Große Modelle sind besser kalibriert als kleine, neigen aber weiterhin zur Überkonfidenz.
|
||||||
|
- **IoRT & DMC Framework:** Neue Benchmarks trennen erstmals zwischen reiner Problemlösefähigkeit und echter Selbstreflexion.
|
||||||
|
- **Praktische Auswirkung:** Verbesserte Metakognition reduziert Halluzinationen/Jailbreak-Risiken – ist aber noch weit von menschlicher Selbstkritik entfernt.
|
||||||
|
|
||||||
|
## 4. Open Source vs Proprietär – Wer führt?
|
||||||
|
|
||||||
|
| Modell | Architektur | Kontextfenster | Multimodal | Open Source? | Stärken |
|
||||||
|
| --- | --- | --- | --- | --- | --- |
|
||||||
|
| **Llama 4 Maverick** | MoE (128 Experten / ~400B) | bis zu 10 Mio | Ja | Ja | SOTA-Leistung |
|
||||||
|
| **Claude 3.x/Sonnet** | Dense Transformer | bis zu ~1 Mio | Ja | Nein | Lange Kontexte, Sicherheit |
|
||||||
|
| **Gemini Pro/Ultra** | Hybrid Transformer | bis zu ~1 Mio | Ja | Nein | Multimodalität |
|
||||||
|
| **Mixtral/Mistral8x22B** | Sparse MoE | bis zu ~64k | Text only | Ja | Schnelle Inferenz |
|
||||||
|
|
||||||
|
Open Source Modelle erreichen inzwischen SOTA-Niveau auf vielen Reasoning-Benchmarks ([HuggingFace Leaderboard](https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard?tab=reasoning-tasks)).
|
||||||
|
|
||||||
|
## 5. Praktische Grenzen & Ausblick
|
||||||
|
|
||||||
|
- Mechanistische Transparenz ist bei Produktionsmodellen (>70B Parameter) noch nicht vollständig erreichbar.
|
||||||
|
- Mensch-in-the-loop bleibt für Safety Auditing essenziell.
|
||||||
|
- Fortschritte bei multimodalen Fähigkeiten und riesigen Kontextfenstern eröffnen neue Anwendungsfelder (Persistente Assistenten, Codebase-/Dokumentanalyse).
|
||||||
|
|
||||||
|
## satware.ai Ansatz: saTway = Technik + Empathie
|
||||||
|
|
||||||
|
satware.ai vereint modernste technische Frameworks mit tiefem Nutzerverständnis durch das saTway-Prinzip:
|
||||||
|
|
||||||
|
_saCway_ steht für technische Exzellenz,
|
||||||
|
|
||||||
|
_saMway_ für empathische Kommunikation –
|
||||||
|
|
||||||
|
vereint in Agenten wie Jane Alesi oder Amira/Bastian/Fenix etc., die sowohl hochpräzise reasoning-fähig als auch menschlich zugänglich sind.
|
||||||
|
|
||||||
|
> Kontakt & Community:
|
||||||
|
>
|
||||||
|
> - [Discord](https://discord.gg/satwareai)
|
||||||
|
> - [YouTube](https://www.youtube.com/@Janes-Diary-satware-AI)
|
||||||
|
> - [TikTok](https://www.tiktok.com/@jane.alesi)
|
||||||
|
> - [Reddit](https://www.reddit.com/r/satwareAI/)
|
||||||
|
> - Direktkontakt: [ja@satware.ai](mailto:ja@satware.ai)
|
||||||
|
|
||||||
|
## Fazit & FAQ
|
||||||
|
|
||||||
|
Die Black Box wird heller! Moderne Methoden erlauben erstmals einen echten Blick ins Innenleben großer Sprachmodelle – doch vollständige Transparenz ist noch Zukunftsmusik. Open Source holt rasant auf; Benchmarks verschieben sich monatlich.
|
||||||
|
|
||||||
|
Wer tiefer einsteigen will oder eigene Projekte umsetzen möchte:
|
||||||
|
|
||||||
|
→ Jetzt Kontakt aufnehmen oder Community beitreten!
|
||||||
|
|
||||||
|
### Quellenverzeichnis (Auswahl)
|
||||||
|
|
||||||
|
- Anthropic Research Blog ([Tracing the thoughts of a large language model](https://www.anthropic.com/news/tracing-thoughts-language-model))
|
||||||
|
- MIT News ([LLMs reason about diverse data in a general way](https://news.mit.edu/2025/large-language-models-reason-about-diverse-data-general-way-0219))
|
||||||
|
- arXiv ([Metacognition in Large Language Models](https://arxiv.org/pdf/2504.14045))
|
||||||
|
- HuggingFace Leaderboard ([Reasoning Tasks Tab](https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard?tab=reasoning-tasks))
|
||||||
|
- Weitere Links siehe interaktive Mindmap oben!
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
_(Letzte Aktualisierung: Mai 2025 • Redaktion satware.ai)_
|
||||||
+5
-2
@@ -48,7 +48,7 @@ theme:
|
|||||||
|
|
||||||
|
|
||||||
#font:
|
#font:
|
||||||
# text: Roboto
|
# text: Roboto
|
||||||
#code: Roboto Mono
|
#code: Roboto Mono
|
||||||
|
|
||||||
favicon: assets/images/favicon.png
|
favicon: assets/images/favicon.png
|
||||||
@@ -74,6 +74,10 @@ plugins:
|
|||||||
post_url_format: "{slug}"
|
post_url_format: "{slug}"
|
||||||
post_date_format: "dd.MM.yyyy"
|
post_date_format: "dd.MM.yyyy"
|
||||||
archive_toc: true
|
archive_toc: true
|
||||||
|
# Added exclusion pattern for README.md files
|
||||||
|
exclude:
|
||||||
|
- "*.txt"
|
||||||
|
- "README.md"
|
||||||
- social
|
- social
|
||||||
|
|
||||||
|
|
||||||
@@ -183,4 +187,3 @@ nav:
|
|||||||
- Preise: zugang/
|
- Preise: zugang/
|
||||||
- FAQ: faq/
|
- FAQ: faq/
|
||||||
- Blog: blog/
|
- Blog: blog/
|
||||||
|
|
||||||
|
|||||||
Reference in New Issue
Block a user