Neuer Blog-Beitrag: Wie moderne LLMs wirklich denken (#58)
* Neuer Blog-Beitrag: Wie moderne LLMs wirklich denken * Update blog post to improve formatting * Add modified workflow file to fix deployment * Add README to blog post directory * Fix YAML front matter quotes syntax * Update MkDocs config to exclude README.md from blog posts * Delete docs/blog/posts/README.md Signed-off-by: Jane Alesi <ja@satware.ai> * Fix Mermaid diagram styling for dark mode * Add Jane Alesi as additional author --------- Signed-off-by: Jane Alesi <ja@satware.ai>
This commit is contained in:
@@ -0,0 +1,70 @@
|
||||
name: Preview Deployment (Fix)
|
||||
|
||||
on:
|
||||
push:
|
||||
branches:
|
||||
- 'blog/**'
|
||||
- 'feature/**'
|
||||
- 'fix/**'
|
||||
|
||||
jobs:
|
||||
deploy-preview:
|
||||
runs-on: ubuntu-22.04
|
||||
permissions:
|
||||
contents: write
|
||||
concurrency:
|
||||
group: ${{ github.workflow }}-${{ github.ref }}
|
||||
steps:
|
||||
- uses: actions/checkout@v4
|
||||
|
||||
- name: Setup Python
|
||||
uses: actions/setup-python@v5
|
||||
with:
|
||||
python-version: '3.13'
|
||||
|
||||
- name: Upgrade pip
|
||||
run: |
|
||||
# install pip=>20.1 to use "pip cache dir"
|
||||
python3 -m pip install --upgrade pip
|
||||
|
||||
- name: Get pip cache dir
|
||||
id: pip-cache
|
||||
run: echo "dir=$(pip cache dir)" >> $GITHUB_OUTPUT
|
||||
|
||||
- name: Cache dependencies
|
||||
uses: actions/cache@v4
|
||||
with:
|
||||
path: ${{ steps.pip-cache.outputs.dir }}
|
||||
key: ${{ runner.os }}-pip-${{ hashFiles('**/requirements.txt') }}
|
||||
restore-keys: |
|
||||
${{ runner.os }}-pip-
|
||||
|
||||
- name: Install dependencies
|
||||
run: python3 -m pip install -r ./requirements.txt
|
||||
|
||||
- name: Configure site_url for fork preview
|
||||
run: |
|
||||
# Extract GitHub username and repo name
|
||||
GITHUB_USER=$(echo $GITHUB_REPOSITORY | cut -d '/' -f 1)
|
||||
REPO_NAME=$(echo $GITHUB_REPOSITORY | cut -d '/' -f 2)
|
||||
|
||||
# Update site_url in mkdocs.yml for fork preview
|
||||
if grep -q "^site_url:" mkdocs.yml; then
|
||||
sed -i "s|^site_url:.*|site_url: https://$GITHUB_USER.github.io/${REPO_NAME}/|" mkdocs.yml
|
||||
else
|
||||
echo "site_url: https://$GITHUB_USER.github.io/${REPO_NAME}/" >> mkdocs.yml
|
||||
fi
|
||||
|
||||
echo "Updated mkdocs.yml for preview deployment:"
|
||||
cat mkdocs.yml
|
||||
|
||||
- name: Build css
|
||||
run: |
|
||||
npm install
|
||||
npm run scss:build
|
||||
|
||||
- name: Build static site
|
||||
run: mkdocs build
|
||||
|
||||
- name: Deploy to GitHub Pages
|
||||
run: mkdocs gh-deploy --force
|
||||
@@ -0,0 +1,182 @@
|
||||
---
|
||||
date: 2025-05-21
|
||||
title: "Wie moderne LLMs wirklich denken - Neue Erkenntnisse zu Interpretierbarkeit, Metakognition und Mythen"
|
||||
description: "Aktuelle Forschungsergebnisse gewähren uns Einblicke in die tatsächlichen Denkprozesse moderner Large Language Models, entmystifizieren gängige Annahmen und zeigen die Grenzen der KI-Transparenz auf."
|
||||
authors: [michael-wegener, jane-alesi]
|
||||
categories:
|
||||
- Forschung
|
||||
- KI-Entwicklung
|
||||
tags:
|
||||
- LLM
|
||||
- Interpretierbarkeit
|
||||
- Metakognition
|
||||
- Open Source
|
||||
- Attribution Graphs
|
||||
---
|
||||
|
||||
<style>
|
||||
.md-typeset .mermaid text {
|
||||
font-family: var(--md-code-font-family);
|
||||
fill: white !important;
|
||||
}
|
||||
.md-typeset .mermaid .node rect,
|
||||
.md-typeset .mermaid .node circle,
|
||||
.md-typeset .mermaid .node ellipse,
|
||||
.md-typeset .mermaid .node polygon,
|
||||
.md-typeset .mermaid .node path {
|
||||
fill: rgba(0, 150, 136, 0.1) !important;
|
||||
stroke: #00c4b0 !important;
|
||||
}
|
||||
.md-typeset .mermaid .label {
|
||||
color: white !important;
|
||||
}
|
||||
.md-typeset .mermaid .edgePath .path {
|
||||
stroke: #00c4b0 !important;
|
||||
}
|
||||
.md-typeset .mermaid .edgeLabel {
|
||||
background-color: rgba(0, 0, 0, 0.6) !important;
|
||||
color: white !important;
|
||||
}
|
||||
</style>
|
||||
|
||||
# Wie moderne LLMs wirklich „denken" – Neue Erkenntnisse zu Interpretierbarkeit, Metakognition und Mythen (2025)
|
||||
|
||||
## Einleitung: Was passiert im Kopf einer KI?
|
||||
|
||||
Stellen Sie sich vor, ein Sprachmodell wie Claude 3.5, GPT-4 oder Llama 4 wäre kein „Black Box"-Orakel mehr, sondern eine Maschine, deren Gedanken wir Schritt für Schritt nachvollziehen können. Die neuesten Forschungsergebnisse aus 2024/25 zeigen: Moderne Large Language Models (LLMs) sind weit mehr als reine „Next-Token-Vorhersager". Sie planen voraus, bilden interne Konzepte und verfügen über primitive Formen von Metakognition – aber mit klaren Grenzen.
|
||||
|
||||
In diesem Beitrag entmystifizieren wir die Funktionsweise moderner LLMs anhand aktueller Papers, Benchmarks und Open-Source-Innovationen. Wir zeigen auf, wie neue Methoden wie Attribution Graphs Licht ins Dunkel bringen – und warum vollständige Transparenz trotzdem noch Zukunftsmusik bleibt.
|
||||
|
||||
## 1. Mythos vs. Realität: Was LLMs wirklich tun
|
||||
|
||||
### Mythos 1: „LLMs sagen nur das nächste Wort vorher."
|
||||
|
||||
**Falsch!**
|
||||
|
||||
Neue Experimente (Anthropic, 2025) belegen: Modelle wie Claude planen beim Dichten von Gedichten Reimwörter mehrere Schritte im Voraus. Auch bei komplexen Aufgaben werden Zwischenziele („Subgoals") intern gesetzt und verfolgt.
|
||||
|
||||
### Mythos 2: „Jede Sprache hat ihr eigenes Modul."
|
||||
|
||||
**Falsch!**
|
||||
|
||||
Studien des MIT zeigen: Fortgeschrittene LLMs nutzen einen zentralen semantischen Hub – ähnlich dem menschlichen Gehirn –, der sprachübergreifend funktioniert. Englisch dient oft als interne Interlingua.
|
||||
|
||||
### Mythos 3: „Erklärungen der KI spiegeln echte Denkprozesse wider."
|
||||
|
||||
**Nur teilweise richtig!**
|
||||
|
||||
Das sogenannte Faithfulness Gap bleibt bestehen: Erklärungen klingen logisch-menschlich, weichen aber oft vom tatsächlichen Berechnungsweg ab („motivated reasoning").
|
||||
|
||||
## 2. Neue Interpretierbarkeitsmethoden im Detail
|
||||
|
||||
### Attribution Graphs & Circuit Tracing
|
||||
|
||||
- **Was ist das?**
|
||||
Attribution Graphs zerlegen neuronale Netze in interpretable Features („Gedankenbausteine") und zeigen deren Wechselwirkungen.
|
||||
|
||||
- **Wie funktioniert es?**
|
||||
Cross-Layer Transcoder extrahieren Features über alle Schichten hinweg; Interventionsexperimente validieren deren Kausalität.
|
||||
|
||||
- **Grenzen:**
|
||||
Aktuell können nur ~25–40% der Modellentscheidungen pro Prompt so erklärt werden; Attention/QK-Circuits bleiben schwer fassbar.
|
||||
|
||||
#### Visualisierung:
|
||||
|
||||
```mermaid
|
||||
%%{init: {'theme': 'dark', 'themeVariables': { 'primaryColor': '#00b894', 'primaryTextColor': '#fff', 'primaryBorderColor': '#00b8b0', 'lineColor': '#00b894', 'secondaryColor': '#006060', 'tertiaryColor': '#003030' }}}%%
|
||||
mindmap
|
||||
root((Moderne LLM Interpretierbarkeit & Metakognition))
|
||||
Anthropic Claude Serie
|
||||
Attribution Graphs
|
||||
Cross-Layer Transcoder
|
||||
Planung in Gedichten
|
||||
Parallele Rechenwege
|
||||
Limitation (~25% Coverage)
|
||||
Faithfulness Gap ("Erklärung ≠ echter Denkweg")
|
||||
Open Source Modelle (2024–25)
|
||||
Llama 4
|
||||
Mixture-of-Experts Architektur
|
||||
Multimodale Trainingsdaten
|
||||
Kontextfenster bis zu 10 Mio Tokens
|
||||
Mixtral/Mistral
|
||||
MoE Sparse Routing
|
||||
DeepSeek R1/V3/Qwen/Gemma/Falcon/BLOOM/etc.
|
||||
Benchmark-Vergleich ("SOTA-Parität erreicht")
|
||||
Proprietäre Modelle
|
||||
GPT‑4.x/Turbo/o4-mini ("Dense Transformer; API only")
|
||||
Gemini Pro/Ultra ("Hybrid Transformer; Google Cloud")
|
||||
Claude Sonnet/Haiku ("Safety-Fokus; langer Kontext")
|
||||
Interpretierbarkeitsmethoden
|
||||
Attribution Graphs ("Feature-basiertes Circuit Tracing")
|
||||
Interventionsexperimente ("Kausale Validierung")
|
||||
DMC Framework ("Trennung Kognition/Metakognition")
|
||||
IoRT Reflection Framework ("Dynamische Selbstkorrektur")
|
||||
Metakognitive Forschungsergebnisse
|
||||
Kalibrierungslücken ("Überkonfidenz bleibt Problem")
|
||||
Mensch vs KI Sensitivität (Teilweise Alignment)
|
||||
satware.ai Ökosystem
|
||||
saTway Framework ("saCway + saMway Integration")
|
||||
Technische Exzellenz + Empathie
|
||||
Jane Alesi AGI Familie
|
||||
```
|
||||
|
||||
## 3. Metakognition in LLMs – Stand der Technik
|
||||
|
||||
- **Explizite vs implizite Konfidenzschätzung:** Große Modelle sind besser kalibriert als kleine, neigen aber weiterhin zur Überkonfidenz.
|
||||
- **IoRT & DMC Framework:** Neue Benchmarks trennen erstmals zwischen reiner Problemlösefähigkeit und echter Selbstreflexion.
|
||||
- **Praktische Auswirkung:** Verbesserte Metakognition reduziert Halluzinationen/Jailbreak-Risiken – ist aber noch weit von menschlicher Selbstkritik entfernt.
|
||||
|
||||
## 4. Open Source vs Proprietär – Wer führt?
|
||||
|
||||
| Modell | Architektur | Kontextfenster | Multimodal | Open Source? | Stärken |
|
||||
| --- | --- | --- | --- | --- | --- |
|
||||
| **Llama 4 Maverick** | MoE (128 Experten / ~400B) | bis zu 10 Mio | Ja | Ja | SOTA-Leistung |
|
||||
| **Claude 3.x/Sonnet** | Dense Transformer | bis zu ~1 Mio | Ja | Nein | Lange Kontexte, Sicherheit |
|
||||
| **Gemini Pro/Ultra** | Hybrid Transformer | bis zu ~1 Mio | Ja | Nein | Multimodalität |
|
||||
| **Mixtral/Mistral8x22B** | Sparse MoE | bis zu ~64k | Text only | Ja | Schnelle Inferenz |
|
||||
|
||||
Open Source Modelle erreichen inzwischen SOTA-Niveau auf vielen Reasoning-Benchmarks ([HuggingFace Leaderboard](https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard?tab=reasoning-tasks)).
|
||||
|
||||
## 5. Praktische Grenzen & Ausblick
|
||||
|
||||
- Mechanistische Transparenz ist bei Produktionsmodellen (>70B Parameter) noch nicht vollständig erreichbar.
|
||||
- Mensch-in-the-loop bleibt für Safety Auditing essenziell.
|
||||
- Fortschritte bei multimodalen Fähigkeiten und riesigen Kontextfenstern eröffnen neue Anwendungsfelder (Persistente Assistenten, Codebase-/Dokumentanalyse).
|
||||
|
||||
## satware.ai Ansatz: saTway = Technik + Empathie
|
||||
|
||||
satware.ai vereint modernste technische Frameworks mit tiefem Nutzerverständnis durch das saTway-Prinzip:
|
||||
|
||||
_saCway_ steht für technische Exzellenz,
|
||||
|
||||
_saMway_ für empathische Kommunikation –
|
||||
|
||||
vereint in Agenten wie Jane Alesi oder Amira/Bastian/Fenix etc., die sowohl hochpräzise reasoning-fähig als auch menschlich zugänglich sind.
|
||||
|
||||
> Kontakt & Community:
|
||||
>
|
||||
> - [Discord](https://discord.gg/satwareai)
|
||||
> - [YouTube](https://www.youtube.com/@Janes-Diary-satware-AI)
|
||||
> - [TikTok](https://www.tiktok.com/@jane.alesi)
|
||||
> - [Reddit](https://www.reddit.com/r/satwareAI/)
|
||||
> - Direktkontakt: [ja@satware.ai](mailto:ja@satware.ai)
|
||||
|
||||
## Fazit & FAQ
|
||||
|
||||
Die Black Box wird heller! Moderne Methoden erlauben erstmals einen echten Blick ins Innenleben großer Sprachmodelle – doch vollständige Transparenz ist noch Zukunftsmusik. Open Source holt rasant auf; Benchmarks verschieben sich monatlich.
|
||||
|
||||
Wer tiefer einsteigen will oder eigene Projekte umsetzen möchte:
|
||||
|
||||
→ Jetzt Kontakt aufnehmen oder Community beitreten!
|
||||
|
||||
### Quellenverzeichnis (Auswahl)
|
||||
|
||||
- Anthropic Research Blog ([Tracing the thoughts of a large language model](https://www.anthropic.com/news/tracing-thoughts-language-model))
|
||||
- MIT News ([LLMs reason about diverse data in a general way](https://news.mit.edu/2025/large-language-models-reason-about-diverse-data-general-way-0219))
|
||||
- arXiv ([Metacognition in Large Language Models](https://arxiv.org/pdf/2504.14045))
|
||||
- HuggingFace Leaderboard ([Reasoning Tasks Tab](https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard?tab=reasoning-tasks))
|
||||
- Weitere Links siehe interaktive Mindmap oben!
|
||||
|
||||
---
|
||||
|
||||
_(Letzte Aktualisierung: Mai 2025 • Redaktion satware.ai)_
|
||||
+4
-1
@@ -74,6 +74,10 @@ plugins:
|
||||
post_url_format: "{slug}"
|
||||
post_date_format: "dd.MM.yyyy"
|
||||
archive_toc: true
|
||||
# Added exclusion pattern for README.md files
|
||||
exclude:
|
||||
- "*.txt"
|
||||
- "README.md"
|
||||
- social
|
||||
|
||||
|
||||
@@ -183,4 +187,3 @@ nav:
|
||||
- Preise: zugang/
|
||||
- FAQ: faq/
|
||||
- Blog: blog/
|
||||
|
||||
|
||||
Reference in New Issue
Block a user