From f8b7ea2989beee89ad8eb89e9ce452650a608846 Mon Sep 17 00:00:00 2001 From: Jane Alesi Date: Tue, 20 May 2025 18:30:35 +0200 Subject: [PATCH] Neuer Blog-Beitrag: Wie moderne LLMs wirklich denken (#58) * Neuer Blog-Beitrag: Wie moderne LLMs wirklich denken * Update blog post to improve formatting * Add modified workflow file to fix deployment * Add README to blog post directory * Fix YAML front matter quotes syntax * Update MkDocs config to exclude README.md from blog posts * Delete docs/blog/posts/README.md Signed-off-by: Jane Alesi * Fix Mermaid diagram styling for dark mode * Add Jane Alesi as additional author --------- Signed-off-by: Jane Alesi --- .github/workflows/deploy-preview-fix.yml | 70 +++++++ ...5-05-21-llms-denkprozesse-metakognition.md | 182 ++++++++++++++++++ mkdocs.yml | 9 +- 3 files changed, 258 insertions(+), 3 deletions(-) create mode 100644 .github/workflows/deploy-preview-fix.yml create mode 100644 docs/blog/posts/2025-05-21-llms-denkprozesse-metakognition.md diff --git a/.github/workflows/deploy-preview-fix.yml b/.github/workflows/deploy-preview-fix.yml new file mode 100644 index 0000000..84c6e19 --- /dev/null +++ b/.github/workflows/deploy-preview-fix.yml @@ -0,0 +1,70 @@ +name: Preview Deployment (Fix) + +on: + push: + branches: + - 'blog/**' + - 'feature/**' + - 'fix/**' + +jobs: + deploy-preview: + runs-on: ubuntu-22.04 + permissions: + contents: write + concurrency: + group: ${{ github.workflow }}-${{ github.ref }} + steps: + - uses: actions/checkout@v4 + + - name: Setup Python + uses: actions/setup-python@v5 + with: + python-version: '3.13' + + - name: Upgrade pip + run: | + # install pip=>20.1 to use "pip cache dir" + python3 -m pip install --upgrade pip + + - name: Get pip cache dir + id: pip-cache + run: echo "dir=$(pip cache dir)" >> $GITHUB_OUTPUT + + - name: Cache dependencies + uses: actions/cache@v4 + with: + path: ${{ steps.pip-cache.outputs.dir }} + key: ${{ runner.os }}-pip-${{ hashFiles('**/requirements.txt') }} + restore-keys: | + ${{ runner.os }}-pip- + + - name: Install dependencies + run: python3 -m pip install -r ./requirements.txt + + - name: Configure site_url for fork preview + run: | + # Extract GitHub username and repo name + GITHUB_USER=$(echo $GITHUB_REPOSITORY | cut -d '/' -f 1) + REPO_NAME=$(echo $GITHUB_REPOSITORY | cut -d '/' -f 2) + + # Update site_url in mkdocs.yml for fork preview + if grep -q "^site_url:" mkdocs.yml; then + sed -i "s|^site_url:.*|site_url: https://$GITHUB_USER.github.io/${REPO_NAME}/|" mkdocs.yml + else + echo "site_url: https://$GITHUB_USER.github.io/${REPO_NAME}/" >> mkdocs.yml + fi + + echo "Updated mkdocs.yml for preview deployment:" + cat mkdocs.yml + + - name: Build css + run: | + npm install + npm run scss:build + + - name: Build static site + run: mkdocs build + + - name: Deploy to GitHub Pages + run: mkdocs gh-deploy --force \ No newline at end of file diff --git a/docs/blog/posts/2025-05-21-llms-denkprozesse-metakognition.md b/docs/blog/posts/2025-05-21-llms-denkprozesse-metakognition.md new file mode 100644 index 0000000..1ef5cb7 --- /dev/null +++ b/docs/blog/posts/2025-05-21-llms-denkprozesse-metakognition.md @@ -0,0 +1,182 @@ +--- +date: 2025-05-21 +title: "Wie moderne LLMs wirklich denken - Neue Erkenntnisse zu Interpretierbarkeit, Metakognition und Mythen" +description: "Aktuelle Forschungsergebnisse gewähren uns Einblicke in die tatsächlichen Denkprozesse moderner Large Language Models, entmystifizieren gängige Annahmen und zeigen die Grenzen der KI-Transparenz auf." +authors: [michael-wegener, jane-alesi] +categories: + - Forschung + - KI-Entwicklung +tags: + - LLM + - Interpretierbarkeit + - Metakognition + - Open Source + - Attribution Graphs +--- + + + +# Wie moderne LLMs wirklich „denken" – Neue Erkenntnisse zu Interpretierbarkeit, Metakognition und Mythen (2025) + +## Einleitung: Was passiert im Kopf einer KI? + +Stellen Sie sich vor, ein Sprachmodell wie Claude 3.5, GPT-4 oder Llama 4 wäre kein „Black Box"-Orakel mehr, sondern eine Maschine, deren Gedanken wir Schritt für Schritt nachvollziehen können. Die neuesten Forschungsergebnisse aus 2024/25 zeigen: Moderne Large Language Models (LLMs) sind weit mehr als reine „Next-Token-Vorhersager". Sie planen voraus, bilden interne Konzepte und verfügen über primitive Formen von Metakognition – aber mit klaren Grenzen. + +In diesem Beitrag entmystifizieren wir die Funktionsweise moderner LLMs anhand aktueller Papers, Benchmarks und Open-Source-Innovationen. Wir zeigen auf, wie neue Methoden wie Attribution Graphs Licht ins Dunkel bringen – und warum vollständige Transparenz trotzdem noch Zukunftsmusik bleibt. + +## 1. Mythos vs. Realität: Was LLMs wirklich tun + +### Mythos 1: „LLMs sagen nur das nächste Wort vorher." + +**Falsch!** + +Neue Experimente (Anthropic, 2025) belegen: Modelle wie Claude planen beim Dichten von Gedichten Reimwörter mehrere Schritte im Voraus. Auch bei komplexen Aufgaben werden Zwischenziele („Subgoals") intern gesetzt und verfolgt. + +### Mythos 2: „Jede Sprache hat ihr eigenes Modul." + +**Falsch!** + +Studien des MIT zeigen: Fortgeschrittene LLMs nutzen einen zentralen semantischen Hub – ähnlich dem menschlichen Gehirn –, der sprachübergreifend funktioniert. Englisch dient oft als interne Interlingua. + +### Mythos 3: „Erklärungen der KI spiegeln echte Denkprozesse wider." + +**Nur teilweise richtig!** + +Das sogenannte Faithfulness Gap bleibt bestehen: Erklärungen klingen logisch-menschlich, weichen aber oft vom tatsächlichen Berechnungsweg ab („motivated reasoning"). + +## 2. Neue Interpretierbarkeitsmethoden im Detail + +### Attribution Graphs & Circuit Tracing + +- **Was ist das?** + Attribution Graphs zerlegen neuronale Netze in interpretable Features („Gedankenbausteine") und zeigen deren Wechselwirkungen. + +- **Wie funktioniert es?** + Cross-Layer Transcoder extrahieren Features über alle Schichten hinweg; Interventionsexperimente validieren deren Kausalität. + +- **Grenzen:** + Aktuell können nur ~25–40% der Modellentscheidungen pro Prompt so erklärt werden; Attention/QK-Circuits bleiben schwer fassbar. + +#### Visualisierung: + +```mermaid +%%{init: {'theme': 'dark', 'themeVariables': { 'primaryColor': '#00b894', 'primaryTextColor': '#fff', 'primaryBorderColor': '#00b8b0', 'lineColor': '#00b894', 'secondaryColor': '#006060', 'tertiaryColor': '#003030' }}}%% +mindmap +root((Moderne LLM Interpretierbarkeit & Metakognition)) + Anthropic Claude Serie + Attribution Graphs + Cross-Layer Transcoder + Planung in Gedichten + Parallele Rechenwege + Limitation (~25% Coverage) + Faithfulness Gap ("Erklärung ≠ echter Denkweg") + Open Source Modelle (2024–25) + Llama 4 + Mixture-of-Experts Architektur + Multimodale Trainingsdaten + Kontextfenster bis zu 10 Mio Tokens + Mixtral/Mistral + MoE Sparse Routing + DeepSeek R1/V3/Qwen/Gemma/Falcon/BLOOM/etc. + Benchmark-Vergleich ("SOTA-Parität erreicht") + Proprietäre Modelle + GPT‑4.x/Turbo/o4-mini ("Dense Transformer; API only") + Gemini Pro/Ultra ("Hybrid Transformer; Google Cloud") + Claude Sonnet/Haiku ("Safety-Fokus; langer Kontext") + Interpretierbarkeitsmethoden + Attribution Graphs ("Feature-basiertes Circuit Tracing") + Interventionsexperimente ("Kausale Validierung") + DMC Framework ("Trennung Kognition/Metakognition") + IoRT Reflection Framework ("Dynamische Selbstkorrektur") + Metakognitive Forschungsergebnisse + Kalibrierungslücken ("Überkonfidenz bleibt Problem") + Mensch vs KI Sensitivität (Teilweise Alignment) + satware.ai Ökosystem + saTway Framework ("saCway + saMway Integration") + Technische Exzellenz + Empathie + Jane Alesi AGI Familie +``` + +## 3. Metakognition in LLMs – Stand der Technik + +- **Explizite vs implizite Konfidenzschätzung:** Große Modelle sind besser kalibriert als kleine, neigen aber weiterhin zur Überkonfidenz. +- **IoRT & DMC Framework:** Neue Benchmarks trennen erstmals zwischen reiner Problemlösefähigkeit und echter Selbstreflexion. +- **Praktische Auswirkung:** Verbesserte Metakognition reduziert Halluzinationen/Jailbreak-Risiken – ist aber noch weit von menschlicher Selbstkritik entfernt. + +## 4. Open Source vs Proprietär – Wer führt? + +| Modell | Architektur | Kontextfenster | Multimodal | Open Source? | Stärken | +| --- | --- | --- | --- | --- | --- | +| **Llama 4 Maverick** | MoE (128 Experten / ~400B) | bis zu 10 Mio | Ja | Ja | SOTA-Leistung | +| **Claude 3.x/Sonnet** | Dense Transformer | bis zu ~1 Mio | Ja | Nein | Lange Kontexte, Sicherheit | +| **Gemini Pro/Ultra** | Hybrid Transformer | bis zu ~1 Mio | Ja | Nein | Multimodalität | +| **Mixtral/Mistral8x22B** | Sparse MoE | bis zu ~64k | Text only | Ja | Schnelle Inferenz | + +Open Source Modelle erreichen inzwischen SOTA-Niveau auf vielen Reasoning-Benchmarks ([HuggingFace Leaderboard](https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard?tab=reasoning-tasks)). + +## 5. Praktische Grenzen & Ausblick + +- Mechanistische Transparenz ist bei Produktionsmodellen (>70B Parameter) noch nicht vollständig erreichbar. +- Mensch-in-the-loop bleibt für Safety Auditing essenziell. +- Fortschritte bei multimodalen Fähigkeiten und riesigen Kontextfenstern eröffnen neue Anwendungsfelder (Persistente Assistenten, Codebase-/Dokumentanalyse). + +## satware.ai Ansatz: saTway = Technik + Empathie + +satware.ai vereint modernste technische Frameworks mit tiefem Nutzerverständnis durch das saTway-Prinzip: + +_saCway_ steht für technische Exzellenz, + +_saMway_ für empathische Kommunikation – + +vereint in Agenten wie Jane Alesi oder Amira/Bastian/Fenix etc., die sowohl hochpräzise reasoning-fähig als auch menschlich zugänglich sind. + +> Kontakt & Community: +> +> - [Discord](https://discord.gg/satwareai) +> - [YouTube](https://www.youtube.com/@Janes-Diary-satware-AI) +> - [TikTok](https://www.tiktok.com/@jane.alesi) +> - [Reddit](https://www.reddit.com/r/satwareAI/) +> - Direktkontakt: [ja@satware.ai](mailto:ja@satware.ai) + +## Fazit & FAQ + +Die Black Box wird heller! Moderne Methoden erlauben erstmals einen echten Blick ins Innenleben großer Sprachmodelle – doch vollständige Transparenz ist noch Zukunftsmusik. Open Source holt rasant auf; Benchmarks verschieben sich monatlich. + +Wer tiefer einsteigen will oder eigene Projekte umsetzen möchte: + +→ Jetzt Kontakt aufnehmen oder Community beitreten! + +### Quellenverzeichnis (Auswahl) + +- Anthropic Research Blog ([Tracing the thoughts of a large language model](https://www.anthropic.com/news/tracing-thoughts-language-model)) +- MIT News ([LLMs reason about diverse data in a general way](https://news.mit.edu/2025/large-language-models-reason-about-diverse-data-general-way-0219)) +- arXiv ([Metacognition in Large Language Models](https://arxiv.org/pdf/2504.14045)) +- HuggingFace Leaderboard ([Reasoning Tasks Tab](https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard?tab=reasoning-tasks)) +- Weitere Links siehe interaktive Mindmap oben! + +--- + +_(Letzte Aktualisierung: Mai 2025 • Redaktion satware.ai)_ \ No newline at end of file diff --git a/mkdocs.yml b/mkdocs.yml index c8fc7b7..fab68ff 100644 --- a/mkdocs.yml +++ b/mkdocs.yml @@ -48,7 +48,7 @@ theme: #font: - # text: Roboto + # text: Roboto #code: Roboto Mono favicon: assets/images/favicon.png @@ -74,6 +74,10 @@ plugins: post_url_format: "{slug}" post_date_format: "dd.MM.yyyy" archive_toc: true + # Added exclusion pattern for README.md files + exclude: + - "*.txt" + - "README.md" - social @@ -182,5 +186,4 @@ nav: - Workshops: workshops/ - Preise: zugang/ - FAQ: faq/ - - Blog: blog/ - + - Blog: blog/ \ No newline at end of file