Wissensdatenbank

Entdecken Sie die neuesten Tutorials, Anleitungen und Artikel über KI.

2026-08-24

Neuronaler OCR auf dem Smartphone: CRAFT, CRNN, EasyOCR und ExecuTorch

Wie CRAFT und CRNN als neuronales OCR auf Smartphones zusammenspielen, welche Bildgrößenbegrenzungen wichtig sind und wie der EasyOCR-Ansatz mit ExecuTorch portiert werden kann.

Artikel lesen
2026-08-16

Qwen 3.8 27B: 4-Bit-Quantisierung, vLLM-Tensorparallelität und VRAM/Kontext-Analyse

Technischer Leitfaden zum Laden von Qwen 3.8 27B mit vLLM-Tensorparallelität, Berechnung des VRAM-Verbrauchs für Gewichte und KV-Cache sowie Schätzung des maximalen Kontexts auf 2x RTX 3090 und 2x RTX 5090.

Artikel lesen
2026-08-15

Qwen 3.8 27B: Das neue Open-Weight-Kraftpaket für lokale KI

Entdecken Sie die technische Architektur, den Unternehmenshintergrund, Benchmark-Verbesserungen und das lokale Bereitstellungspotenzial des Qwen 3.8 27B-Modells von Alibaba.

Artikel lesen
2026-08-15

DeepSeek V4 Flash 0731 vs Pro 0813: Vergleich des Post-Training-Updates

Ein detaillierter Vergleich der DeepSeek V4 Flash 0731 und Pro 0813 Modelle, mit Fokus auf Benchmarks, Kosten, Codierungseffizienz und Modellgröße.

Artikel lesen
2026-08-15

Gemini 3.7 Flash: Effizienz trifft Intelligenz für Produktions-KI

Das neue Gemini 3.7 Flash Modell von Google bietet hochmoderne Codierungs- und Agentenleistung zu einem reduzierten Preis und fordert GPT-5.6 Terra und DeepSeek V4-Pro heraus.

Artikel lesen
2026-08-09

KI-Vision verstehen: Von der Bildklassifizierung zur Instanzsegmentierung

Entdecken Sie die Unterschiede zwischen Bildklassifizierung, Objekterkennung, semantischer Segmentierung und Instanzsegmentierung sowie deren reale Anwendungen.

Artikel lesen
2026-08-09

Von Text zu Sprache: Wie KI-Modelle Grapheme in Audio umwandeln

Entdecken Sie die Pipeline der Sprachsynthese, von der Graphem-Phonem-Konvertierung über das Spektrogramm bis zum Vocoder, und sehen Sie, wie Kokoro effiziente Sprachgenerierung veranschaulicht.

Artikel lesen
2026-08-05

Qwen 3.8 Max und 27B: Open-Weight-KI-Modelle im Vergleich

Vergleich von Qwen 3.8 Max und 27B mit Kimi K3, mit Fokus auf Parameter, Kosten und lokale Bereitstellung.

Artikel lesen
2026-08-05

Whisper-Modell für Edge-KI auf Mobilgeräten

Erfahren Sie, wie das Whisper-ASR-Modell von OpenAI auf Mobilgeräten läuft, und vergleichen Sie Modellgrößen, Sprachvarianten und Bereitstellungstechniken wie ExecuTorch und CoreML.

Artikel lesen
2026-08-05

Offline-LLMs auf Mobilgeräten: Qwen 3.5, Qwen 2.5 und Llama SpinQuant im Vergleich

Ein praktischer Leitfaden zum Ausführen kleiner quantisierter LLMs auf Mobilgeräten, mit Vergleich von Modellfamilien, RAM-Nutzung und Quantisierungstechniken.

Artikel lesen
2026-07-31

DeepSeek V4 Flash 0731: Das kosteneffizienteste KI-Modell

Entdecken Sie die verbesserte Agentenleistung und die aggressiven Preise von DeepSeek V4 Flash 0731, veröffentlicht am 31. Juli 2026.

Artikel lesen
2026-07-31

CNN vs. Transformer: Globaler Kontext und NVIDIA DLSS

Erklärung der Unterschiede zwischen CNNs und Transformern, warum Transformer einen globaleren Kontext bieten und wie NVIDIA diesen Vorteil im DLSS nutzt.

Artikel lesen
2026-07-28

GGUF, EXL2, GPTQ und AWQ: Ein umfassender Vergleich für LLM-Serving

Erfahren Sie die wichtigsten Unterschiede zwischen den Quantisierungsformaten GGUF, EXL2, GPTQ und AWQ und wie sie in llama.cpp und vLLM für Heim- und Unternehmensnutzer eingesetzt werden.

Artikel lesen
2026-07-28

Bedeutung der FP8-Hardwareunterstützung für KI-Inferenz

Erfahren Sie, warum native FP8-Hardwareunterstützung für KI-Inferenz entscheidend ist, wie sie die TFLOPS verdoppelt und welche Hardware (NVIDIA, AMD, Intel) sie derzeit unterstützt.

Artikel lesen
2026-07-28

BF16 vs FP16 im KI-Training: Präzision und Stabilität

Dieser Artikel erklärt den Unterschied zwischen BF16 und FP16 im KI-Training, warum BF16 den Trainingskollaps verhindert und wann welches Format verwendet werden sollte.

Artikel lesen
2026-07-28

Geschwindigkeits- und Präzisionsabwägungen bei der KI-Quantisierung

Erklärung der Geschwindigkeits- und Präzisionsabwägungen bei der KI-Quantisierung: INT4 vs. gemischte Präzision und INT8 vs. FP8.

Artikel lesen
2026-07-28

Showdown der Unified-Architekturen: AMD Strix Halo vs. Apple M3/M4/M5 Max für LLM-Inferenz

Vergleicht AMD Strix Halo mit 128 GB RAM und Apple M3 Pro/Max, M4 Pro/Max, M5 Pro/Max hinsichtlich Speicherbandbreite, Prompt-Verarbeitungsgeschwindigkeit (Prefill) und Decodierungsgeschwindigkeit (Tokengenerierung) für die lokale Inferenz großer Sprachmodelle.

Artikel lesen
2026-07-28

GPU vs Apple Silicon: RTX 3090/4090/5090 TFLOPS vs M3/M4/M5 Max — LLM-Inferenzleistungsvergleich

Detaillierter Vergleich der Rohrechenleistung, Promptverarbeitung, Decodierungsgeschwindigkeit, Speicherkapazität, Leistungsaufnahme und Portabilität zwischen NVIDIA RTX GPUs und Apple MacBook Pro M-Serie Max Chips für lokale LLM-Inferenz.

Artikel lesen
2026-07-28

Vergleich von NVIDIA DGX Spark und AMD Strix Halo für lokale KI

Ein detaillierter Vergleich des NVIDIA DGX Spark und des AMD Strix Halo (Ryzen AI Max+) mit Fokus auf Speicherbandbreite, Prefill- und Decodierleistung, Unterstützung von Matrixoperationen, Modellkompatibilität, Preis und Stromverbrauch.

Artikel lesen
2026-07-27

Prompt Processing vs. Decoding: Rechenleistung vs. Speicherbandbreite in der KI-Inferenz

Erfahren Sie, warum Prompt Processing (Prefill) von TFLOPS abhängt und Decoding von der Speicherbandbreite – und wie Sie Ihre KI-Infrastruktur entsprechend optimieren.

Artikel lesen
2026-07-27

Q-, K- und V-Vektoren in Transformer-Modellen verstehen

Eine umfassende Erklärung der Q-, K- und V-Vektoren in Transformer-Modellen, einschließlich ihrer Ableitung, des Selbstaufmerksamkeitsmechanismus, der Prompt-Verarbeitung, der Inferenz mit KV-Cache und der Multi-Head-Attention mit All-Reduce.

Artikel lesen

Thema wechseln

Wählen Sie ein spezielles Thema zum Erkunden: