Wissensdatenbank
Entdecken Sie die neuesten Tutorials, Anleitungen und Artikel über KI.
Neuronaler OCR auf dem Smartphone: CRAFT, CRNN, EasyOCR und ExecuTorch
Wie CRAFT und CRNN als neuronales OCR auf Smartphones zusammenspielen, welche Bildgrößenbegrenzungen wichtig sind und wie der EasyOCR-Ansatz mit ExecuTorch portiert werden kann.
Artikel lesenQwen 3.8 27B: 4-Bit-Quantisierung, vLLM-Tensorparallelität und VRAM/Kontext-Analyse
Technischer Leitfaden zum Laden von Qwen 3.8 27B mit vLLM-Tensorparallelität, Berechnung des VRAM-Verbrauchs für Gewichte und KV-Cache sowie Schätzung des maximalen Kontexts auf 2x RTX 3090 und 2x RTX 5090.
Artikel lesenQwen 3.8 27B: Das neue Open-Weight-Kraftpaket für lokale KI
Entdecken Sie die technische Architektur, den Unternehmenshintergrund, Benchmark-Verbesserungen und das lokale Bereitstellungspotenzial des Qwen 3.8 27B-Modells von Alibaba.
Artikel lesenDeepSeek V4 Flash 0731 vs Pro 0813: Vergleich des Post-Training-Updates
Ein detaillierter Vergleich der DeepSeek V4 Flash 0731 und Pro 0813 Modelle, mit Fokus auf Benchmarks, Kosten, Codierungseffizienz und Modellgröße.
Artikel lesenGemini 3.7 Flash: Effizienz trifft Intelligenz für Produktions-KI
Das neue Gemini 3.7 Flash Modell von Google bietet hochmoderne Codierungs- und Agentenleistung zu einem reduzierten Preis und fordert GPT-5.6 Terra und DeepSeek V4-Pro heraus.
Artikel lesenKI-Vision verstehen: Von der Bildklassifizierung zur Instanzsegmentierung
Entdecken Sie die Unterschiede zwischen Bildklassifizierung, Objekterkennung, semantischer Segmentierung und Instanzsegmentierung sowie deren reale Anwendungen.
Artikel lesenVon Text zu Sprache: Wie KI-Modelle Grapheme in Audio umwandeln
Entdecken Sie die Pipeline der Sprachsynthese, von der Graphem-Phonem-Konvertierung über das Spektrogramm bis zum Vocoder, und sehen Sie, wie Kokoro effiziente Sprachgenerierung veranschaulicht.
Artikel lesenQwen 3.8 Max und 27B: Open-Weight-KI-Modelle im Vergleich
Vergleich von Qwen 3.8 Max und 27B mit Kimi K3, mit Fokus auf Parameter, Kosten und lokale Bereitstellung.
Artikel lesenWhisper-Modell für Edge-KI auf Mobilgeräten
Erfahren Sie, wie das Whisper-ASR-Modell von OpenAI auf Mobilgeräten läuft, und vergleichen Sie Modellgrößen, Sprachvarianten und Bereitstellungstechniken wie ExecuTorch und CoreML.
Artikel lesenOffline-LLMs auf Mobilgeräten: Qwen 3.5, Qwen 2.5 und Llama SpinQuant im Vergleich
Ein praktischer Leitfaden zum Ausführen kleiner quantisierter LLMs auf Mobilgeräten, mit Vergleich von Modellfamilien, RAM-Nutzung und Quantisierungstechniken.
Artikel lesenDeepSeek V4 Flash 0731: Das kosteneffizienteste KI-Modell
Entdecken Sie die verbesserte Agentenleistung und die aggressiven Preise von DeepSeek V4 Flash 0731, veröffentlicht am 31. Juli 2026.
Artikel lesenCNN vs. Transformer: Globaler Kontext und NVIDIA DLSS
Erklärung der Unterschiede zwischen CNNs und Transformern, warum Transformer einen globaleren Kontext bieten und wie NVIDIA diesen Vorteil im DLSS nutzt.
Artikel lesenGGUF, EXL2, GPTQ und AWQ: Ein umfassender Vergleich für LLM-Serving
Erfahren Sie die wichtigsten Unterschiede zwischen den Quantisierungsformaten GGUF, EXL2, GPTQ und AWQ und wie sie in llama.cpp und vLLM für Heim- und Unternehmensnutzer eingesetzt werden.
Artikel lesenBedeutung der FP8-Hardwareunterstützung für KI-Inferenz
Erfahren Sie, warum native FP8-Hardwareunterstützung für KI-Inferenz entscheidend ist, wie sie die TFLOPS verdoppelt und welche Hardware (NVIDIA, AMD, Intel) sie derzeit unterstützt.
Artikel lesenBF16 vs FP16 im KI-Training: Präzision und Stabilität
Dieser Artikel erklärt den Unterschied zwischen BF16 und FP16 im KI-Training, warum BF16 den Trainingskollaps verhindert und wann welches Format verwendet werden sollte.
Artikel lesenGeschwindigkeits- und Präzisionsabwägungen bei der KI-Quantisierung
Erklärung der Geschwindigkeits- und Präzisionsabwägungen bei der KI-Quantisierung: INT4 vs. gemischte Präzision und INT8 vs. FP8.
Artikel lesenShowdown der Unified-Architekturen: AMD Strix Halo vs. Apple M3/M4/M5 Max für LLM-Inferenz
Vergleicht AMD Strix Halo mit 128 GB RAM und Apple M3 Pro/Max, M4 Pro/Max, M5 Pro/Max hinsichtlich Speicherbandbreite, Prompt-Verarbeitungsgeschwindigkeit (Prefill) und Decodierungsgeschwindigkeit (Tokengenerierung) für die lokale Inferenz großer Sprachmodelle.
Artikel lesenGPU vs Apple Silicon: RTX 3090/4090/5090 TFLOPS vs M3/M4/M5 Max — LLM-Inferenzleistungsvergleich
Detaillierter Vergleich der Rohrechenleistung, Promptverarbeitung, Decodierungsgeschwindigkeit, Speicherkapazität, Leistungsaufnahme und Portabilität zwischen NVIDIA RTX GPUs und Apple MacBook Pro M-Serie Max Chips für lokale LLM-Inferenz.
Artikel lesenVergleich von NVIDIA DGX Spark und AMD Strix Halo für lokale KI
Ein detaillierter Vergleich des NVIDIA DGX Spark und des AMD Strix Halo (Ryzen AI Max+) mit Fokus auf Speicherbandbreite, Prefill- und Decodierleistung, Unterstützung von Matrixoperationen, Modellkompatibilität, Preis und Stromverbrauch.
Artikel lesenPrompt Processing vs. Decoding: Rechenleistung vs. Speicherbandbreite in der KI-Inferenz
Erfahren Sie, warum Prompt Processing (Prefill) von TFLOPS abhängt und Decoding von der Speicherbandbreite – und wie Sie Ihre KI-Infrastruktur entsprechend optimieren.
Artikel lesenQ-, K- und V-Vektoren in Transformer-Modellen verstehen
Eine umfassende Erklärung der Q-, K- und V-Vektoren in Transformer-Modellen, einschließlich ihrer Ableitung, des Selbstaufmerksamkeitsmechanismus, der Prompt-Verarbeitung, der Inferenz mit KV-Cache und der Multi-Head-Attention mit All-Reduce.
Artikel lesen