Zum Hauptinhalt springen
🔒 Vorschaumodus. Die ersten fünfzehn Foundations-Lektionen sind kostenlos; diese hier ist Pro. Starte einen 7-Tage-Trial, um den Editor, AI-Hinweise und den Rest des Lehrplans freizuschalten. Karte erforderlich, jederzeit im Dashboard kündbar.7-Tage-Trial starten →
← KurseAI Engineering with PythonModul 3 · RAG (Retrieval-Augmented Generation)Chunking-Strategienwrite36 / 105
+100 XP
Aufgabe
📝 **Frage:** **Schreiben Sie die Funktion** \`chunk_count(total_tokens, chunk_size, Overlap)\`, die die Anzahl der Blöcke zurückgibt, die ein Dokument mit Sliding-Window-Chunking erzeugt. Spezifikation: Jeder Block besteht aus „Chunk_size“-Token. Jeder Chunk überlappt den vorherigen um \`Overlap\`-Tokens – der *Schritt* (effektive neue Tokens pro Chunk) ist also \`chunk_size - Overlap\`. Der erste Block beginnt bei 0; Es werden so lange neue Blöcke hinzugefügt, bis die Startposition \`total_tokens\` überschreitet. Formel: \`\`\` step = chunk_size – Überlappung count = ceil(max(0, total_tokens – Überlappung) / Schritt) \`\`\` (Randfall: Wenn \`total_tokens <= chunk_size\`, ist das immer noch 1 Chunk.) Dann zählt der Druckblock für diese drei Konfigurationen eines Dokuments mit 50.000 Token: \`\`\` 500/50: 111 800/80: 70 1500/200: 39 \`\`\` Der 3-fache Rückgang von 111 Blöcken auf 39 Blöcke → das ist der Kompromiss bei den Einbettungskosten, den erfahrene Entwickler vor der Indizierung von 1 Million Dokumenten explizit machen. 📋 Wählen Sie die richtige Antwort. 💡 **Hinweis:** Lesen Sie die obige Theorie noch einmal, wenn Sie sich nicht sicher sind.
✏️ Schreibe deinen Code hier
🐍
Python wird geladen...
Einmaliger Download (~1 MB). Danach läuft alles sofort.
📊 Ergebnis
Klicke auf Ausführen, um das Ergebnis zu sehen...

💬 Diskussion

Sei der erste — stelle eine Frage oder teile einen Tipp.
Anmelden um an der Diskussion teilzunehmen. Lesen ist kostenlos.
Diskussion wird geladen…