Aufgabe
📝 **Frage:** **Schreiben Sie die Funktion** \`chunk_count(total_tokens, chunk_size, Overlap)\`, die die Anzahl der Blöcke zurückgibt, die ein Dokument mit Sliding-Window-Chunking erzeugt.
Spezifikation: Jeder Block besteht aus „Chunk_size“-Token. Jeder Chunk überlappt den vorherigen um \`Overlap\`-Tokens – der *Schritt* (effektive neue Tokens pro Chunk) ist also \`chunk_size - Overlap\`. Der erste Block beginnt bei 0; Es werden so lange neue Blöcke hinzugefügt, bis die Startposition \`total_tokens\` überschreitet.
Formel:
\`\`\`
step = chunk_size – Überlappung
count = ceil(max(0, total_tokens – Überlappung) / Schritt)
\`\`\`
(Randfall: Wenn \`total_tokens <= chunk_size\`, ist das immer noch 1 Chunk.)
Dann zählt der Druckblock für diese drei Konfigurationen eines Dokuments mit 50.000 Token:
\`\`\`
500/50: 111
800/80: 70
1500/200: 39
\`\`\`
Der 3-fache Rückgang von 111 Blöcken auf 39 Blöcke → das ist der Kompromiss bei den Einbettungskosten, den erfahrene Entwickler vor der Indizierung von 1 Million Dokumenten explizit machen.
📋 Wählen Sie die richtige Antwort.
💡 **Hinweis:** Lesen Sie die obige Theorie noch einmal, wenn Sie sich nicht sicher sind.