Feladat
📝 **Kérdés:** **Írja be azt a** \`chunk_count(total_tokens, chunk_size, overlap)\` függvényt, amely visszaadja a dokumentum által előállított darabok számát csúszóablak-darabolással.
Specifikáció: minden darab \`chunk_size\` token. Minden darab \`overlap\` tokenekkel fedi át az előzőt – tehát a *step* (az új tokenek darabonkénti érvényessége) \`chunk_size - overlap\`. Az első darab 0-val kezdődik; Az új darabok mindaddig adódnak hozzá, amíg a kezdőpozíció meg nem haladja a \`total_tokens\` értéket.
Képlet:
\`\`\`
lépés = chunk_size - átfedés
count = ceil(max(0, total_tokens - átfedés) / lépés)
\`\`\`
(Kis- és nagybetű: ha \`total_tokens <= chunk_size\`, akkor ez még mindig 1 darab.)
Ezután a nyomtatási darabszámok egy 50 000 tokenből álló dokumentum három konfigurációjához tartoznak:
\`\`\`
500/50: 111
800/80: 70
1500/200: 39
\`\`\`
A 3-szoros csökkenés 111 darabról 39 darabra → ez a beágyazási költségek kompromisszuma, amelyet a vezető fejlesztők egyértelművé tesznek 1 millió dokumentum indexelése előtt.
📋 Válassza ki a megfelelő választ.
💡 **Tipp:** Ha nem biztos benne, olvassa el újra a fenti elméletet.