Sarcină
📝 **Întrebare:** **Scrieți funcția** \`chunk_count(total_tokens, chunk_size, overlap)\` care returnează numărul de bucăți pe care le produce un document cu sliding-window chunking.
Specific: fiecare bucată este jetoane \`chunk_size\`. Fiecare bucată se suprapune pe cea anterioară prin jetoane \`overlap\` — deci *pasul* (jetoane noi efective pe bucată) este \`chunk_size - overlap\`. Prima bucată începe la 0; noi bucăți continuă să fie adăugate până când poziția de început depășește \`total_tokens\`.
Formula:
\`\`\`
pas = chunk_size - suprapunere
count = ceil(max(0, total_tokens - overlap) / step)
\`\`\`
(Cazul limită: dacă \`total_tokens <= chunk_size\`, aceasta este totuși 1 bucată.)
Apoi tipăriți numărul de bucăți pentru aceste trei configurații ale unui document cu 50.000 de jetoane:
\`\`\`
500/50: 111
800/80: 70
1500/200: 39
\`\`\`
Scăderea de 3 ori de la 111 bucăți la 39 de bucăți → acesta este compromisul de cost de încorporare pe care dezvoltatorii seniori îl explică înainte de a indexa 1 milion de documente.
📋 Alegeți răspunsul potrivit.
💡 **Sugestie:** Recitiți teoria de mai sus dacă nu sunteți sigur.