Ugrás a fő tartalomra
🔒 Előnézet mód. Az első tizenöt Foundations lecke ingyenes; ez Pro. Indíts 7 napos trial-t, hogy feloldd a szerkesztőt, az AI tippeket és a tananyag többi részét. Kártya szükséges, bármikor lemondhatod a Dashboard-ban.7 napos trial indítása →
← KurzusokAI Engineering with Python3. modul · RAG (Retrieval-Augmented Generation)Darabolási stratégiákwrite36 / 105
+100 XP
Feladat
📝 **Kérdés:** **Írja be azt a** \`chunk_count(total_tokens, chunk_size, overlap)\` függvényt, amely visszaadja a dokumentum által előállított darabok számát csúszóablak-darabolással. Specifikáció: minden darab \`chunk_size\` token. Minden darab \`overlap\` tokenekkel fedi át az előzőt – tehát a *step* (az új tokenek darabonkénti érvényessége) \`chunk_size - overlap\`. Az első darab 0-val kezdődik; Az új darabok mindaddig adódnak hozzá, amíg a kezdőpozíció meg nem haladja a \`total_tokens\` értéket. Képlet: \`\`\` lépés = chunk_size - átfedés count = ceil(max(0, total_tokens - átfedés) / lépés) \`\`\` (Kis- és nagybetű: ha \`total_tokens <= chunk_size\`, akkor ez még mindig 1 darab.) Ezután a nyomtatási darabszámok egy 50 000 tokenből álló dokumentum három konfigurációjához tartoznak: \`\`\` 500/50: 111 800/80: 70 1500/200: 39 \`\`\` A 3-szoros csökkenés 111 darabról 39 darabra → ez a beágyazási költségek kompromisszuma, amelyet a vezető fejlesztők egyértelművé tesznek 1 millió dokumentum indexelése előtt. 📋 Válassza ki a megfelelő választ. 💡 **Tipp:** Ha nem biztos benne, olvassa el újra a fenti elméletet.
✏️ Írd ide a kódodat
🐍
Python betöltése...
Egyszeri letöltés (~1 MB). Utána azonnal fut.
📊 Eredmény
Kattints a Futtatásra az eredmény megtekintéséhez...

💬 Beszélgetés

Légy az első — tegyél fel kérdést vagy oszd meg egy tippet.
Jelentkezz be hogy csatlakozz a beszélgetéshez. Az olvasás ingyenes.
Beszélgetés betöltése…