Към основното съдържание
🔒 Режим за преглед. Първите петнадесет урока на Foundations са безплатни; този е Pro. Стартирайте 7-дневен trial, за да отключите редактора, AI подсказките и останалата част от курса. Изисква се карта, отменете по всяко време в Dashboard.Стартирай 7-дневен trial →
← КурсовеAI Engineering with PythonМодул 3 · RAG (генериране с допълнено извличане)Стратегии за разделянеwrite36 / 105
+100 XP
Задача
📝 **Въпрос:** **Напишете функцията** \`chunk_count(total_tokens, chunk_size, overlap)\`, която връща броя на парчетата, създадени от документа с разделяне на плъзгащ се прозорец. Спецификация: всяко парче е токени \`chunk_size\`. Всяка част припокрива предишната с \`припокриващи се\` токени — така че *стъпката* (ефективни нови токени на част) е \`размер на парче - припокриване\`. Първата част започва от 0; продължават да се добавят нови парчета, докато началната позиция надхвърли \`total_tokens\`. Формула: \`\`\` стъпка = chunk_size - припокриване брой = ceil(max(0, total_tokens - припокриване) / стъпка) \`\`\` (Граничен случай: ако \`total_tokens <= chunk_size\`, това все още е 1 парче.) След това броят на частите за печат за тези три конфигурации на документ с 50 000 токена: \`\`\` 500/50: 111 800/80: 70 1500/200: 39 \`\`\` Спадът 3 пъти от 111 части на 39 части → това е компромисът на разходите за вграждане, който старшите разработчици правят изрично, преди да индексират 1 милион документа. 📋 Изберете правилния отговор. 💡 **Съвет:** Прочетете отново теорията по-горе, ако не сте сигурни.
✏️ Пиши кода тук
🐍
Зареждане на Python...
Еднократно изтегляне (~1 MB). После работи мигновено.
📊 Резултат
Натисни Изпълни, за да видиш резултата...

💬 Дискусия

Бъди първи — задай въпрос или сподели съвет.
Влез за да се присъединиш към дискусията. Четенето е безплатно.
Зареждане на дискусията…