400bc को क्रलर
तपाईं सायद आफ्नो सर्भरको लगमा एउटा नाम देखेर यहाँ आउनुभयो। त्यो क्रलरले के गर्छ, कति बिस्तारै गर्छ, र कसरी रोक्ने — सबै यहाँ छ।
यसले पठाउने नाम
हरेक अनुरोधमा ठ्याक्कै यही User-Agent जान्छ:
400bc/0.1 (+https://400bc.com/ne/crawler)robots.txt
हरेक होस्टको robots.txt पहिले पढिन्छ र पालना गरिन्छ। त्यो ६ घण्टासम्म सम्झिइन्छ, त्यसपछि फेरि पढिन्छ — त्यसैले तपाईंले गरेको परिवर्तन बढीमा ६ घण्टाभित्र लागू हुन्छ।
बिस्तारै क्रल
एउटै होस्टमा दुई अनुरोधबीच कम्तीमा २ सेकेन्डको अन्तर राखिन्छ, र एक पटकमा एउटै होस्टबाट एउटा मात्र ठेगाना लिइन्छ। robots.txt मा Crawl-delay लेखिएको छ भने त्यो मानिन्छ, तर बढीमा ३० सेकेन्डसम्म — त्योभन्दा ढिलो माग्ने होस्ट क्रल नगर्नु नै उचित ठानिन्छ।
के पढिन्छ
क्रल सूचीमा हातले थपिएका होस्ट मात्र क्रल गरिन्छन् — यसले आफैँ नयाँ साइट खोज्दैन। HTML र सादा पाठ मात्र पढिन्छ, र ठूला फाइल बीचमै छाडिन्छन्। पृष्ठको पाठ मात्र राखिन्छ; कच्चा HTML राखिँदैन।
कसरी रोक्ने
आफ्नो robots.txt मा यति लेखे पुग्छ:
User-agent: 400bc
Disallow: /सम्पर्क
रोक्न नमिलेमा, धेरै छिटो क्रल भएजस्तो लागेमा, वा केही सोध्नुपरेमा [email protected] मा लेख्नुहोस्। पढ्ने मान्छे Binod Tamang हुनुहुन्छ।