400bc को क्रलर

तपाईं सायद आफ्नो सर्भरको लगमा एउटा नाम देखेर यहाँ आउनुभयो। त्यो क्रलरले के गर्छ, कति बिस्तारै गर्छ, र कसरी रोक्ने — सबै यहाँ छ।

यसले पठाउने नाम

हरेक अनुरोधमा ठ्याक्कै यही User-Agent जान्छ:

400bc/0.1 (+https://400bc.com/ne/crawler)

robots.txt

हरेक होस्टको robots.txt पहिले पढिन्छ र पालना गरिन्छ। त्यो ६ घण्टासम्म सम्झिइन्छ, त्यसपछि फेरि पढिन्छ — त्यसैले तपाईंले गरेको परिवर्तन बढीमा ६ घण्टाभित्र लागू हुन्छ।

बिस्तारै क्रल

एउटै होस्टमा दुई अनुरोधबीच कम्तीमा २ सेकेन्डको अन्तर राखिन्छ, र एक पटकमा एउटै होस्टबाट एउटा मात्र ठेगाना लिइन्छ। robots.txt मा Crawl-delay लेखिएको छ भने त्यो मानिन्छ, तर बढीमा ३० सेकेन्डसम्म — त्योभन्दा ढिलो माग्ने होस्ट क्रल नगर्नु नै उचित ठानिन्छ।

के पढिन्छ

क्रल सूचीमा हातले थपिएका होस्ट मात्र क्रल गरिन्छन् — यसले आफैँ नयाँ साइट खोज्दैन। HTML र सादा पाठ मात्र पढिन्छ, र ठूला फाइल बीचमै छाडिन्छन्। पृष्ठको पाठ मात्र राखिन्छ; कच्चा HTML राखिँदैन।

कसरी रोक्ने

आफ्नो robots.txt मा यति लेखे पुग्छ:

User-agent: 400bc
Disallow: /

सम्पर्क

रोक्न नमिलेमा, धेरै छिटो क्रल भएजस्तो लागेमा, वा केही सोध्नुपरेमा [email protected] मा लेख्नुहोस्। पढ्ने मान्छे Binod Tamang हुनुहुन्छ।