Dedicato agli admin: una trappola per scraper LLM

Dedicato agli admin: una trappola per scraper LLM

Genera pagine web infinite alimentando gli scraper di merda nonsense.

Avveleniamo i pozzi, ma selettivamente!

@informatica

https://hackaday.com/2025/01/23/trap-naughty-web-crawlers-in-digestive-juices-with-nepenthes/

6 points · 3 comments · view on lemmy.world

3 Comments

paoloredaelli@mastodon.uno · 2 pts · 1y (3 replies)

@lgsp
Ma la domanda è: come distinguere il "legittimo" crawler di un motore di ricerca da quello di una LLM? Dubito facciano la cortesia di usare un loro User Agent…
@informatica

pgo@mastodon.uno · 2 pts · 1y
[ removed ]
lgsp@urbanists.social · 1 pts · 1y (1 reply)

@paoloredaelli

Basandosi sul comportamento: se i crawler seguono quanto indicato da robots.txt, non cercando di accedere in parti del sito non consentite, non finiscono nella trappola infinita, altrimenti sì.

EDIT: mi sbagliavo un warning avvisa proprio che non c'è modo di distiguere buoni da cattivi

@informatica

https://zadzmo.org/code/nepenthes/

paoloredaelli@mastodon.uno · 1 pts · 1y

@lgsp
Mi fatto stanno "avvelenando i pozzi".
@informatica