Raspršivanje je proces koji koristi algoritam (kao što su MD5, SHA-1 ili SHA-2) za stvaranje jedinstvenog identifikatora – 'hash-a' – za datoteku na temelju njezinih podataka. Dvije identične datoteke uvijek će imati isti hash. Slično tome, dvije različite datoteke uvijek će imati različite hash-ove, čak i ako je razlika između dvije datoteke minimalna. Hash-ovi datoteka za koje se utvrdi da krše autorska prava na materijal mogu se dodati na 'crne liste', koje usluge pohrane u oblaku mogu koristiti za otkrivanje, blok i uklanjanje neovlaštenih datoteka.
Svrha raspršivanja je identificiranje različitih kopija iste digitalne datoteke. Prvo se koristi algoritam za dodjeljivanje jedinstvenog niza znakova, nazvanog 'hash', digitalnoj datoteci, a taj se hash pohranjuje u bazu podataka hashiranja. Druga digitalna datoteka zatim prolazi kroz isti proces raspršivanje , a dobiveni hash uspoređuje se s onim koji je već pohranjen u bazi podataka hashiranja kako bi se utvrdilo podudaraju li se datoteke točno.
Raspršivanje se prvenstveno koristi za indeksiranje sadržaja, zaštitu lozinki, otkrivanje zlonamjernih datoteka poput virusa ili blok ilegalnog sadržaja, poput promicanja terorističkih djela ili iskorištavanja maloljetnika. Što se tiče materijala zaštićenog autorskim pravima, hashovi služe za identifikaciju, usporedbu i sprječavanje prijenosa digitalnog sadržaja koji je već uklonjen zbog kršenja autorskih prava.
Teško je odrediti specifične implementacijske zahtjeve za raspršivanje jer postoji nekoliko različitih tehnika i algoritama raspršivanje koji se mogu koristiti, a svi oni zahtijevaju različite količine računalne snage. Većina metoda raspršivanja su kriptografske (u kojima će dvije različite datoteke, iako vrlo slične, imati potpuno različite hashove), ali postoje i perceptivne metode raspršivanja (u kojima će dvije gotovo identične datoteke, na primjer slične slike, imati slične hashove). Uz to, prednost raspršivanja je što se može primijeniti na već postojeći sadržaj. Hashove mogu dijeliti i koristiti sve različite strane koristeći isti proces raspršivanja i istu bazu podataka hashiranja. Nedostatak je, međutim, što raspršivanje prepoznaje samo istu identičnu datoteku, a ne i njezin sadržaj.
Raspršivanje zahtijeva ograničena ulaganja jer su dostupna rješenja otvorenog koda. Nadalje, budući da baze podataka s hashom pohranjuju samo niz znakova, a ne cijelu datoteku, zahtijevaju manje računalnih i memorijskih resursa.