Hashing ist ein Verfahren, bei dem mit Hilfe eines Algorithmus wie MD5, SHA-1 oder SHA-2 eine einmalige Kennung - ein „Hash“ - für eine Datei auf der Grundlage ihrer Daten erstellt wird. Zwei identische Dateien haben immer denselben Hash. Ebenso werden zwei unterschiedliche Dateien immer unterschiedliche Hashes haben, selbst wenn der Unterschied zwischen den beiden Dateien minimal ist. Die Hashes von Dateien, die gegen urheberrechtlich geschütztes Material verstoßen, können zu „schwarzen Listen“ hinzugefügt werden, die von Cloud-Speicherdiensten verwendet werden können, um nicht autorisierte Dateien zu ermitteln, zu sperren und zu löschen.
Der Zweck des Hashings ist es, verschiedene Kopien derselben digitalen Datei zu identifizieren. Zunächst wird der digitalen Datei mit Hilfe eines Algorithmus eine einmalige Zeichenfolge, ein so genannter "Hash", zugeordnet, der in einer Hash-Datenbank gespeichert wird. Eine zweite digitale Datei wird dann demselben Hashing-Prozess unterzogen, und der resultierende Hash wird mit dem bereits in der Hash-Datenbank gespeicherten verglichen, um festzustellen, ob die Dateien genau übereinstimmen.
Hashing wird in erster Linie zur Indexierung von Inhalten, zur Sicherung von Passwörtern, zum Aufspüren schädlicher Dateien wie Viren oder zum Sperren illegaler Dateninhalte wie der Förderung terroristischer Handlungen oder der Ausbeutung von Minderjährigen eingesetzt. Im Hinblick auf urheberrechtlich geschütztes Material dienen Hashes dazu, digitale Inhalte zu identifizieren, zu vergleichen und das Hochladen von Inhalten zu verhindern, die aufgrund von Urheberrechtsverletzungen bereits vom Netz genommen wurden.
Es ist kompliziert, spezifische Implementierungsanforderungen für das Hashing zu erstellen, da verschiedene Hashing-Techniken und -Algorithmen verwendet werden können, die alle unterschiedliche Rechenleistungen erfordern. Die meisten Hashing-Methoden sind kryptografisch (bei denen zwei verschiedene Dateien, obwohl sie sich sehr ähnlich sind, völlig unterschiedliche Hashes haben), aber es gibt auch wahrnehmungsbasierte Hashing-Methoden (bei denen zwei fast identische Dateien, z. B. ähnliche Bilder, ähnliche Hashes haben). Der Vorteil des Hashings ist, dass es auf bereits vorhandene Inhalte angewendet werden kann. Hashes können von allen Beteiligten genutzt und geteilt werden, indem sie das gleiche Hashing-Verfahren und die gleiche Hash-Datenbank verwenden. Der Nachteil ist jedoch, dass Hashing nur die gleiche identische Datei erkennt, nicht aber deren Inhalt.
Hashing erfordert nur geringe Investitionen, da Open-Source-Lösungen verfügbar sind. Da Hashing-Datenbanken außerdem nur eine Zeichenfolge und nicht die gesamte Datei speichern, benötigen sie weniger Rechen- und Speicherressourcen.