Wie weet nog wat er in de kelder ligt?

 English version: scroll down

De digitale tijdbom II

In mijn vorige blogDe digitale tijdbom van vergeten data’ schreef ik over bestanden die allang niet meer actief worden gebruikt, maar die ergens blijven bestaan. Op oude netwerkschijven, in backups, in legacy-systemen, op vergeten fileservers of als kopie van een kopie in een map waarvan niemand meer weet waarom die ooit is aangemaakt. Dat klinkt misschien als een theoretisch risico. Dat is het niet meer.

Afgelopen jaren waren diverse voorbeelden waarbij organisaties werden geconfronteerd met gevoelige informatie waarvan ze zelf niet meer wisten dat die nog bestond. Soms kwam die informatie boven bij een hack. Soms werd een oude database door een derde gevonden. En soms ontdekte de organisatie zelf pas veel later dat er een enorme hoeveelheid historische informatie ergens was blijven liggen. De interessante vraag is daarom niet alleen meer: hoe beveiligen we onze data? De eerste vraag zou moeten zijn: ‘Weten we eigenlijk wel welke data we nog hebben?’

Een vergeten database bij de migratie

Een van de meest sprekende voorbeelden is Eatigo, een platform voor restaurant-reserveringen. In 2018 migreerde het bedrijf naar een nieuw platform. Daarbij werd een oude database nog tijdelijk bewaard om de migratie te ondersteunen. Daarna was die database niet meer bedoeld voor gebruik. Maar hij werd ook niet verwijderd. En erger: na de migratie wist de nieuwe technische organisatie niet meer van het bestaan van de database. 

In 2020 bleek dat juist deze oude database toegankelijk vanaf internet en werd informatie over ongeveer 2,8 miljoen gebruikers op een online forum te koop aangeboden. Het ging onder meer om namen, e-mailadressen, telefoonnummers, wachtwoordgegevens en gegevens waarmee accounts konden worden gekoppeld. De Singaporese privacy-toezichthouder legde een boete op. Dit zijn precies de incidenten die ik bedoel. Er was geen ingewikkelde aanval nodig op het nieuwe platform. Het probleem zat in iets dat eigenlijk al had moeten worden opgeruimd: een oude database die na een migratie was achtergebleven. De data was oud. Maar het risico bleek springlevend.

Een vergeten oude back-up

Ook Reddit ontdekte in 2018 dat oude data een onverwacht lange levensduur kan hebben. Aanvallers kregen toegang tot een database-backup uit 2007. Die bevatte gegevens uit de eerste jaren van Reddit, waaronder gebruikersnamen, e-mailadressen, wachtwoord-hashes en oude inhoud, inclusief privéberichten. Voor Reddit was die informatie inmiddels meer dan tien jaar oud en niet meer relevant Voor de aanvaller was dat nog steeds interessante informatie. 

Dat is een belangrijk onderscheid. Vanuit een organisatie bekeken, kan informatie verouderd zijn omdat het bedrijfsproces waarvoor zij ooit werd gebruikt niet meer bestaat. Maar dat betekent niet dat de informatie haar waarde heeft verloren. Een oude klantenlijst kan nog steeds persoonsgegevens bevatten. Een oude e-mail kan een besluit of toezegging aantonen. Een oud contract kan juridische betekenis hebben. Een oude database kan wachtwoordgegevens bevatten. En een oude interne presentatie kan informatie bevatten die een organisatie liever niet opnieuw op straat ziet liggen. Oud betekent niet ongevaarlijk.

Vier terabyte aan vergeten data

Het wordt nog interessanter wanneer een derde de data vindt voordat de organisatie zelf weet dat er iets mis is. In 2026 werd een publiek toegankelijke SQL Server-backup van ongeveer vier terabyte ontdekt, die aan EY bleek gekoppeld. Onderzoekers vonden de backup tijdens netwerkonderzoek; dit werd vervolgens verantwoord gemeld en EY kon maatregelen nemen. 

Vier terabyte. Dat is geen vergeten Word-document op een bureaublad. Dat is een enorme hoeveelheid informatie die ergens staat en blijkbaar toegankelijk is zonder dat de eigenaar dat zo bedoeld heeft. En precies daar verandert het karakter van het probleem. Een organisatie hoeft niet te worden aangevallen om een informatieprobleem te hebben. Iemand hoeft de informatie alleen maar te vinden.

De vergeten datakluis bij de belasting

Nog een voorbeeld dat misschien nog ongemakkelijker is. De Belastingdienst ontdekte in 2026 dat een afgesloten bewaaromgeving, de zogenoemde datakluis, jarenlang buiten beeld was gebleven. In 2019 waren daar ten minste 64 miljoen ongesorteerde bestanden in geplaatst. De omgeving was ingericht als onderdeel van de verplichtingen rond onder meer AVG en archiefwetgeving. Het bijzondere is dat dit geen klassieke cyberaanval was. Niemand hoefde de beveiliging te kraken. De informatie was er gewoon. Maar omdat de omgeving buiten beeld was geraakt, werd de inhoud jarenlang niet meegenomen bij belangrijke informatieverzoeken en parlementaire onderzoeken. 

De bestanden worden inmiddels alsnog beoordeeld. Dat maakt deze zaak voor mij juist zo relevant. Want informatie kan verloren raken zonder dat er ook maar één bit verloren gaat. Ik vergelijk het wel eens met een huis. Stel dat een organisatie twintig jaar lang een kelder gebruikt. Elke afdeling zet er dozen neer. Sommige voorzien van keurige labels. Andere hebben alleen een datum. Ook dozen van medewerkers die al jaren vertrokken zijn. Er ‘verhuisdozen’ die bij een reorganisatie zijn blijven staan. En achterin staan dozen waarvan niemand zelfs meer weet wie ze daar heeft neergezet. 

Wat staat er eigenlijk in de kelder?

Op een dag vraagt iemand: “Wat hebben we eigenlijk allemaal in die kelder?” Het antwoord is verrassend vaak: “Dat weten we niet precies.” Digitaal is dat probleem alleen veel groter. Een organisatie heeft niet één kelder, maar tientallen. Netwerkschijven. SharePoint. Mailarchieven. Oude fileservers. Backups. Cloudopslag. Applicatiedatabases. Testomgevingen. Migratiekopieën. Persoonlijke opslag. Exports naar Excel. Oude systemen die officieel zijn uitgefaseerd. En vervolgens zijn er vaak nog kopieën van die kopieën. En daar weer back-ups van. De organisatie denkt dat zij één dossier heeft. De werkelijkheid kan zijn dat hetzelfde document op vijf, tien of twintig plaatsen voorkomt.

Tot voor kort was de enorme omvang van die informatie nog enigszins een bescherming. Wie vier terabyte aan documenten vindt, heeft immers nog geen idee wat erin staat. Maar dat verandert. AI maakt het steeds eenvoudiger om grote hoeveelheden ‘black data’ te doorzoeken, patronen te herkennen en verbanden te leggen. Het verschil tussen “Ik heb vier miljoen bestanden gevonden” en “Ik heb 3.200 documenten gevonden waarin dit onderwerp wordt besproken, 417 documenten met persoonsgegevens en 28 documenten die mogelijk vertrouwelijke informatie bevatten” wordt steeds kleiner. 

Een groeiend, onzichtbaar risico

Dat is voor organisaties een enorme kans, maar ook een fiks risico. Want dezelfde techniek die een organisatie kan helpen om haar vergeten informatie eindelijk te vinden, kan ook een aanvaller helpen om sneller waardevolle informatie uit een enorme dataset te halen. Daarmee verandert de vraag van cybersecurity opnieuw. Niet alleen: kan iemand bij mijn data? Maar ook: als iemand erbij kan, hoe snel kan diegene begrijpen wat hij aan uniek materiaal heeft gevonden?

Daarom begint het probleem van vergeten data wat mij betreft niet met vernietigen. Het begint met kijken. Wat staat er werkelijk? Welke bestanden zijn er? Welke documenten horen bij elkaar? Welke kopieën bestaan er? Waar zitten persoonsgegevens? Welke informatie is gevoelig? Welke dossiers zijn versnipperd? Welke bestanden hebben archiefwaarde? Welke informatie mag worden vernietigd? En misschien wel de belangrijkste vraag: welke verrassingen liggen er nog tussen onze miljoenen bestanden? Dat is precies het soort vraag waarvoor we Archon hebben ontwikkeld.

Een datastofzuiger voor zwarte data

Archon is geen nieuw systeem maar een gereedschap voor informatieprofessionals. Je kunt het zien als een digitale stofzuiger voor grijze en zwarte data. Archon kan – geïnstalleerd op een eigen server – snel grote hoeveelheden bestaande informatie onderzoeken: oude netwerkschijven, fileservers, SharePoint-omgevingen, historische opslag en andere plaatsen waar in de loop der jaren informatie is achtergebleven. Het maakt documenten waar nodig leesbaar, bijvoorbeeld met OCR, en analyseert vervolgens inhoud, documenttypen, relaties, versies, dossiers en context. 

Daarmee kan zichtbaar worden wat er werkelijk in zo’n vergeten informatieberg zit. Niet alleen wat een bestand heet, maar ook wat het betekent. Waar staan persoonsgegevens? Welke documenten zijn dubbel? Welke documenten vormen samen één dossier? Welke informatie is gevoelig? Welke metadata ontbreken? Welke documenten horen ergens anders thuis? En welke informatie komt mogelijk in aanmerking voor archivering, vernietiging of nader onderzoek? Archon ondersteunt daarbij de professional. Het systeem analyseert, ordent, classificeert en adviseert; de informatieprofessional blijft degene die beoordeelt en beslist. En helpt zelfs bij het zwartlakken bij WOO-verzoeken.

Archon een gereedschap voor tijdelijk als permanent gebruik

Archon is geen nieuwe digitale kelder waarin alle informatie voortaan permanent moet worden opgeslagen. Het kan tijdelijk worden ingezet voor een grote opschoningsactie. Periodiek om de kwaliteit van informatie te controleren. Of structureel wanneer een organisatie voortdurend zicht wil houden op haar informatiehuishouding. Na afloop kan het weer worden uitgeschakeld zonder dat bestaande systemen hoeven te worden aangepast. De gedachte daarachter is eenvoudig: Archon onderzoekt de informatie, maar wordt niet de nieuwe eigenaar ervan. 

De organisatie houdt haar eigen systemen en haar eigen informatiearchitectuur. Archon helpt de informatieprofessional om te zien wat daar werkelijk aanwezig is. En juist dat kan het verschil maken tussen denken dat je je informatie beheerst en het daadwerkelijk kunnen aantonen. De digitale tijdbom waarover ik in mijn vorige blog schreef, is geen theoretisch gevaar. Soms ligt de informatie in een oude database. Soms in een backup. Soms op een vergeten netwerkschijf. Soms in een migratieomgeving die niemand meer beheert. En soms blijkt een organisatie miljoenen bestanden te bezitten waarvan zij niet meer precies weet wat erin staat. 

Het gevaarlijkste is misschien niet eens dat die informatie bestaat. Het gevaarlijkste is dat de eigenaar niet meer weet dat zij bestaat, terwijl een ander haar wel kan vinden. Daarom begint informatiebeveiliging soms op een onverwachte plek. Niet met een firewall. Niet met een wachtwoord. Niet met een nieuw informatiesysteem. Maar met een simpele vraag: “Wat staat er eigenlijk nog bij ons?” Want voordat je een digitale tijdbom kunt ontmantelen, moet je eerst weten waar hij ligt.

Photo by Jack Krzysik

——————————  Translated by ChatGPT —————————

Who Knows What’s Still Sitting in the Basement?

The Digital Time Bomb II

In my previous blog, The Digital Time Bomb of Forgotten Data, I wrote about information that is no longer actively used but continues to exist somewhere in an organisation. Old network drives. Backups. Legacy systems. Forgotten file servers. Migration copies. And copies of copies in folders nobody remembers creating. It may sound harmless. It isn’t.

Forgotten data keeps resurfacing

Over the past few years, organisations have repeatedly discovered sensitive information they no longer knew they had. Sometimes it surfaced during a cyberattack. Sometimes an old database was discovered by someone outside the organisation. And sometimes the organisation itself only realised years later how much historical information was still sitting somewhere. So perhaps the first question is no longer: How do we protect our data? It should be: Do we actually know what data we still have?

The database nobody remembered

Consider Eatigo, a restaurant reservation platform. During a platform migration in 2018, an old database was kept temporarily to support the transition. It was no longer intended for operational use, but it wasn’t deleted either. More importantly, the new technical organisation was no longer aware that the database existed. In 2020, the old database was found to be accessible from the internet. Information relating to around 2.8 million users was offered for sale online, including names, email addresses, phone numbers and password-related information.

The lesson is simple. There was no sophisticated attack on the new platform. The problem was an old database that had survived the migration. The data was old. The risk wasn’t. When an old backup becomes valuable again Reddit encountered a similar problem in 2018. Attackers gained access to a database backup from 2007. It contained information from Reddit’s early years, including usernames, email addresses, password hashes and old content, including private messages. From Reddit’s perspective, much of this information was more than a decade old. For an attacker, it was still interesting. That distinction matters.

Four terabyte of ‘forgotten data’

Information may be obsolete because the business process that created it has disappeared. But that does not mean the information itself has lost its value. An old customer list can still contain personal data. An old email can document a decision. An old contract can have legal significance. An old database can contain credentials. An old presentation can contain information an organisation would rather not see published again. Old does not mean harmless. Four terabytes hiding in plain sight.

The problem becomes even more interesting when someone else discovers the information before the organisation does. In 2026, researchers found a publicly accessible SQL Server backup of around four terabytes that appeared to be associated with EY. The backup was discovered during network research and subsequently reported responsibly, allowing EY to take action. Four terabytes is not a forgotten document on someone’s desktop. It is an enormous amount of information sitting somewhere, apparently accessible without the owner intending it to be. And that changes the nature of the problem. An organisation doesn’t necessarily need to be attacked to have an information security problem. Someone may only need to find the data.

The forgotten data vault

Another example is the Dutch Tax Administration. In 2026, it became known that a closed storage environment — referred to as a data vault — had remained outside the organisation’s operational view for years. At least 64 million unsorted files had been placed there in 2019. The environment had been created in the context of privacy and archival obligations. What makes this case particularly striking is that there was no classic cyberattack. Nobody had to break through the security perimeter.

The information was simply there. Because the environment had effectively disappeared from view, its contents were not properly considered in important information requests and parliamentary investigations for years. The files are now being reviewed. For me, this illustrates an important point: Information can be lost without a single bit being lost.

What is actually in the basement?

I often compare this with a house. Imagine an organisation that has used the same basement for twenty years. Every department has put boxes down there. Some are neatly labelled. Others have nothing more than a date. There are boxes belonging to employees who left years ago. Boxes from reorganisations. Old project files. And, somewhere at the back, boxes nobody remembers putting there.

Then one day someone asks: “What do we actually have in the basement?” The answer is often: “We don’t really know.” Digitally, the problem is much bigger. An organisation doesn’t have one basement. It has dozens: network drives, SharePoint, email archives, file servers, backups, cloud storage, databases, test environments, migration copies, personal storage, Excel exports, legacy systems. And then there are copies of copies — and backups of those copies. We may think we have one document. In reality, the same document may exist in ten different places. 

AI changes the equation

Until recently, the sheer volume of forgotten information provided a certain degree of protection. If someone discovered four terabytes of documents, they still had to figure out what was inside. AI is changing that. It is becoming increasingly easy to search huge volumes of so-called dark data, recognise patterns and connect information across documents. The difference between: “I found four million files” and: “I found 3,200 documents about this subject, 417 containing personal data and 28 containing potentially confidential information” is becoming smaller. 

That is an enormous opportunity for organisations. But it is also a significant risk. The same technology that helps an organisation understand its forgotten information can help an attacker understand it too. So the cybersecurity question is changing once again. Not just: Can someone access my data? But also: If they can, how quickly can they understand what they have found?

Start by looking

That is why I don’t think the forgotten-data problem starts with deletion. It starts with visibility. What is actually there? Which files exist? How many copies are there? Where is personal data stored? Which information is sensitive? Which documents belong together? Which files have archival value? What can be deleted?

And perhaps the most interesting question: What surprises are still hiding among our millions of files? That is exactly the kind of question we developed Archon to help answer. A digital vacuum cleaner for dark data Archon is a tool for information professionals.

Digital vacuumcleaner

You could think of it as a digital vacuum cleaner for grey and dark data. Installed on an organisation’s own server, Archon can investigate large volumes of existing information: old network drives, file servers, SharePoint environments, historical storage and other places where information has accumulated over the years. Where necessary, documents can be made searchable using technologies such as OCR. Archon can then analyse content, document types, relationships, versions, case files and context.

The goal is not simply to find files. It is to understand what they represent. Where is the personal data? Which documents are duplicates? Which documents belong to the same case? Which information is sensitive? Which metadata is missing? Which information may need to be archived, deleted or investigated further? Archon supports the professional in that process. It analyses, organises, classifies and advises. The information professional remains the person who evaluates and decides.

It can even assist with redacting information for public-record requests under Dutch Woo legislation. 

Not another digital basement

Archon is not a new digital basement where everything has to be stored permanently.

It can be used temporarily for a major clean-up. It can be deployed periodically to assess information quality. Or it can become part of an ongoing information-management process. And when the work is done, it can simply be switched off. Existing systems do not have to be replaced. That is an important part of the idea behind Archon:

It investigates the information without becoming its new owner. The organisation keeps its own systems and its own information architecture. Archon helps information professionals understand what is actually there. Before you defuse the time bomb

The digital time bomb I wrote about in my previous blog is not a theoretical problem.

Sometimes the information is in an old database. Sometimes it is in a backup. Sometimes it is sitting on a forgotten network drive. Sometimes it is hidden inside a migration environment nobody manages anymore.

And sometimes an organisation discovers that it owns millions of files without really knowing what they contain. Perhaps the biggest risk is not that the information exists. It is that the owner no longer knows it exists, while someone else may still be able to find it. That is why information security sometimes starts in an unexpected place. Not with a firewall. Not with a password. Not with a new information system. But with a simple question: “What do we actually still have?” Because before you can defuse a digital time bomb, you first need to know where it is.

#Hashtags

#DarkData #DataGovernance #InformationGovernance #CyberSecurity #DataSecurity #DataManagement #AI #InformationManagement #RecordsManagement #DataDiscovery #Archiving #Privacy #GDPR #DigitalTransformation #Archon #i-Archon