Dårlig data, feil og helt normalt å se på
Dit driftsdata ender opp
Noe data er verken mørkt eller i silo, det er rett og slett feil. En fastfrossen sensor som melder samme verdi i en uke, en gjennomstrømning i feil enhet, et hull fylt med nuller. Det farlige er at feil verdier ligger i de samme tabellene som riktige, i samme skrifttype.
Hva det betyr
Formene dårlig data tar
Dårlig data er sjelden dramatisk. Det er en sensor som driver ut av kalibrering med en halv prosent i måneden, et tidsstempel i lokal tid i en UTC-tabell, et utstyr omdøpt på den ene siden av et grensesnitt, en manuell føring med et forskjøvet siffer.
Alt dette ser ut som data. Alt aggregeres, plottes og midles uten protest. Ingenting ved et gjennomsnitt forteller deg at en av kildene sto bom stille i ni dager.
- Fastfrosne og drivende sensorer fortsetter å melde plausible tall.
- Enhets- og tidssonerot overlever hver aggregering som gjøres på det.
- Hull, nuller og duplikater endrer gjennomsnitt ingen sjekker på nytt.
- Manuelle føringer bærer tastefeil inn i systemer som stoler på dem for alltid.
Hva det koster
Hva ett feil tall gjør nedstrøms
Dårlig data blir ikke der det ble født. Det flyter inn i nøkkeltall, rapporter og modeller, og alt som beregnes av det, arver feilen uten å arve tvilen.
Rapporter krangler med hverandre
To dashbord er uenige, og et møte som skulle besluttet noe, bruker timen sin på å avgjøre hvem sitt tall som er riktig i stedet. Tillit brukt der kommer ikke gratis tilbake.
Modeller lærer seg feilen
En prognosemodell trent på en fastfrossen sensor lærer at stillstand er normalt. Dårlig data villeder ikke bare mennesker, det trener i det stille hver modell nedstrøms.
Rettelsen kommer for sent
Feil som oppdages ved rapportering, oppdages uker etter at de begynte. Da er den dårlige perioden vevd inn i totalene, og å nøste den opp koster mer enn det ville kostet å fange den.
Vår tilnærming
Stopp dårlig data, før det infiserer rapportene dine
Dårlig data er billigst å fange ved innlesning, mens konteksten som forklarer det fortsatt finnes. Det betyr at kvalitet må være en egenskap ved røret, ikke en kvartalsvis revisjon.
Flagg på hver verdi
Fastfrosset, utenfor område, drift og hull kan oppdages mekanisk. Flagg dem når dataene kommer inn, så kan hver leser nedstrøms, menneske eller modell, avgjøre hva den stoler på.
Sporbarhet som bærer tvilen
Når et nøkkeltall kan vise hvilke råsignaler som ga det, forklarer et mistenkelig tall seg selv på minutter. Kvalitetsflagg som følger sporbarheten, gjør tvil billig å avklare.
Enheter og tid som fakta av første klasse
En verdi uten enhet og entydig tidsstempel er en gjetning. Å lagre begge som fakta plattformen håndhever, fjerner de to vanligste måtene tall blir stille feil på.
Vanlige spørsmål
Spurt og besvart
Hva er dårlig data?
Dårlig data er registrert data som gir et feil bilde av virkeligheten: fastfrosne eller drivende sensorer, feil enheter, tidssonefeil, hull, duplikater og tastefeil. Det er farlig fordi det ser nøyaktig ut som god data og aggregeres uten protest.
Hva koster dårlig data en drift?
Studier har funnet at bare en liten andel av bedrifters data møter grunnleggende kvalitetskrav, og driftskostnaden viser seg som rapporter som er uenige, modeller trent på feil, og møter brukt på å krangle om hvem sitt tall som stemmer i stedet for å beslutte.
Hvordan oppdager man dårlig data tidlig?
Oppdag det ved innlesning, mens konteksten fortsatt finnes: automatiske flagg for fastfrosne, drivende og utenfor område-signaler, håndhevede enheter og tidsstempler, og sporbarhet slik at ethvert tall nedstrøms kan vise hvilke kilder det stolte på.
Resten av fordelingen
Dit de andre datapunktene går
Avløpet har fem utløp, og hvert av dem svikter driften på sin egen måte. Denne siden dekker ett av dem. De fire andre er verdt ti minutter hver.