Hva er skraping?

Skraping, eller web scraping på engelsk, er en teknikk som bruker programvare for å hente ut informasjon fra nettsider automatisk. I stedet for å manuelt kopiere og lime inn data, lar skraping deg samle inn store mengder data på kort tid. For en investor kan dette være aksjekurser, valutaomregninger, nyhetsoverskrifter, regnskapstall eller sosiale medier-sentiment. Teknikken er spesielt nyttig når dataene er spredt på mange ulike kilder og du ønsker å aggregere dem i ett system.

Skraping fungerer ved at en datamaskin sender forespørsler til en nettside, akkurat som en vanlig nettleser, men i stedet for å vise siden visuelt, tolker den HTML-koden og trekker ut de ønskede dataene. Dataene kan deretter lagres i et regneark, en database eller brukes direkte i analyser.

I finansbransjen har skraping blitt stadig mer utbredt. Ifølge en rapport fra 2023 bruker 71 % av finansorganisasjoner web scraping for å samle inn eksterne data til beslutningsstøtte. Dette inkluderer alt fra hedgefond som skraper Twitter for sentiment, til private investorer som henter inn aksjekurser for å oppdatere porteføljen sin.

Forstå skraping

For å forstå skraping i en investeringskontekst, må vi først skille mellom ulike typer. Web scraping henter data fra offentlige nettsider via HTTP-forespørsler. Screen scraping derimot, innebærer at en tredjepartsapp logger inn på dine vegne og kopierer data fra skjermbildet – for eksempel når en budsjetteringsapp ber om bankens brukernavn og passord. I finans er screen scraping utbredt i forbrukertjenester, men det medfører sikkerhetsrisikoer og kan oppheve svindelbeskyttelsen.

For investorer er web scraping mest relevant. Du kan for eksempel skrape Oslo Børs' nettside for å få oppdaterte aksjekurser hvert minutt. Du kan også skrape Finansportalen for å sammenligne fondsavgifter. Noen avanserte investorer skraper også nyhetsartikler for å analysere sentiment, eller regnskapsdata fra Proff.no for å vurdere selskapers helse.

Det er viktig å forstå at skraping ikke er det samme som å bruke en API. API (Application Programming Interface) er en offisiell måte for programmer å hente data fra en tjeneste, ofte med tillatelse og strukturert data. Skraping er en uoffisiell metode som kan være mer sårbar for endringer på nettsiden. Mange nettsider forsøker å blokkere skraping, for eksempel ved å kreve innlogging eller bruke CAPTCHA.

Hvordan fungerer skraping?

Skraping skjer i flere trinn. Først identifiserer du hvilke data du vil hente og hvilken nettside som inneholder dem. Deretter skriver du et skript – ofte i Python – som sender en HTTP-forespørsel til nettsiden. Nettsiden returnerer HTML-kode. Skriptet parser HTML-en og finner de relevante elementene, for eksempel en aksjekurs i en bestemt CSS-klasse. Til slutt lagres dataene, for eksempel i en CSV-fil eller en database.

For investorer som ikke er programmerere, finnes det ferdige verktøy som Octoparse, ParseHub eller Chrome-utvidelser som Data Scraper. Disse lar deg peke og klikke på dataene du vil ha, og verktøyet genererer skriptet for deg.

En viktig del av skraping er å håndtere dynamisk innhold. Mange moderne nettsider laster data via JavaScript, noe som betyr at den opprinnelige HTML-en ikke inneholder kursene. Da må du bruke verktøy som Selenium eller Playwright som simulerer en ekte nettleser.

For å unngå å bli blokkert, bør du respektere robots.txt-filen på nettsiden, sette en forsinkelse mellom forespørsler, og identifisere deg med en User-Agent-streng. Noen nettsider krever API-nøkkel eller betaling for tilgang, noe som er en mer bærekraftig løsning.

Historisk bakgrunn

Web scraping har eksistert like lenge som World Wide Web. Allerede på 1990-tallet ble det skrevet skript for å hente data fra nettsider. I finansbransjen ble skraping tidlig brukt for å samle aksjekurser fra børsenes offentlige sider, særlig før API-er ble vanlige. På 2000-tallet vokste bruken av skraping i hedgefond og kvantitative fond som ønsket alternative datakilder.

Et kjent eksempel er da LinkedIn saksøkte et selskap for å skrape offentlige profiler. Saken gikk helt til USAs høyesterett, og i 2022 ble det slått fast at skraping av offentlig tilgjengelige data er lovlig under amerikansk lov. Dette har hatt stor betydning for finansbransjen, der skraping av offentlige data som aksjekurser og nyheter nå anses som lovlig.

I Norge har skraping også blitt vanlig, spesielt blant private investorer og fintech-selskaper. Finansportalen, Oslo Børs og Skatteetaten har alle data som kan skrapes, men de har ulike restriksjoner. Norske myndigheter har ikke hatt noen spesifikke rettssaker om skraping, men EU-retten (GDPR) påvirker hva slags personopplysninger du kan skrape.

Praktisk eksempel

La oss se på et konkret norsk eksempel. Du er en investor som ønsker å spore aksjekursene til de 10 mest omsatte aksjene på Oslo Børs hver dag. I stedet for å gå inn på nettsiden manuelt, kan du sette opp et skript som skraper data fra E24s børsside eller direkte fra Oslo Børs' offisielle side.

Skriptet kan kjøres hver morgen og lagre kursene i et regneark. Over tid kan du analysere utviklingen og se mønstre. Du kan også kombinere kursdata med nyheter skrapet fra andre kilder for å se hvordan nyheter påvirker kursene.

For eksempel: Du skraper dagens sluttkurs for Equinor, DNB, Telenor, Yara og Norsk Hydro. Etter en måned har du en tabell med 20 datapunkter per aksje. Du kan da beregne gjennomsnittlig avkastning, volatilitet og korrelasjoner.

Tabell: Eksempel på skrapede data (uke 1)

DatoEquinorDNBTelenorYaraNorsk Hydro
02.01.2024280,50195,20125,10380,4072,10
03.01.2024282,00194,80124,90382,0072,50
04.01.2024279,30196,10125,30379,8071,90
05.01.2024281,20195,60124,70381,2072,30
En slik tabell kan enkelt lages ved hjelp av et skript. Det sparer deg for timer med manuelt arbeid.

Fordeler og ulemper

Fordelene med skraping for investorer er mange. Det gir tilgang til store mengder data i sanntid, noe som er avgjørende for å ta raske beslutninger. Du kan automatisere innhenting av data fra flere kilder og dermed få et mer helhetlig bilde. Skraping kan også avdekke mønstre og korrelasjoner som ikke er åpenbare ved manuell analyse. For eksempel kan du skrape værmeldinger og se hvordan de påvirker landbruksaksjer.

Ulemper inkluderer tekniske utfordringer. Nettsider endrer seg ofte, og skriptet ditt kan slutte å fungere. Du risikerer også å bli blokkert hvis du sender for mange forespørsler. Noen nettsider har juridiske forbehold mot skraping, og selv om offentlig data er lovlig, kan brudd på brukervilkår føre til at IP-adressen din blir utestengt. I tillegg krever skraping en viss programmeringskunnskap eller bruk av tredjepartsverktøy.

En annen ulempe er datakvalitet. Skrapede data kan inneholde feil hvis nettsiden endrer layout, eller hvis du parser feil element. Det er viktig å validere dataene regelmessig.

Tabell: Fordeler og ulemper

FordelerUlemper
Automatiserer datainnsamlingKrever teknisk kompetanse
Gir sanntidsdataNettsider kan blokkere skraping
Muliggjør analyse av store datamengderJuridiske risikoer ved brudd på vilkår
Kostnadseffektivt sammenlignet med API-erDatakvalitet kan variere
Kan kombineres med andre datakilderKrever vedlikehold når nettsider endres

Vanlige misforståelser

En vanlig misforståelse er at all skraping er ulovlig. Dette stemmer ikke. Skraping av offentlig tilgjengelige data er generelt lovlig, i hvert fall i USA og EU, så lenge du ikke omgår tekniske barrierer som pålogging eller CAPTCHA. Derimot er det ulovlig å skrape data som er beskyttet av opphavsrett eller personvern, eller å bruke dataene til konkurrerende formål i strid med vilkårene.

En annen misforståelse er at skraping er det samme som hacking. Skraping bruker vanlige HTTP-forespørsler og er ikke mer inngripende enn en vanlig nettleser. Det er ikke hacking, men det kan være i en gråsone hvis du ignorerer robots.txt eller bruker mange samtidige forespørsler.

Noen tror også at skraping er forbeholdt store hedgefond og teknologieksperter. I virkeligheten finnes det mange brukervennlige verktøy som gjør skraping tilgjengelig for vanlige investorer. Du trenger ikke å være programmerer for å komme i gang.

Endelig tror mange at skraping gir deg nøyaktige data uten feil. Men som nevnt kan endringer i nettsidens layout føre til at skriptet henter feil data. Det er derfor viktig å ha kontrollmekanismer.

Oppsummering

Skraping er et kraftig verktøy for investorer som ønsker å samle inn finansdata effektivt. Det gjør det mulig å automatisere innhenting av aksjekurser, regnskapstall, nyheter og alternative data fra en rekke kilder. Teknikken er lovlig så lenge du holder deg til offentlig tilgjengelige data og respekterer nettsiders vilkår.

For norske investorer åpner skraping for muligheter til å bygge egne databaser og analyser uten å være avhengig av dyre API-er. Samtidig må du være oppmerksom på utfordringer som tekniske endringer, blokkering og datakvalitet. Start gjerne med enkle verktøy og utvid etter hvert som du blir mer erfaren.

Husk at skraping ikke er en erstatning for grundig analyse, men et supplement som kan gi deg et konkurransefortrinn. Ved å kombinere skrapede data med tradisjonell fundamental analyse kan du ta mer informerte investeringsbeslutninger.