
Hva om en større del av evalueringsarbeidet i offentlige anskaffelser kunne gjøres før tilbudene kommer inn, i stedet for etterpå?
Det er utgangspunktet for en evalueringsmetode som Posten Bring nå tar i bruk, og som også har vekket interesse hos andre større samfunnsaktører. Vi har tidligere hørt fra kategoriansvarlig Kristian von Aphelen om arbeidet med å erstatte deler av tradisjonelle fritekstbesvarelser med forhåndsdefinerte svaralternativer og automatisk poengsetting (banebrytende endring). I denne oppfølgingsartikkelen går han nærmere inn på hvorfor dette kan være interessant – ikke bare som et effektiviseringstiltak, men som en annen måte å tenke tilbudsevaluering på.
Evaluering av tilbud har lenge vært en av de mest krevende delene av offentlige anskaffelser. Leverandørene blir gjerne bedt om å beskrive hvordan oppdraget skal gjennomføres, redegjøre for metodikk, forklare hvordan risiko skal håndteres og dokumentere erfaring, kompetanse og kvalitet. Resultatet kan bli omfattende tilbud med prosjektplaner, CV-er, prosessbeskrivelser, sertifikater, referanser og teknisk dokumentasjon.
I større konkurranser kan hvert tilbud bestå av flere hundre sider. Har man ti tilbydere med 500 sider hver, sitter evalueringsteamet i teorien med 5 000 sider informasjon som skal leses, forstås, sammenlignes og vurderes. Men dokumentmengden er egentlig bare en del av utfordringen. Minst like viktig er spørsmålet om hvordan informasjon som leverandørene har valgt å presentere på helt forskjellige måter, skal sammenlignes på en konsistent måte.
En leverandør kan for eksempel skrive:
«Vi har betydelig erfaring med tilsvarende oppdrag og benytter en robust metodikk som sikrer høy kvalitet.»
Det høres naturligvis positivt ut. Men hvor positivt? Representerer dette middels, god eller svært god kvalitet? Og hva skiller egentlig denne formuleringen fra konkurrentens beskrivelse?
Her ligger en av de grunnleggende utfordringene ved fritekstevaluering. Evaluatorene må fortolke teksten, og to erfarne personer kan lese den samme besvarelsen og likevel komme til forskjellige konklusjoner. Skjønn vil være både nødvendig og riktig i mange anskaffelser, men jo større rommet for fortolkning er, desto større blir også muligheten for variasjon i vurderingene.
I tillegg vet vi at mennesker påvirkes av ulike kognitive skjevheter. Et godt førsteinntrykk kan påvirke hvordan resten av tilbudet oppfattes. En velskrevet tekst kan fremstå som mer profesjonell enn en mindre polert besvarelse, og en omfattende beskrivelse kan oppfattes som grundigere selv om den ikke nødvendigvis inneholder mer relevant informasjon.
Dermed oppstår et interessant spørsmål: Evaluerer vi alltid leverandørens evne til å levere, eller evaluerer vi noen ganger også leverandørens evne til å skrive et godt tilbud?
Dette er særlig relevant fordi leverandørene har svært ulike forutsetninger. Store virksomheter kan ha profesjonelle tilbudsteam, egne bid managers, eksterne konsulenter og betydelige ressurser tilgjengelig når et tilbud skal utformes. Mindre virksomheter kan ha minst like gode løsninger, men langt mindre kapasitet til å produsere omfattende og språklig gjennomarbeidede tilbud. Jo større betydning selve presentasjonen får, desto større blir derfor risikoen for at evnen til å beskrive kvalitet påvirker vurderingen av den faktiske kvaliteten.
Fritekst skaper samtidig et praktisk sammenligningsproblem. Én leverandør kan beskrive risikoarbeidet på fem sider, en annen på én side. En tredje viser til et vedlegg, mens en fjerde presenterer prosessen i et diagram. Før tilbudene kan sammenlignes, må evaluatorene dermed finne, tolke og strukturere informasjonen. Og på toppen av det hele er det jo slik at for å få en noenlunde representativ skåring fra evalueringsteamet, så skal f.eks. alle 5 evaluatorer evaluere akkurat det samme. Ineffektivitet sier Kristian og smiler.
Når vurderingen er ferdig, kommer dessuten spørsmålet om etterprøvbarhet. Hvorfor fikk leverandør A åtte poeng, mens leverandør B fikk ti? Hvilke konkrete forskjeller i tilbudene utgjorde de to poengene? Jo mer skjønnsmessig evalueringen er, desto mer krevende kan det være å dokumentere den presise sammenhengen mellom leverandørens besvarelse og poengsummen som ble gitt. Dette kan igjen få betydning ved innsynsbegjæringer, klager og andre kontrollprosesser.
Hva om vi flytter vurderingen frem i tid?
Det er her svaralternativer og automatisk poengsetting kommer inn. I stedet for å be leverandøren om å «beskrive hvilken responstid som tilbys», kan oppdragsgiver for eksempel spørre:
«Angi hvilken responstid som tilbys.»
Leverandøren kan deretter velge mellom:
- Over 8 timer
- 4–8 timer
- 2–4 timer
- Under 2 timer
Oppdragsgiver har på forhånd bestemt hvilken verdi de ulike nivåene representerer – basert på sitt behov:
| Responstid | Poeng |
|---|---|
| Over 8 timer | 0 |
| 4–8 timer | 3 |
| 2–4 timer | 7 |
| Under 2 timer | 10 |
Leverandøren velger alternativet som beskriver tilbudet, og systemet beregner poengene. Ingen evaluator trenger dermed å diskutere om formuleringer som «rask responstid», «svært rask responstid» eller «meget god tilgjengelighet» egentlig betyr to, fire eller åtte timer.
Det kan høres ut som en relativt enkel digitalisering av evalueringsprosessen, men den viktigste endringen ligger egentlig et annet sted. For å kunne lage svaralternativene må oppdragsgiver allerede før konkurransen publiseres ta stilling til hva som faktisk skaper verdi, hvilke kvalitetsnivåer som er relevante, hvor stor verdi forskjellen mellom nivåene har, og hvordan dette skal gjenspeiles i poengmodellen.
En betydelig del av vurderingsarbeidet flyttes dermed fra tiden etter tilbudsfristen til arbeidet før konkurransen publiseres.
I en tradisjonell modell blir spørsmålet ofte: Hva har leverandørene tilbudt, og hvem mener vi er best?
Med svaralternativer blir spørsmålet i større grad: Hva mener vi på forhånd kjennetegner det beste tilbudet?
Det er en vesentlig forskjell, fordi oppdragsgiver tvinges til å være tydeligere på hva som faktisk har verdi i den konkrete anskaffelsen.
Når svaralternativer og poengverdier er definert på forhånd, reduseres samtidig behovet for individuell fortolkning. En responstid på 2–4 timer gir den poengsummen som allerede er definert for dette nivået. Den samme besvarelsen gir dermed det samme resultatet uavhengig av hvem som sitter i evalueringsteamet.
Alle leverandørene får de samme spørsmålene, de samme svaralternativene og vurderes etter den samme poengmodellen. Variasjonen mellom evaluatorene kan dermed reduseres betydelig. Etter Kristians vurdering er dette noe av det mest interessante ved metoden. Han omtaler ambisjonen som å komme nærmere «sann likebehandling», fordi leverandørene i større grad vurderes etter den samme forhåndsdefinerte målestokken.
Dette kan også få stor betydning for ressursbruken. En tradisjonell evaluering innebærer gjerne at teamet skal lese, tolke, diskutere, sammenligne, poengsette og dokumentere. Med autoskåring skjer mye av dette på en annen måte. Leverandøren registrerer sine svar, og systemet beregner poengene ut fra modellen som allerede er definert.
Det betyr ikke at all menneskelig vurdering skal forsvinne. Dersom konkurransen inneholder kvaliteter som vanskelig lar seg beskrive gjennom forhåndsdefinerte alternativer, vil disse fortsatt kunne vurderes manuelt. Det interessante er snarere å skille mellom hvor skjønn faktisk tilfører verdi, og hvor det ikke gjør det.
For de delene av konkurransen som kan beskrives gjennom tydelige og målbare alternativer, kan evalueringsarbeidet reduseres betydelig. Og jo flere leverandører som deltar, desto større kan denne gevinsten bli.
Samtidig blir sammenhengen mellom spørsmål, svar og resultat tydeligere. For hvert vurderingspunkt kan oppdragsgiver vise hvilket spørsmål som ble stilt, hvilket svar leverandøren valgte og hvilken verdi dette svaret representerte i modellen. Det gir et tydeligere revisjonsspor og kan gjøre både intern kvalitetssikring, innsynshåndtering og klagebehandling enklere.
Erfaringen fra Posten Bring er også at leverandørene lettere kan forstå hva som har påvirket resultatet. Selv om leverandøren ikke nødvendigvis kjenner poengverdien bak hvert enkelt svaralternativ, blir logikken mer forståelig. Dersom mange av svarene ligger i den mindre fordelaktige delen av skalaen, vil dette naturlig påvirke totalskåren.
En annen interessant effekt er at verdien av lange og strategisk formulerte beskrivelser reduseres. Leverandørene må i større grad forholde seg til faktiske egenskaper, reelle ytelser og dokumenterbare kvaliteter. Konkurransen kan dermed flyttes fra hvordan tilbudet beskrives, til hva som faktisk tilbys.
Forskjellen kan illustreres enkelt. I stedet for at leverandøren skriver:
«Vi tilbyr normalt responstid mellom to og fire timer, men ved spesielle forhold kan den bli kortere.»
registreres ganske enkelt:
2–4 timer
Språklig er forskjellen liten. Datamessig er den betydelig. Den første formuleringen må leses og tolkes. Den andre er strukturert informasjon som umiddelbart kan sammenlignes med tilsvarende informasjon fra andre leverandører.
Dette kan også få betydning etter at konkurransen er avsluttet. Når leverandøren har gitt klare og entydige svar på hva som faktisk tilbys, kan det bli enklere å følge opp de samme forpliktelsene i kontraktsperioden. Informasjonen som samles inn i konkurransen blir dermed ikke bare et grunnlag for evaluering, men kan også få verdi i den videre kontraktsoppfølgingen.
Fra tilbudsdokumenter til strukturerte data
Det er nettopp her koblingen til digitalisering og kunstig intelligens blir særlig interessant.
Når informasjon samles inn på en standardisert måte, oppstår strukturerte datasett med konsistente variabler og høy sammenlignbarhet. Det gir et bedre utgangspunkt for analyser, rapportering, avviksoppfølging, beslutningsstøtte og sammenligninger på tvers av leverandører og konkurranser.
Kunstig intelligens kan naturligvis også analysere fritekst, men strukturert informasjon gir et annet utgangspunkt. Når dataene allerede er kategorisert og standardisert, blir det enklere å identifisere mønstre og utvikling over tid. På den måten kan verdien av svaralternativene strekke seg langt utover selve tilbudsevalueringen.
Det betyr likevel ikke at svaralternativer og autoskåring er en enkel løsning som passer overalt. Metoden stiller tvert imot høye krav til oppdragsgiver. For å lage gode svaralternativer må man forstå behovet godt, vite hvilke egenskaper som faktisk skaper verdi, definere relevante kvalitetsnivåer og utforme en poengmodell som gir de riktige insentivene.
Dårlig utformede svaralternativer kan føre til overforenkling, feil insentiver eller tap av relevant informasjon. Dersom oppdragsgiver ikke har forstått hva som faktisk skaper verdi, vil heller ikke en automatisert poengmodell løse problemet.
Arbeidet forsvinner altså ikke. Det flyttes. Men det er viktig å påpeke at å utforme svaralternativer og tilhørende poeng er svært mye mindre arbeidskrevende enn en tradisjonell evalueringsprosess.
I stedet for å bruke store ressurser på å tolke tilbudene etter tilbudsfristen, må oppdragsgiver investere mer kompetanse i å forstå behovet og designe konkurransen før den publiseres. Kvaliteten på konkurranseutformingen blir derfor helt avgjørende.
Det er kanskje også her den mest prinsipielle forskjellen mellom de to modellene ligger.
Den tradisjonelle modellen kan, noe forenklet, beskrives slik:
«Les tilbudene og finn ut hvem som er best.»
Svaralternativmodellen snur på dette:
«Definer på forhånd hva som skaper verdi, og la svarene vise hvem som tilbyr det.»
Evalueringen går dermed fra i stor grad å være et tolkningsproblem etter tilbudsfristen til i større grad å bli et designproblem før konkurransen publiseres.
Det er mer enn en teknisk endring. Det er en endring i hvor selve tenkearbeidet skjer.
Denne forskyvningen kan også påvirke hvordan oppdragsgivere ser på antallet tilbydere. I tradisjonelle konkurranser kan mange tilbud innebære en betydelig arbeidsbelastning. Fem leverandører betyr fem tilbud som skal leses og evalueres. Ti betyr ti. Tjue leverandører kan gjøre evalueringsarbeidet svært omfattende.
Dermed kan et stort antall tilbydere – som i utgangspunktet burde være positivt for konkurransen – samtidig bli en praktisk utfordring.
Med autoskåring kan denne dynamikken endres. Når større deler av evalueringen skjer automatisk, blir ikke nødvendigvis leverandør nummer 15 like ressurskrevende som i en tradisjonell modell. Det kan senke terskelen for å legge til rette for bredere konkurranse og gjøre det enklere å håndtere flere tilbydere.
Det reiser et interessant spørsmål: Hva om flere tilbydere ikke først og fremst betyr mer evalueringsarbeid, men bedre konkurranse?
Mer enn et effektiviseringstiltak
Det er lett å betrakte svaralternativer og autoskåring først og fremst som en måte å spare tid på. Det er utvilsomt en viktig del av bildet, men den mest interessante effekten kan ligge et annet sted.
Metoden tvinger oppdragsgiver til å definere hva som faktisk har verdi før tilbudene kommer inn. Det reduserer behovet for å tolke store mengder tekst i etterkant, kan gjøre tilbudene enklere å sammenligne og kan gi mer konsistente og etterprøvbare vurderinger.
Samtidig kan leverandørene bruke mindre tid på omfattende tilbudstekster og mer tid på å konkurrere om det som faktisk betyr noe: innholdet i leveransen.
Erfaringen fra Posten Bring er at arbeidet med å designe spørsmål og svaralternativer kan kreve vesentlig mindre tid enn den tradisjonelle evalueringsprosessen, samtidig som informasjonen blir mer strukturert og enklere å følge opp.
Det betyr ikke at fritekst eller skjønn bør forsvinne fra offentlige anskaffelser. Noen kvaliteter lar seg vanskelig redusere til et svaralternativ, og i slike tilfeller vil faglig skjønn fortsatt være både nødvendig og verdifullt.
Det avgjørende spørsmålet er derfor kanskje ikke om hele evalueringen kan automatiseres, men hvor menneskelig skjønn faktisk tilfører verdi – og hvor et bedre resultat kan oppnås ved å definere verdien på forhånd.
I en tid der digitalisering, automatisering og kunstig intelligens får stadig større betydning, kan svaralternativer og autoskåring derfor representere noe mer enn en raskere måte å evaluere tilbud på. Det kan være en utvikling fra tekstbasert fortolkning til mer strukturert og databasert evaluering, og fra omfattende vurderinger i etterkant til et grundigere arbeid med verdidesign i forkant.
Dersom dette samtidig kan gi lavere ressursbruk, bedre konkurranse, større transparens og mer konsistente vurderinger, er det kanskje nettopp denne forskyvningen som er metodens største potensial.
Ikke å fjerne den faglige vurderingen, men å bruke den på riktig tidspunkt.
Leverandører og andre aktører som ønsker å diskutere erfaringene med denne metodikken nærmere, kan kontakte Kristian von Aphelen via LinkedIn (grunnet en varslet større nedbemanning i konsernet er dessverre usikkerheten stor for både ham og mange andre i konsernet).
Toppbilde: Posten Norge-bil om bord på en ferge. Foto: Daehnicke / Wikimedia Commons / CC BY-SA 4.0.