Files
boc/SIL/HYPOTHESES.md
T
Bernt 05ed037fe8 pilot.landvex.com: HTTPS + Full Stack Verified
- DNS: pilot.landvex.com -> 16.170.83.169
- TLS: Let's Encrypt certificate (expires 2026-09-30)
- Nginx: reverse proxy with SSL termination
- API: https://pilot.landvex.com/api/v1/missions
- UI: https://pilot.landvex.com/
- Upload: POST /api/v1/missions/import (multipart/form-data)

Verified:
 https://pilot.landvex.com/health
 https://pilot.landvex.com/version
 https://pilot.landvex.com/api/v1/missions (list)
 https://pilot.landvex.com/api/v1/missions/:id (get)
 POST /api/v1/missions/import (video upload)
 UI loads with title 'LandveX Intelligence Lab'

Next: Pilot 001 — Break the system!
2026-07-02 17:34:19 +00:00

2.7 KiB

SIL Hypoteser

"Vilka hypoteser försöker vi falsifiera?"


H1: SIL minskar regressionsfel med minst 20%

Mätning:

  • Baseline: Regressionsfrekvens utan SIL (vecka 1-2)
  • Med SIL: Regressionsfrekvens med SIL (vecka 3-8)
  • Jämför: (baseline - med_SIL) / baseline

Falsifiering:

  • Om regressionsfrekvens INTE minskar med ≥20% → H1 falsifierad

Konsekvens:

  • Om falsifierad: SIL:s impact-analysis är för svag. Förbättra graf eller regler.

H2: SIL upptäcker fler arkitekturöverträdelser än traditionell code review

Mätning:

  • Räkna överträdelser som hittades av code review men INTE av SIL
  • Räkna överträdelser som hittades av SIL men INTE av code review
  • Jämför antal

Falsifiering:

  • Om code review hittar fler överträdelser än SIL → H2 falsifierad

Konsekvens:

  • Om falsifierad: Arkitekturpolicyerna är för svaga eller för få.

H3: SIL hittar fler beroenden än en senior utvecklare

Mätning:

  • Jämför SIL:s förutsägelser med senior utvecklares manuell analys
  • Räkna true positives, false positives, false negatives

Falsifiering:

  • Om senior utvecklare har högre recall än SIL → H3 falsifierad

Konsekvens:

  • Om falsifierad: Grafen saknar relationer eller fil-mappning är felaktig.

H4: Confidence korrelerar med faktisk korrekthet

Mätning:

  • Bin confidence i intervall (0.5-0.6, 0.6-0.7, etc.)
  • För varje bin: beräkna faktisk accuracy
  • Jämför: |förväntad_confidence - faktisk_accuracy| < 10%

Falsifiering:

  • Om kalibreringsfelet > 10% i flera bin → H4 falsifierad

Konsekvens:

  • Om falsifierad: Confidence-modellen är felkalibrerad. Justera algoritm.

H5: UNKNOWN används när systemet faktiskt saknar tillräcklig evidens

Mätning:

  • När SIL säger UNKNOWN: verifiera om det verkligen saknades evidens
  • När SIL säger CERTAIN men har fel: hade det saknats evidens?

Falsifiering:

  • Om UNKNOWN används när det fanns tillräcklig evidens → H5 falsifierad
  • Om CERTAIN används när evidens saknades → H5 falsifierad

Konsekvens:

  • Om falsifierad: Osäkerhetsmodellen är för konservativ eller för aggressiv.

Experimentdesign

Vecka 1-2: Baseline

  • Kör utan SIL (eller med SIL i skuggläge utan att visa resultat)
  • Samla data för H1, H2, H3

Vecka 3-6: Med SIL

  • Aktivera SIL för utvecklare (opt-in)
  • Samla samma data
  • Jämför

Vecka 7-8: Analys

  • Beräkna alla hypoteser
  • Klassificera fel (Failure Review)
  • Kalibrera confidence

Vecka 9: Beslut

  • Go/no-go för full aktivering
  • Prioritera förbättringar baserat på falsifierade hypoteser

"Det är en stor mental skillnad att fråga 'Vilka hypoteser försöker vi falsifiera?' istället för 'Vad kan vi bygga mer?'"