Evaluatiekloof bij AI-agents: bedrijven vertrouwen minder op beoordelingen
Uit een onderzoek onder 157 bedrijven blijkt dat organisaties AI-agents steeds meer autonomie geven, terwijl ze minder vertrouwen hebben in de evaluaties die deze autonomie moeten waarborgen. Ongeveer de helft van de bedrijven heeft al een agent in productie gebracht die wel hun interne evaluaties doorstond, maar faalde bij de klant. Slechts één op de twintig bedrijven vertrouwt volledig op geautomatiseerde evaluaties, waarbij de grootste zwakte is dat deze evaluaties niet overeenkomen met de resultaten in de echte wereld.
Desondanks staat twee derde van de bedrijven het al toe, of werkt actief aan, het implementeren van wijzigingen aan agents op basis van alleen geautomatiseerde evaluaties, zonder menselijke controle. Dit leidt tot een zogenaamde evaluatiekloof: het verschil tussen de autonomie die bedrijven aan hun agents geven en het vertrouwen in de tests die bedoeld zijn om falen te voorkomen.
Bron: VentureBeat
Originele bron: VentureBeat AI