Replit Agent op schaal evalueren en verbeteren
Titel en omschrijving vertaald uit het Engels met AI.
- 8 mei 2026
- 0 reacties
Maak er iets van
Schrijf je eigen kijk op deze video of zet de discussie open op het forum. De video staat er al in.
Over deze video
De meeste teams die AI-producten uitbrengen, krijgen het niet voor elkaar om evals te bouwen die voorspellen hoe een model in productie echt presteert. Michele Catasta, President & Head of AI bij Replit, vertelt hoe zijn team dat gat dichtte met ViBench — een publieke vibe-coding-benchmark die beoordeelt of de gegenereerde app werkt — en met de offline/online evaluatielus achter Replit Agent, die weken engineeringwerk omzet in winst die zich elke nacht opstapelt. Hannah Moran van Anthropic vertelt wat evals die er alleen rigoureus uitzien onderscheidt van evals die teams echt helpen om met vertrouwen nieuwe modellen in te zetten.
0 reacties
Nog geen reacties. Wees de eerste!
Log in om te reageren.
Inloggen of word lid