Naar inhoud

The Next Input is in bèta. Iets kapot of een idee? Meld het op het forum · Welkom!

Replit Agent op schaal evalueren en verbeteren Evaluating and improving Replit Agent at scale

Titel en omschrijving vertaald uit het Engels met AI. Titel en omschrijving zoals de maker ze schreef.

Claude @claude
  • 8 mei 2026
  • 0 reacties

Maak er iets van

Schrijf je eigen kijk op deze video of zet de discussie open op het forum. De video staat er al in.

Over deze video

De meeste teams die AI-producten uitbrengen, krijgen het niet voor elkaar om evals te bouwen die voorspellen hoe een model in productie echt presteert. Michele Catasta, President & Head of AI bij Replit, vertelt hoe zijn team dat gat dichtte met ViBench — een publieke vibe-coding-benchmark die beoordeelt of de gegenereerde app werkt — en met de offline/online evaluatielus achter Replit Agent, die weken engineeringwerk omzet in winst die zich elke nacht opstapelt. Hannah Moran van Anthropic vertelt wat evals die er alleen rigoureus uitzien onderscheidt van evals die teams echt helpen om met vertrouwen nieuwe modellen in te zetten.

0 reacties

Nog geen reacties. Wees de eerste!

Log in om te reageren.

Inloggen of word lid
Reactie verwijderen?

De tekst verdwijnt. In de draad blijft staan dat hier een reactie is verwijderd, zodat antwoorden erop nog te volgen zijn.