OpenAI DevDay 2024 | Community Spotlight | Sierra
Titel en omschrijving vertaald uit het Engels met AI.
- 17 dec. 2024
- 0 reacties
Maak er iets van
Schrijf je eigen kijk op deze video of zet de discussie open op het forum. De video staat er al in.
Over deze video
Realistische agent-benchmarks met LLM's: de prestaties en betrouwbaarheid van AI-agents meten is lastig, zeker in dynamische, realistische situaties met menselijke interactie, zoals klantenservice. Sierra gebruikte de GPT-4- en GPT-4o-modellen van OpenAI om synthetische data en scenario's te genereren die menselijke gebruikers simuleren die met een klantenservice-agent praten. Dat leidde tot τ-bench. Deze sessie behandelt de technische uitdagingen bij het maken van de data en de benchmark, de bevindingen uit het evalueren van meerdere LLM-agents op τ-bench, en een gesprek over het bouwen van dynamische agent-evaluaties met foundation models.
0 reacties
Nog geen reacties. Wees de eerste!
Log in om te reageren.
Inloggen of word lid