Saltar al contenido principal

Evaluaciones de IA

Aprende sobre los frameworks de evaluación de Dart y Flutter para medir la confiabilidad de las herramientas de IA.

Para explorar la estrategia de evaluación, ver el conjunto de datos de código abierto y las rúbricas de puntuación, o participar en los conjuntos de datos de referencia de la comunidad, visita el repositorio Flutter Evals.

Evaluar las capacidades y la confiabilidad de los agentes de IA requiere enfoques de prueba que modelen tareas reales de los desarrolladores. Debido a que los LLM no son deterministas, las pruebas unitarias estándar son insuficientes para verificar comportamientos agénticos como la navegación por la base de código, la ejecución de planes y la síntesis de código.

Para generar confianza en los desarrolladores en las herramientas de IA, Dart y Flutter utilizan un sistema de evaluación ("evals") para probar los recorridos críticos de los usuarios (CUJ). Las evaluaciones miden tanto la corrección determinista del código (compilación, lints, pruebas automatizadas) como el rendimiento cualitativo (razonamiento, seguridad y concisión) utilizando jueces de modelos automatizados y calificación humana experta.