GregLab | Exam Prep

Fundamentals of Generative AI

Generative AI Evaluation Metrics

Generative AI evaluation combines automatic metrics with human judgment. Metrics such as ROUGE, BLEU, BERTScore, and perplexity each measure different signals and do not replace safety or usefulness review.

Concepts

  • ROUGE is commonly used for summarization overlap against reference summaries.
  • BLEU is commonly used for machine translation precision against references.
  • BERTScore compares semantic similarity using contextual embeddings.
  • Perplexity measures how surprised a language model is by text; lower is generally better.
  • Human evaluation is important for usefulness, safety, factuality, tone, and task fit.

Exam tips

  • ROUGE is common for summarization overlap; BLEU is common for translation overlap.
  • BERTScore uses contextual embeddings for semantic similarity.
  • Human evaluation is important for factuality, tone, safety, and task fit.

Free AWS Certified AI Practitioner prep

Build focused AIF-C01 quizzes from exam domains, topics, and AWS services.

Practice with exam-style multiple-choice and multiple-response questions, clearly labeled supplemental exercises, score breakdowns, explanations, and a compact reference for this lane's official exam domains.

Build a quiz

Exam Weights

Quiz builder

Choose your practice set

Mode

Exam fidelity: AWS lists multiple choice and multiple response for this exam. Ordering, matching, and case-study items are supplemental learning exercises; their results stay in overall study accuracy but do not count toward exam-style accuracy. Difficulty labels describe this site's scenario complexity, not an AWS-published question rating.

Reference

AIF-C01 topics and service map

Study links

AIF-C01 resources