GregLab | Exam Prep

Fundamentals of Generative AI

Generative AI Evaluation Metrics

Generative AI evaluation combines automatic metrics with human judgment. Metrics such as ROUGE, BLEU, BERTScore, and perplexity each measure different signals and do not replace safety or usefulness review.

Concepts

  • ROUGE is commonly used for summarization overlap against reference summaries.
  • BLEU is commonly used for machine translation precision against references.
  • BERTScore compares semantic similarity using contextual embeddings.
  • Perplexity measures how surprised a language model is by text; lower is generally better.
  • Human evaluation is important for usefulness, safety, factuality, tone, and task fit.

Exam tips

  • ROUGE is common for summarization overlap; BLEU is common for translation overlap.
  • BERTScore uses contextual embeddings for semantic similarity.
  • Human evaluation is important for factuality, tone, safety, and task fit.

Free AWS Certified AI Practitioner prep

Build focused AIF-C01 quizzes from skill areas, topics, and product references.

Practice with exam-style multiple-choice and multiple-response questions, score breakdowns, explanations, and a compact reference for this lane's official exam domains.

Read Topics Build a quiz

Exam Weights

Quiz builder

Choose your practice set

Mode

Exam fidelity: AWS lists multiple choice and multiple response for this exam. Ordering, matching, and case-study items are supplemental learning exercises; their results stay in overall study accuracy but do not count toward exam-style accuracy. Difficulty labels describe this site's scenario complexity, not an AWS-published question rating.

Reference

AIF-C01 topics and reference map

Study links

AIF-C01 resources