Escrito por estudiantes que aprobaron Inmediatamente disponible después del pago Leer en línea o como PDF ¿Documento equivocado? Cámbialo gratis 4,6 TrustPilot
logo-home
Document preview thumbnail
Vista previa 2 fuera de 15 páginas
Examen

CS 7643 Quiz 5 Review – Questions and Answers | 2026 Update | 100% Correct – GT.

Document preview thumbnail
Vista previa 2 fuera de 15 páginas

CS 7643 Quiz 5 Review – Questions and Answers | 2026 Update | 100% Correct – GT.

Vista previa del contenido

CS 7643 Quiz 5 Review – Questions and Answers | 2026 Update | 100% Correct – GT.


🔵 SECTION 1: Deep Reinforcement
Learning

Q1. Define Reinforcement Learning and explain how Deep Reinforcement
Learning extends it.

Answer:

Reinforcement Learning (RL) is a framework where an agent interacts with an environment to
maximize cumulative reward.

At each timestep:

1. Observe state sts_tst
2. Take action ata_tat
3. Receive reward rtr_trt
4. Transition to next state st+1s_{t+1}st+1

Deep Reinforcement Learning (DRL) extends RL by using deep neural networks to
approximate:

 Value functions V(s)V(s)V(s)
 Q-functions Q(s,a)Q(s,a)Q(s,a)
 Policies π(a∣s)\pi(a|s)π(a∣s)

This enables solving high-dimensional problems such as images and continuous control.



Q2. What is the difference between Q-learning and SARSA?

Answer:

Both are temporal-difference (TD) methods.

Q-Learning (Off-Policy)

Q(s,a)←Q(s,a)+α[r+γmax⁡a′Q(s′,a′)−Q(s,a)]Q(s,a) \leftarrow Q(s,a) + \alpha \big[r + \gamma
\max_{a'} Q(s',a') - Q(s,a)\big]Q(s,a)←Q(s,a)+α[r+γa′maxQ(s′,a′)−Q(s,a)]

,  Uses maximum next Q-value
 Learns optimal policy
 Off-policy

SARSA (On-Policy)

Q(s,a)←Q(s,a)+α[r+γQ(s′,a′)−Q(s,a)]Q(s,a) \leftarrow Q(s,a) + \alpha \big[r + \gamma Q(s',a') -
Q(s,a)\big]Q(s,a)←Q(s,a)+α[r+γQ(s′,a′)−Q(s,a)]

 Uses actual next chosen action
 Learns behavior policy
 On-policy

Key difference:
Q-learning uses greedy max; SARSA uses actual action taken.



Q3. Explain step-by-step how Deep Q-Learning (DQN) works.

Answer:

1. Replace Q-table with neural network:

Q(s,a;θ)Q(s,a;\theta)Q(s,a;θ)

2. Use ε-greedy action selection.
3. Store experience tuple:

(s,a,r,s′)(s,a,r,s')(s,a,r,s′)

4. Sample minibatch from replay buffer.
5. Compute target:

y=r+γmax⁡a′Q(s′,a′;θ−)y = r + \gamma \max_{a'} Q(s',a';\theta^-)y=r+γa′maxQ(s′,a′;θ−)

6. Minimize loss:

L=(y−Q(s,a;θ))2L = (y - Q(s,a;\theta))^2L=(y−Q(s,a;θ))2

7. Periodically update target network.

Stabilization methods:

 Experience Replay
 Target Network

Información del documento

Subido en
3 de marzo de 2026
Número de páginas
15
Escrito en
2025/2026
Tipo
Examen
Contiene
Preguntas y respuestas
$16.99

¿Documento equivocado? Cámbialo gratis Dentro de los 14 días posteriores a la compra y antes de descargarlo, puedes elegir otro documento. Puedes gastar el importe de nuevo.
Escrito por estudiantes que aprobaron
Inmediatamente disponible después del pago
Leer en línea o como PDF

Seller avatar
Los indicadores de reputación están sujetos a la cantidad de artículos vendidos por una tarifa y las reseñas que ha recibido por esos documentos. Hay tres niveles: Bronce, Plata y Oro. Cuanto mayor reputación, más podrás confiar en la calidad del trabajo del vendedor.
Wiseman
3.9
(1639)
Vendido
8170
Seguidores
3893
Artículos
30517
Última venta
1 hora hace



Por qué los estudiantes eligen Stuvia

Creado por compañeros estudiantes, verificado por reseñas

Calidad en la que puedes confiar: escrito por estudiantes que aprobaron y evaluado por otros que han usado estos resúmenes.

¿No estás satisfecho? Elige otro documento

¡No te preocupes! Puedes elegir directamente otro documento que se ajuste mejor a lo que buscas.

Paga como quieras, empieza a estudiar al instante

Sin suscripción, sin compromisos. Paga como estés acostumbrado con tarjeta de crédito y descarga tu documento PDF inmediatamente.

Student with book image

“Comprado, descargado y aprobado. Así de fácil puede ser.”

Alisha Student

Preguntas frecuentes