Q-learning
Nº Q2664563 ★★
Incomum · Saberes
Q-learning
Q-learning é um algoritmo de aprendizagem por reforço que treina um agente para atribuir valores às suas possíveis ações com base em seu estado atual, sem exigir um modelo do ambiente (sem modelo). Ele pode lidar com problemas com transições estocásticas e recompensas sem exigir adaptações.
Último preço
—
Preço mínimo
—
Mediana 7 d
—
Vendas 30 d
0
Faixa 30 d
—
Em circulação
0
Cotação
mediana
mín – máx
vendas
Sem vendas no período
Ver tabela
| Data | mediana | Mín | Máx | vendas |
|---|
Histórico de vendas
- Última venda
- —
- Média 30 d
- —
- Mínima 30 d
- —
- Máxima 30 d
- —
- Vendas 7 d
- 0
- Vendas 30 d
- 0
Ainda sem vendas.
Vendas anônimas: sem comprador nem vendedor. Os números contam só vendas entre jogadores.
Na Wikipédia
Q-learning é um algoritmo de aprendizagem por reforço que treina um agente para atribuir valores às suas possíveis ações com base em seu estado atual, sem exigir um modelo do ambiente (sem modelo). Ele pode lidar com problemas com transições estocásticas e recompensas sem exigir adaptações. Para qualquer processo de decisão de Markov finito, o Q-learning encontra uma política ótima no sentido de maximizar o valor esperado da recompensa total em todas e quaisquer etapas sucessivas, começando pelo estado atual. O Q-learning pode identificar uma política de seleção de ação ótima para qualquer processo de decisão de Markov finito, dado um tempo de exploração infinito e uma política parcialmente aleatória. “Q” refere-se à função que o algoritmo calcula: a recompensa esperada — isto é, a qualidade — de uma ação realizada em um determinado estado.
Texto: Wikipédia, CC BY-SA 4.0. ·