技術要素

基本情報技術者試験エージェントが環境の中で行動し、その結果として得られる報酬を最大化するように試行錯誤を通じて方策を学習する手法は…

テクノロジ系技術要素難易度:normal
エージェントが環境の中で行動し、その結果として得られる報酬を最大化するように試行錯誤を通じて方策を学習する手法はどれか。
強化学習
教師あり学習
教師なし学習
アンサンブル学習
正解
ア.強化学習

強化学習はエージェントが環境内で行動し、得られる報酬の累積を最大化する方策を試行錯誤で学ぶ。設問の説明に一致するため正しい。

?選択肢ごとの解説

ア ○強化学習はエージェントが環境内で行動し、得られる報酬の累積を最大化する方策を試行錯誤で学ぶ。設問の説明に一致するため正しい。
イ ×教師あり学習は正解ラベル付きデータから入力と出力の対応を学ぶ手法で、報酬による試行錯誤を行うものではない。
ウ ×教師なし学習はラベルのないデータからクラスタや構造を見つける手法で、報酬を最大化する仕組みではない。
エ ×アンサンブル学習は複数モデルの予測を統合して精度を高める技法で、報酬に基づく方策学習とは枠組みが異なる。
この問題の「深掘り・誤答の完全解説・覚え方」は、登録すると読めます。

基本情報技術者試験は全4,036問。公開しているのはその一部で、登録すると残りも一問ごとにAI解説つきで解けます。SRS暗記カード・全真模試・弱点診断まで。

登録は1分・クレジットカード不要。無料のまま練習・暗記カード・模試まで使えます。

作成・校閲:ukamiru編集部 · 基本情報技術者試験 過去問 · fe-a3-0307

【基本情報技術者試験】エージェントが環境の中で行動し、その結果として得られる報酬を…|正解「強化学習」|ukamiru 過去問