過去の局面は特徴入力にしない方が+26ほど強い?
| 投稿日 | : 2022/08/30(Tue) 13:22 |
| 投稿者 | : 山下 |
| 件名 | : Re: 過去の局面は特徴入力にしない方が+26ほど強い? |
| 投稿日 | : 2022/08/31(Wed) 10:38 |
| 投稿者 | : 山下 |
| 参照先 | : |
人間が指す場合は、直前の手は相手の狙いの推測や
手の流れ、などで結構大きな情報だと思うのですが。
使ったhcpe3のデータが最初の4手はランダムで、以前の手の情報が怪しい、のも逆効果になってる原因の一つかもしれません。
marbleは直前手入ってないのですか。
最初にGNU Go相手にCNNのPolicyを試した論文でも直前の手なんてのは理論上不要、と
信念で使ってなかったのですが、直後にDeepMindが直前手を入れたので一致率が5%ぐらい上がってました。
シチョウは探索入れないとダメな気がします。
以前LeelaZeroに無意味そうなシチョウ逃げを絶対打たない、という手抜きの改良をしたのですが
+20Elo程度で、シチョウを逃げない棋譜を作って学習させないとほぼ効果ないようでした。
LZ that does not escape difficult ladder is slightly(54%) stronger
https://github.com/leela-zero/leela-zero/issues/2502
手の流れ、などで結構大きな情報だと思うのですが。
使ったhcpe3のデータが最初の4手はランダムで、以前の手の情報が怪しい、のも逆効果になってる原因の一つかもしれません。
marbleは直前手入ってないのですか。
最初にGNU Go相手にCNNのPolicyを試した論文でも直前の手なんてのは理論上不要、と
信念で使ってなかったのですが、直後にDeepMindが直前手を入れたので一致率が5%ぐらい上がってました。
シチョウは探索入れないとダメな気がします。
以前LeelaZeroに無意味そうなシチョウ逃げを絶対打たない、という手抜きの改良をしたのですが
+20Elo程度で、シチョウを逃げない棋譜を作って学習させないとほぼ効果ないようでした。
LZ that does not escape difficult ladder is slightly(54%) stronger
https://github.com/leela-zero/leela-zero/issues/2502
| 件名 | : Re: 過去の局面は特徴入力にしない方が+26ほど強い? |
| 投稿日 | : 2022/08/30(Tue) 19:38 |
| 投稿者 | : 48 |
| 参照先 | : |
2年ほど前でしたか確認して報告した記憶があります。
ということで将棋では過去局面不要と考えています。
囲碁でもやってみたのがmarbleですが,シチョウ回避できていないのが本件か
別件かの区別もついていません。
ということで将棋では過去局面不要と考えています。
囲碁でもやってみたのがmarbleですが,シチョウ回避できていないのが本件か
別件かの区別もついていません。
これを現在局面のみ、にすると+26 ELO強い、という結果になりました。
勝 分 敗 局数 (宣 千 宣) 先手勝率 勝率 95% ELO
762-26-412 1200 (14-26-0)(s=602-572,0.513), 0.646(0.027)( 104) GCTで学習(現在局面のみ)
723-21-456 1200 (10-21-0)(s=586-593,0.497), 0.611(0.027)( 78) GCTで学習(現在+過去5手前の局面)
543-18-639 1200 (12-18-1)(s=594-588,0.503), 0.460(0.028)( -27) w4116
学習は前回と同じ、GCTのデータを使い、同じように80万回学習を3回繰り返しました。学習率の変動も同じです。
ELO差が小さいので、誤差の影響も大きく、過去の局面は入れても入れなくても大差ない、が正解かもしれません。
囲碁だと直前の1手、はかなり大きな要素なのですが将棋だと影響小さいです。
直前の手の場所、だけでも入力した方が強くなりそうな気はするのですが。
実際は過去5手分のデータ(9x9 * (28 + 14 + 3)*5 = 18225個)は常に0、としてます。
GCTの学習データだと+105 ELO強い
http://www.yss-aya.com/bbs/patio.cgi?read=9&ukey=0