應用、環境與模擬到真實

強化學習用於晶片設計(RL for chip design)

設計晶片意味著把許多元件擺在一張二維畫布上,使導線盡量短、散熱可控,且滿足時序限制——這個難題大到工程師可能要花上數週。RL 可以把佈局當成一連串決策:這個區塊放哪裡,然後下一個,再下一個。

智能體一次放置一個巨集區塊;狀態是當前的部分佈局,動作是下一個擺放位置,獎勵則結合線長、壅塞與時序,通常以快速估算得出,好讓智能體得到迅速的回饋。學到的策略能跨設計類推,在數小時內提出可與人工調校匹敵、甚至更佳的平面規劃。

Google 曾表示在其 TPU 平面規劃的部分環節使用 RL;這項工作既引發興奮,也招來爭論——關於它的結果與強力的傳統最佳化器相比是否公平。這是個健康的提醒:任何「RL 打敗專家」的主張,都值得用審慎、對等的基準來檢驗。

又称
learned chip placementRL floorplanning