關於資料重新整理效能
Oracle Fusion Data Intelligence 中的資料重新整理是複雜的處理。預計重新整理持續時間中的某些日對日差異。
一般資料重新整理包括下列程序:
- 從 Oracle Fusion Cloud Applications 或其他第三方來源擷取資料。
- 將資料轉換成準備進行分析的預建綱要。
- 將資料載入 Oracle Autonomous AI Lakehouse 。
- 使用「資料共用」功能與外部目標共用資料。
影響資料重新整理效能的因子
重新整理資料所需的時間以及所有產生的關鍵指標和儀表板取決於幾個因素。
包括:
- 來源系統可用性 – 如果來源系統無法使用,重新整理將會暫停並等待。系統會傳送通知。如果系統可以判斷存取問題是由無效的證明資料所造成,「要求歷史記錄」和「倉儲重新整理統計資料」會顯示重新整理是否因來源可用性而排入佇列。
- 來源系統上的可用資源 – 如果來源系統資源由 Oracle Fusion Data Intelligence 擷取處理以外的處理使用,則會造成 Oracle Fusion Data Intelligence 資料重新整理的延遲。這對 Oracle Fusion Cloud Applications 特別有效。
- 來源資料的大小與複雜性 – 一般而言,重新整理期間所處理的資料量,是重新整理所需時間的良好指標,但並非總是如此。「倉儲重新整理統計資料」包含可表示整體數量的已發布記錄數目。請參閱檢視倉儲重新整理統計資料。
- 啟用的功能區域 - 一般而言,功能區域越多,要處理的資料就越多,重新整理時間就越長。
- 自訂 SQL 查詢 – 如果自訂查詢在 Oracle Autonomous AI Lakehouse 上執行,則可以使用管線所需的資源,這可能會影響整體重新整理效能。
- 依自訂下游處理鎖定表格 - 如果任何下游處理在 Oracle Fusion Data Intelligence 表格上取得鎖定,並保留它們太長,這可能會導致 Oracle Fusion Data Intelligence 執行的資料重新整理延遲。
- 對來源系統物件所做的自訂 – 如果這些物件需要完整載入自訂項目,重新整理將需要較長的時間。
- 來源和目標系統維護 – 系統維護活動 (例如修補) 可能會暫停或延遲管線程序,這可能會延長整體重新整理時間。
- 自訂資料管線 – 如果在自訂資料管線的資料擴增指令碼中使用複雜轉換邏輯,則可能會影響整體重新整理時間。
資料重新整理效能的考量
鑑於影響資料重新整理的各種因素,完成時間會因日而異。
請參閱影響資料重新整理效能的因子。
管線效能是共同的責任;因此,Oracle 提供可擴展的平台、組態控制和使用指南,同時管理資料量、來源系統整備度、轉換設計 (如果使用任何自訂資料管線)、排程和環境特定組態。最佳結果需要使用者持續參與組態、主動監控影響資料重新整理的不同因素,以及遵守 Oracle 建議的做法和工具。
為了協助保持最佳重新整理效能,請考慮下列動作:
- 已啟用的功能區域 - 只啟用分析業務需求所需的功能區域。從必要的開始,並在新需求出現時新增更多需求,而不是事先啟用所有功能。請參閱啟用功能區域的資料管線。移除對分析而言不重要的任何功能區域。請參閱停用功能區域的資料管線。
- 經常重新整理資料的模組和資料表格 – 使用「經常資料重新整理」功能,僅新增日內作業分析業務需求所需的模組。移除對分析而言不重要的任何模組。請參閱設定經常重新整理資料 V2 (預覽) 和經常重新整理資料的效能考量。
- 初始擷取日期 - 此設定控制要在倉儲中擷取、轉換及儲存的資料。根據實際業務需求仔細設定。請考慮使用「相對初始擷取日期」,而非絕對「初始擷取日期」。請參閱關於業務進程參數。如果您正在使用「可設定的客戶分析」功能,這會特別有影響力。請參閱可設定帳戶分析。
- 自訂擷取 - 如果自訂資料擷取是在來源系統上執行,則可以競爭資源並延遲資料重新整理。例如,與 Oracle Fusion Data Intelligence 擷取處理平行執行的自訂 Business Intelligence Cloud Connector (BICC) 擷取可能會拖慢 Oracle Fusion Data Intelligence 重新整理的速度。為了避免延遲,請確定在 Oracle Fusion Data Intelligence 資料重新整理視窗期間沒有執行其他自訂重新整理工作。特定重新整理所需的時間超過預期時,請使用「倉儲重新整理」統計資料來判斷資料重新整理期間是否因自訂擷取而有所延遲。請參閱檢視倉儲重新整理統計資料。
- Oracle Autonomous AI Lakehouse 的高服務階段作業 – 資料重新整理程序取決於可用的倉儲資源。如果執行高服務階段作業,則可以使用容量,並延遲將資料發布至倉儲。請參閱與 Oracle Fusion Data Intelligence 關聯的自治式 AI 湖倉一體使用指南。特定重新整理的執行時間超過預期時,請使用「倉儲重新整理」統計資料來判斷資料重新整理期間是否有任何「高」階段作業。請參閱檢視倉儲重新整理統計資料。
- 下游自訂 ETL 處理 - 資料重新整理處理需要對資料倉儲中的表格進行不中斷的存取。任何存取這些表格與取得長期保留鎖定的自訂 ETL 處理,都應排定在 Oracle Fusion Data Intelligence 重新整理視窗之外。
- 排定優先順序的重新整理 - 如果想要讓特定資料在增量重新整理期間先重新整理,可以選取這些倉儲表格來排定優先順序的重新整理。不過,這僅適用於真正需要在其他資料集之前重新整理的有限表格集。請參閱設定增量重新整理資料集的優先順序 (預覽) 。
- 功能區域排程置換 – 複查您已啟用的功能區域,並根據業務需求考慮分階段重新整理時間。這可以減少每日增量管線重新整理的處理負載。請參閱修訂功能區域的資料業務進程排程 (預覽) 。
- Fusion 擴增來源 – 如果您的資料擴增主要用於下游整合,請考慮使用資料集的 Fusion 擴增來源。使用此選項,增強重新整理可以與 Oracle Fusion Cloud Applications 中功能區域的每日增量重新整理平行執行。這可改善 Oracle Fusion Cloud Applications 來源的增量重新整理效能。它也會針對使用 Fusion 擴增來源的資料擴增啟用不同的重新整理頻率。根據 Oracle Fusion Cloud Applications 來源和 Fusion Augmentations 來源以分階段的方式排定重新整理,以避免 Oracle Fusion Cloud Applications 的資源競爭。請參閱使用 Fusion Augmentations 來源執行資料擴增。
- 在要求時重新整理階段優先順序變更 - 對於排定的增量重新整理,您可以提出服務要求,將特定模組從「主要」階段移至「次要」階段。請參閱 〈排程增量資料重新整理〉 。這可讓更高關鍵業務的資料更快推出。