Skip to content

Data Drift Detection Prepare

uddd.DataDriftDetectionPreparer

Data Drift Detection을 위한 준비 단계를 수행하는 class 입니다.

Usage

demo/classification/train.py 참고

build(task_module, config) classmethod

DataDriftDetectionPreparer class의 instance를 생성합니다.

Parameters:

Name Type Description Default
task_module ModuleType

Data Drift Detection을 수행할 task의 module입니다.

required
config Dict

build를 위한 config가 담겨 있는 dictionary 입니다.

config = {
    "checkpoint_path": str,
    "password": str, # checkpoint 파일의 암호입니다. (default None)
    "total_images": Dict[str, Union[Dict[str, Dict], List[Dict]]], # train과 validation data 경로가 담겨 있는 dictionary입니다.
        {
            "train_images": {
                # 1: basic structure
                "{image_id}": {
                    "path": Union[str, List[str]],  # 이미지 경로 (multipage인 경우 경로 리스트)
                },
                ...,  # times number of images
            },
            "validation_images": {...},
        }
    "batch_size": int, # feature를 추출할 때 사용할 batch size입니다. (default 1)
    "device": Union[torch.device, str, int], # 사용할 device입니다. (default "cpu")
    "random_seed": int, # random seed입니다. (default 0)
}

required

Returns:

Name Type Description
DataDriftDetectionPreparer DataDriftDetectionPreparer

build가 완료된 preparer.DataDriftDetectionPreparer class의 instance를 반환합니다.

to_device(device)

DataDriftDetectionPreparer의 device를 변경합니다. (cpu/gpu)

Parameters:

Name Type Description Default
device Union[device, str, int]

변경하고자 하는 device 입니다. int의 경우 해당 번호의 GPU를, "cpu" 문자열의 경우 cpu를 사용합니다.

required

Returns:

Name Type Description
None None

None

extract_single_batch_feature()

한 batch data에 대한 feature를 추출하고 내부 feature_set에 저장합니다.

Returns:

Name Type Description
None None

None

get_feature_extraction_steps()

extract_single_batch_feature함수를 수행해야하는 iteration 수를 반환합니다.

Returns:

Name Type Description
int int

feature extraction iteration 수

post_extract_feature_process()

train과 validation 데이터에 대한 feature 추출이 끝난 후, 후처리를 수행합니다.

Returns:

Name Type Description
None None

None

extract_feature_set_and_postprocess()

train과 validation 데이터에 대한 feature 추출을 수행하고, 후처리를 수행합니다.

Returns:

Name Type Description
None None

None

core_train_feature_set_sampling()

추출한 train feature set을 sampling하여 core train feature set을 생성합니다. 그 후, 내부 feature_set에 덮어씌웁니다.

Returns:

Name Type Description
None None

None

get_valid_distances_stat()

core train feature set과 validation feature set의 거리를 계산하고, 거리의 통계값을 저장합니다.

Returns:

Name Type Description
None None

None

prepare()

Data Drift Detection을 위한 준비 단계를 수행합니다.

Returns:

Name Type Description
None None

None

save_prepare_result(checkpoint_path_list, password)

Data Drift Detection 준비 결과를 입력 받은 여러 checkpoint에 저장합니다.

Parameters:

Name Type Description Default
checkpoint_path_list List[str]

결과를 저장할 checkpoint 파일의 경로 리스트입니다.

required
password str

대상 checkpoint 파일의 암호입니다.

required

Returns:

Name Type Description
None None

None