Blame - src/core/CL/kernels/CLGEMMLowpOffsetContributionOutputStageKernel.cpp - ml/ComputeLibrary

2019-11-04 14:42:08 +0000

[diff] [blame]

46

int32_t a_offset, int32_t b_offset, const GEMMLowpOutputStageInfo &output_stage, const ITensorInfo *output_multipliers, const ITensorInfo *output_shifts)

Gian Marco Iodice

2018-10-18 10:21:02 +0100

[diff] [blame]

47

{

48

ARM_COMPUTE_RETURN_ERROR_ON_DATA_TYPE_CHANNEL_NOT_IN(mm_result, 1, DataType::S32);

Gian Marco Iodice

2018-10-18 10:21:02 +0100

[diff] [blame]

if(bias != nullptr)

{

ARM_COMPUTE_RETURN_ERROR_ON_DATA_TYPE_CHANNEL_NOT_IN(bias, 1, DataType::S32);

53

ARM_COMPUTE_RETURN_ERROR_ON(bias->num_dimensions() > 1);

54

ARM_COMPUTE_RETURN_ERROR_ON(mm_result->dimension(0) != bias->dimension(0));

55

}

56

Vidhya Sudhan Loganathan

2019-11-04 14:42:08 +0000

[diff] [blame]

57

ARM_COMPUTE_RETURN_ERROR_ON_DATA_TYPE_CHANNEL_NOT_IN(output_multipliers, 1, DataType::S32);

58

ARM_COMPUTE_RETURN_ERROR_ON(output_multipliers->num_dimensions() > 1);

59

ARM_COMPUTE_RETURN_ERROR_ON_DATA_TYPE_CHANNEL_NOT_IN(output_shifts, 1, DataType::S32);

60

ARM_COMPUTE_RETURN_ERROR_ON(output_shifts->num_dimensions() > 1);

61

if(output_stage.is_quantized_per_channel)

62

{

63

ARM_COMPUTE_RETURN_ERROR_ON(mm_result->dimension(0) != output_shifts->dimension(0));

64

ARM_COMPUTE_RETURN_ERROR_ON(mm_result->dimension(0) != output_multipliers->dimension(0));

65

}

66

Gian Marco Iodice

2018-10-18 10:21:02 +0100

[diff] [blame]

67

// If a_offset == 0, vector_sum_col can be a nullptr

68

if(a_offset != 0)

69

{

70

ARM_COMPUTE_RETURN_ERROR_ON_DATA_TYPE_CHANNEL_NOT_IN(vector_sum_col, 1, DataType::S32);

71

ARM_COMPUTE_RETURN_ERROR_ON(vector_sum_col->dimension(0) != mm_result->dimension(0));

72

}

73

74

// If b_offset == 0, vector_sum_row can be a nullptr

75

if(b_offset != 0)

76

{

77

ARM_COMPUTE_RETURN_ERROR_ON_DATA_TYPE_CHANNEL_NOT_IN(vector_sum_row, 1, DataType::S32);

78

79

// Check if input is a 3D reinterpretation

80

const bool reinterpret_as_3d = mm_result->num_dimensions() > 1 && mm_result->tensor_shape().y() != vector_sum_row->tensor_shape().x();

81

82

// Validate input

83

ARM_COMPUTE_RETURN_ERROR_ON(reinterpret_as_3d && vector_sum_row->dimension(0) != (mm_result->dimension(1) * mm_result->dimension(2)));

84

ARM_COMPUTE_RETURN_ERROR_ON(!reinterpret_as_3d && vector_sum_row->dimension(0) != mm_result->dimension(1));

85

86

TensorShape output_shape = mm_result->tensor_shape();

87

if(output_shape.num_dimensions() > 1)

88

{

89

const unsigned int output_batch_idx = reinterpret_as_3d ? 3 : 2;

90

91

TensorShape vector_sum_row_shape = vector_sum_row->tensor_shape();

92

vector_sum_row_shape.collapse_from(1);

93

output_shape.collapse_from(output_batch_idx);

94

95

ARM_COMPUTE_RETURN_ERROR_ON_MSG(vector_sum_row_shape[1] != output_shape[output_batch_idx],

96

"mm_result tensor must have the same number of batches of output tensor");

if(a_offset != 0)

{

TensorShape vector_sum_col_shape = vector_sum_col->tensor_shape();

101

vector_sum_col_shape.collapse_from(1);

102

103

ARM_COMPUTE_RETURN_ERROR_ON_MSG(vector_sum_col_shape[1] != 1 && vector_sum_col_shape[1] != vector_sum_row_shape[1],

104

"vector_sum_col tensor must have the same number of batches of vector_sum_row_shape or the number of batches must be set to 1");

}

}

}

Manuel Bottini

2019-12-02 16:22:35 +0000

[diff] [blame]

109

ARM_COMPUTE_RETURN_ERROR_ON(output_stage.type == GEMMLowpOutputStageType::NONE);

110

// Checks performed when output is configured

111

if((output != nullptr) && (output->total_size() != 0))

Gian Marco Iodice

2018-10-18 10:21:02 +0100

[diff] [blame]

112

{

Manuel Bottini

2019-12-02 16:22:35 +0000

[diff] [blame]

113

ARM_COMPUTE_RETURN_ERROR_ON(output_stage.output_data_type != output->data_type());

114

ARM_COMPUTE_RETURN_ERROR_ON_DATA_TYPE_CHANNEL_NOT_IN(output, 1, DataType::QASYMM8, DataType::QASYMM8_SIGNED);

Gian Marco Iodice

2018-10-18 10:21:02 +0100

[diff] [blame]

115

ARM_COMPUTE_RETURN_ERROR_ON_MISMATCHING_SHAPES(mm_result, output);

116

}

117

Giorgio Arena

1856ff7

2020-02-07 13:46:45 +0000

[diff] [blame]

118

ARM_COMPUTE_RETURN_ERROR_ON(output_stage.gemmlowp_min_bound > output_stage.gemmlowp_max_bound);

Manuel Bottini

2019-12-02 16:22:35 +0000

[diff] [blame]

119

ARM_COMPUTE_RETURN_ERROR_ON_MSG(output_stage.gemmlowp_multipliers.size() != output_stage.gemmlowp_shifts.size(), "per channel quantization info is incorrect");

Vidhya Sudhan Loganathan

2019-11-04 14:42:08 +0000

[diff] [blame]

120

Gian Marco Iodice

2018-10-18 10:21:02 +0100

[diff] [blame]

return Status{};

}

std::pair<Status, Window> validate_and_configure_window(ITensorInfo *mm_result, ITensorInfo *vector_sum_col, ITensorInfo *vector_sum_row, ITensorInfo *bias, ITensorInfo *output,

Manuel Bottini

2019-12-02 16:22:35 +0000

[diff] [blame]

125

int32_t a_offset, int32_t b_offset, const GEMMLowpOutputStageInfo &output_stage, ITensorInfo *output_multipliers, ITensorInfo *output_shifts)

Gian Marco Iodice

2018-10-18 10:21:02 +0100

[diff] [blame]

126

{

127

constexpr unsigned int num_elems_processed_per_iteration = 4;

128

bool window_changed = false;

129

130

// Auto initialize the output

Manuel Bottini

2019-12-02 16:22:35 +0000

[diff] [blame]

131

auto_init_if_empty(*output, mm_result->clone()->set_data_type(output_stage.output_data_type));

Gian Marco Iodice

2018-10-18 10:21:02 +0100

[diff] [blame]

132

133

// Configure kernel window

134

Window win = calculate_max_window(*mm_result, Steps(num_elems_processed_per_iteration));

135

136

AccessWindowHorizontal mm_result_access(mm_result, 0, num_elems_processed_per_iteration);

137

window_changed = window_changed || update_window_and_padding(win, mm_result_access);

138

139

AccessWindowHorizontal output_access(output, 0, num_elems_processed_per_iteration);

140

window_changed = window_changed || update_window_and_padding(win, output_access);

if(a_offset != 0)

{

AccessWindowHorizontal vector_sum_col_access(vector_sum_col, 0, num_elems_processed_per_iteration);

145

window_changed = window_changed || update_window_and_padding(win, vector_sum_col_access);

}

if(b_offset != 0)

{

AccessWindowStatic vector_sum_row_access(vector_sum_row, 0, 0, vector_sum_row->dimension(0), 0); // NOLINT

150

window_changed = window_changed || update_window_and_padding(win, vector_sum_row_access);

}

if(bias != nullptr)

{

AccessWindowStatic bias_access(bias, 0, 0, ceil_to_multiple(bias->dimension(0), num_elems_processed_per_iteration), bias->tensor_shape()[1]);

156

window_changed = window_changed || update_window_and_padding(win, bias_access);

157

}

158

Vidhya Sudhan Loganathan

2019-11-04 14:42:08 +0000

[diff] [blame]

159

if(output_multipliers->dimension(0) > 1)

160

{

161

AccessWindowHorizontal output_multipliers_access(output_multipliers, 0, num_elems_processed_per_iteration);

162

AccessWindowHorizontal output_shifts_access(output_shifts, 0, num_elems_processed_per_iteration);

163

window_changed = window_changed || update_window_and_padding(win, output_multipliers_access, output_shifts_access);

164

}

165

Gian Marco Iodice

2018-10-18 10:21:02 +0100

[diff] [blame]

166

Status err = (window_changed) ? ARM_COMPUTE_CREATE_ERROR(ErrorCode::RUNTIME_ERROR, "Insufficient Padding!") : Status{};

167

return std::make_pair(err, win);

}

} // namespace

CLGEMMLowpOffsetContributionOutputStageKernel::CLGEMMLowpOffsetContributionOutputStageKernel()

Vidhya Sudhan Loganathan

2019-11-04 14:42:08 +0000

[diff] [blame]

172

: _mm_result(nullptr),

173

_vector_sum_col(nullptr),

174

_vector_sum_row(nullptr),

175

_bias(nullptr),

176

_output(nullptr),

177

_output_multipliers(nullptr),

178

_output_shifts(nullptr),

179

_is_quantized_per_channel(false)

Gian Marco Iodice

2018-10-18 10:21:02 +0100

[diff] [blame]

{

}

void CLGEMMLowpOffsetContributionOutputStageKernel::configure(const ICLTensor *mm_result, const ICLTensor *vector_sum_col, const ICLTensor *vector_sum_row, const ICLTensor *bias, ICLTensor *output,

Vidhya Sudhan Loganathan

2019-11-04 14:42:08 +0000

[diff] [blame]

184

int32_t k, int32_t a_offset, int32_t b_offset, const GEMMLowpOutputStageInfo &output_stage,

185

const ICLTensor *output_multipliers, const ICLTensor *output_shifts)

Gian Marco Iodice

2018-10-18 10:21:02 +0100

[diff] [blame]

186

{

Manuel Bottini

4c6bd51

2020-04-08 10:15:51 +0100

[diff] [blame]

187

configure(CLKernelLibrary::get().get_compile_context(), mm_result, vector_sum_col, vector_sum_row, bias, output, k, a_offset, b_offset, output_stage, output_multipliers, output_shifts);

188

}

189

Manuel Bottini

679fc96

2020-04-21 16:08:53 +0100

[diff] [blame]

190

void CLGEMMLowpOffsetContributionOutputStageKernel::configure(const CLCompileContext &compile_context, const ICLTensor *mm_result, const ICLTensor *vector_sum_col, const ICLTensor *vector_sum_row,

Manuel Bottini

4c6bd51

2020-04-08 10:15:51 +0100

[diff] [blame]

191

const ICLTensor *bias, ICLTensor *output,

192

int32_t k, int32_t a_offset, int32_t b_offset, const GEMMLowpOutputStageInfo &output_stage,

193

const ICLTensor *output_multipliers, const ICLTensor *output_shifts)

194

{

Gian Marco Iodice

2018-10-18 10:21:02 +0100

[diff] [blame]

195

// Perform validate step

Vidhya Sudhan Loganathan

2019-11-04 14:42:08 +0000

[diff] [blame]

196

ARM_COMPUTE_ERROR_ON_NULLPTR(mm_result, output, output_multipliers, output_shifts);

Gian Marco Iodice

2018-10-18 10:21:02 +0100

[diff] [blame]

197

ARM_COMPUTE_ERROR_THROW_ON(validate_arguments(mm_result->info(),

198

vector_sum_col != nullptr ? vector_sum_col->info() : nullptr,

199

vector_sum_row != nullptr ? vector_sum_row->info() : nullptr,

200

bias != nullptr ? bias->info() : nullptr,

201

output->info(),

Vidhya Sudhan Loganathan

2019-11-04 14:42:08 +0000

[diff] [blame]

202

a_offset, b_offset, output_stage,

203

output_multipliers->info(), output_shifts->info())); // NOLINT

Gian Marco Iodice

2018-10-18 10:21:02 +0100

[diff] [blame]

204

205

const int min = output_stage.gemmlowp_min_bound;

206

const int max = output_stage.gemmlowp_max_bound;

207

Vidhya Sudhan Loganathan

2019-11-04 14:42:08 +0000

[diff] [blame]

208

_vector_sum_col = vector_sum_col;

209

_vector_sum_row = vector_sum_row;

210

_mm_result = mm_result;

211

_bias = bias;

212

_output = output;

213

_output_multipliers = output_multipliers;

214

_output_shifts = output_shifts;

215

_is_quantized_per_channel = output_stage.is_quantized_per_channel;

Gian Marco Iodice

2018-10-18 10:21:02 +0100

[diff] [blame]

216

217

// Check if input is a 3D reinterpretation

218

const bool reinterpret_as_3d = vector_sum_row != nullptr

219

&& mm_result->info()->num_dimensions() > 1

220

&& mm_result->info()->tensor_shape().y() != vector_sum_row->info()->tensor_shape().x();

221

222

// Set the arguments to pass at compile time

223

CLBuildOptions build_opts;

224

225

// If a_offset == 0, vector_sum_col can be a nullptr

226

if(a_offset != 0)

227

{

228

build_opts.add_option("-DA_OFFSET=" + support::cpp11::to_string(a_offset));

229

build_opts.add_option_if(vector_sum_col->info()->tensor_shape().num_dimensions() > 1, "-DSUM_COL_HAS_BATCHES");

230

}

231

// If b_offset == 0, vector_sum_row can be a nullptr

232

build_opts.add_option_if(b_offset != 0, "-DB_OFFSET=" + support::cpp11::to_string(b_offset));

233

build_opts.add_option("-DK_OFFSET=" + support::cpp11::to_string(a_offset * b_offset * k));

234

build_opts.add_option_if(reinterpret_as_3d, "-DHEIGHT_INPUT3D=" + support::cpp11::to_string(mm_result->info()->dimension(1)));

235

build_opts.add_option_if(reinterpret_as_3d, "-DDEPTH_INPUT3D=" + support::cpp11::to_string(mm_result->info()->dimension(2)));

236

build_opts.add_option_if(bias != nullptr, "-DADD_BIAS");

237

build_opts.add_option("-DRESULT_OFFSET=" + support::cpp11::to_string(output_stage.gemmlowp_offset));

Vidhya Sudhan Loganathan

2019-11-04 14:42:08 +0000

[diff] [blame]

238

build_opts.add_option("-DRESULT_MULTIPLIER=" + support::cpp11::to_string(output_stage.gemmlowp_multipliers[0]));

239

build_opts.add_option("-DRESULT_SHIFT=" + support::cpp11::to_string(output_stage.gemmlowp_shifts[0]));

240

build_opts.add_option_if(_is_quantized_per_channel, "-DPER_CHANNEL_QUANTIZATION");

Manuel Bottini

2019-12-02 16:22:35 +0000

[diff] [blame]

241

build_opts.add_option("-DOUTPUT_DATA_TYPE=" + get_cl_type_from_data_type(output->info()->data_type()));

242

243

PixelValue min_val{};

244

PixelValue max_val{};

245

std::tie(min_val, max_val) = get_min_max(output->info()->data_type());

Giorgio Arena

1856ff7

2020-02-07 13:46:45 +0000

[diff] [blame]

246

build_opts.add_option_if((min > min_val.get<int32_t>()), "-DMIN_BOUND=" + support::cpp11::to_string(min));

247

build_opts.add_option_if((max < max_val.get<int32_t>()), "-DMAX_BOUND=" + support::cpp11::to_string(max));

Gian Marco Iodice

2018-10-18 10:21:02 +0100

[diff] [blame]

248

249

std::string kernel_name("gemmlowp_offset_contribution");

Manuel Bottini

2019-12-02 16:22:35 +0000

[diff] [blame]

250

kernel_name += "_" + string_from_gemmlowp_output_stage(output_stage.type);

Gian Marco Iodice

2018-10-18 10:21:02 +0100

[diff] [blame]

251

252

// Create kernel

Manuel Bottini

4c6bd51

2020-04-08 10:15:51 +0100

[diff] [blame]

253

_kernel = create_kernel(compile_context, kernel_name, build_opts.options());

Gian Marco Iodice

2018-10-18 10:21:02 +0100

[diff] [blame]

254

255

// Configure kernel window

256

auto win_config = validate_and_configure_window(mm_result->info(),

257

vector_sum_col != nullptr ? vector_sum_col->info() : nullptr,

258

vector_sum_row != nullptr ? vector_sum_row->info() : nullptr,

259

bias != nullptr ? bias->info() : nullptr,

260

output->info(),

Manuel Bottini

2019-12-02 16:22:35 +0000

[diff] [blame]

261

a_offset, b_offset, output_stage,

Vidhya Sudhan Loganathan

2019-11-04 14:42:08 +0000

[diff] [blame]

262

output_multipliers->info(), output_shifts->info()); // NOLINT

Gian Marco Iodice

2018-10-18 10:21:02 +0100

[diff] [blame]

263

ARM_COMPUTE_ERROR_THROW_ON(win_config.first);

264

ICLKernel::configure_internal(win_config.second);

265

266

// Set config_id for enabling LWS tuning

267

_config_id = kernel_name + "_";

268

_config_id += support::cpp11::to_string(mm_result->info()->dimension(0));

269

_config_id += "_";

270

_config_id += support::cpp11::to_string(mm_result->info()->dimension(1));

271

_config_id += "_";

272

_config_id += support::cpp11::to_string(mm_result->info()->dimension(2));

273

}

274

275

Status CLGEMMLowpOffsetContributionOutputStageKernel::validate(const ITensorInfo *mm_result, const ITensorInfo *vector_sum_col, const ITensorInfo *vector_sum_row, const ITensorInfo *bias,

Vidhya Sudhan Loganathan

2019-11-04 14:42:08 +0000

[diff] [blame]

276

const ITensorInfo *output, int32_t a_offset, int32_t b_offset, const GEMMLowpOutputStageInfo &output_stage,

277

const ITensorInfo *output_multipliers, const ITensorInfo *output_shifts)

Gian Marco Iodice

2018-10-18 10:21:02 +0100

[diff] [blame]

278

{

Vidhya Sudhan Loganathan

2019-11-04 14:42:08 +0000

[diff] [blame]

279

ARM_COMPUTE_RETURN_ON_ERROR(validate_arguments(mm_result, vector_sum_col, vector_sum_row, bias, output, a_offset, b_offset, output_stage, output_multipliers, output_shifts));

Gian Marco Iodice

2018-10-18 10:21:02 +0100

[diff] [blame]

280

ARM_COMPUTE_RETURN_ON_ERROR(validate_and_configure_window(mm_result->clone().get(),

281

vector_sum_col != nullptr ? vector_sum_col->clone().get() : nullptr,

282

vector_sum_row != nullptr ? vector_sum_row->clone().get() : nullptr,

283

bias != nullptr ? bias->clone().get() : nullptr,

284

output->clone().get(),

Manuel Bottini

2019-12-02 16:22:35 +0000

[diff] [blame]

285

a_offset, b_offset, output_stage,

Vidhya Sudhan Loganathan

2019-11-04 14:42:08 +0000

[diff] [blame]

286

output_multipliers->clone().get(), output_shifts->clone().get())

Gian Marco Iodice

2018-10-18 10:21:02 +0100

[diff] [blame]

.first); // NOLINT

return Status{};

}

void CLGEMMLowpOffsetContributionOutputStageKernel::run(const Window &window, cl::CommandQueue &queue)

293

{

294

ARM_COMPUTE_ERROR_ON_UNCONFIGURED_KERNEL(this);

295

ARM_COMPUTE_ERROR_ON_INVALID_SUBWINDOW(ICLKernel::window(), window);

296

297

Window collapsed = window.collapse_if_possible(ICLKernel::window(), Window::DimZ);

298

Window slice = collapsed.first_slice_window_3D();

299

300

// Set window for vector_sum_col

301

Window win_vector_sum_col = slice;

302

win_vector_sum_col.set(Window::DimY, Window::Dimension(0, 0, 0));

303

win_vector_sum_col.set(Window::DimZ, Window::Dimension(0, 0, 0));

304

305

// Set window for vector_sum_row

306

Window win_vector_sum_row = slice;

307

win_vector_sum_row.set(Window::DimX, Window::Dimension(0, 0, 0));

308

win_vector_sum_row.set(Window::DimY, Window::Dimension(0, 0, 0));

309

win_vector_sum_col.set(Window::DimZ, Window::Dimension(0, 0, 0));

310

311

Window biases_slice = slice;

312

biases_slice.set(Window::DimY, Window::Dimension(0, 1, 1));

313

biases_slice.set(Window::DimZ, Window::Dimension(0, 1, 1));

do

{

unsigned int idx = 0;

318

add_3D_tensor_argument(idx, _mm_result, slice);

Michalis Spyrou

e1651a5

2019-07-11 15:00:49 +0100

[diff] [blame]

319

add_2D_tensor_argument_if((_vector_sum_col != nullptr), idx, _vector_sum_col, win_vector_sum_col);

320

add_2D_tensor_argument_if((_vector_sum_row != nullptr), idx, _vector_sum_row, win_vector_sum_row);

321

add_1D_tensor_argument_if((_bias != nullptr), idx, _bias, biases_slice);

Gian Marco Iodice

2018-10-18 10:21:02 +0100

[diff] [blame]

322

add_3D_tensor_argument(idx, _output, slice);

Vidhya Sudhan Loganathan

2019-11-04 14:42:08 +0000

[diff] [blame]

323

add_1D_tensor_argument_if(_is_quantized_per_channel, idx, _output_multipliers, biases_slice);

324

add_1D_tensor_argument_if(_is_quantized_per_channel, idx, _output_shifts, biases_slice);

Gian Marco Iodice

2018-10-18 10:21:02 +0100

[diff] [blame]

325

enqueue(queue, *this, slice, lws_hint());

326

}

327

while(collapsed.slide_window_slice_3D(slice));

328

}

Vidhya Sudhan Loganathan