forked from facebookincubator/triton-shared
-
Notifications
You must be signed in to change notification settings - Fork 0
Expand file tree
/
Copy pathTritonArithToLinalg.cpp
More file actions
103 lines (89 loc) · 4.35 KB
/
Copy pathTritonArithToLinalg.cpp
File metadata and controls
103 lines (89 loc) · 4.35 KB
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
//===----------------------------------------------------------------------===//
//
// Copyright (c) Meta Platforms, Inc. and affiliates, Microsoft Corporation.
// Licensed under the MIT license.
//
//===----------------------------------------------------------------------===//
#include "triton-shared/Conversion/TritonArithToLinalg/TritonArithToLinalg.h"
#include "triton-shared/Dialect/TritonTilingExt/IR/TritonTilingExtDialect.h"
#include "triton/Dialect/Triton/IR/Dialect.h"
#include "mlir/Dialect/Affine/IR/AffineOps.h"
#include "mlir/Dialect/Bufferization/IR/Bufferization.h"
#include "mlir/Dialect/ControlFlow/IR/ControlFlowOps.h"
#include "mlir/Dialect/Linalg/IR/Linalg.h"
#include "mlir/Dialect/Linalg/Passes.h"
#include "llvm/ADT/SmallVectorExtras.h"
#include "llvm/ADT/TypeSwitch.h"
#include "llvm/Support/Debug.h"
#include "llvm/Support/FormatVariadic.h"
#include "llvm/Support/MathExtras.h"
#include <numeric>
#include <type_traits>
#define DEBUG_TYPE "triton-arith-to-linalg"
#include "triton-shared/Conversion/TritonArithToLinalg/ConversionPatterns.hpp"
using namespace mlir;
using namespace triton;
void mlir::triton::populateTritonArithToLinalgCanonicalizationPatterns(
RewritePatternSet &patterns) {
patterns.add<MinMaxConverter<arith::CmpFOp>, MinMaxConverter<arith::CmpIOp>>(
patterns.getContext());
}
void mlir::triton::populateTritonTensorPtrConversionPatterns(
RewritePatternSet &patterns) {
patterns.add<StorePtrToLinalgConverter, TensorOpConverter<triton::LoadOp>,
TensorOpConverter<triton::IntToPtrOp>,
TensorOpConverter<triton::PtrToIntOp>,
TensorOpConverter<triton::BitcastOp>>(patterns.getContext());
}
void mlir::triton::populateTritonArithToLinalgConversionPatterns(
bool pidsToFuncArgs, bool addptrToLinalg, bool assertToCf,
bool transposeReduceToRank0, RewritePatternSet &patterns) {
if (pidsToFuncArgs) {
patterns.add<GetProgramIDConverter, GetNumProgramsConverter>(
patterns.getContext());
}
if (addptrToLinalg) {
patterns.add<AddPtrConverter>(patterns.getContext());
}
if (assertToCf) {
patterns.add<AssertConverter>(patterns.getContext());
}
patterns.add<BroadcastConverter>(patterns.getContext());
patterns.add<TransposeConverter>(patterns.getContext());
patterns.add<MakeRangeConverter>(patterns.getContext());
patterns.add<ExpandDimsConverter>(patterns.getContext());
patterns.add<BitcastConverter>(patterns.getContext());
patterns.add<CallConverter>(patterns.getContext());
patterns.add<MulHiUIOpConverter>(patterns.getContext());
patterns.add<PreciseSqrtConverter>(patterns.getContext());
patterns.add<PreciseDivConverter>(patterns.getContext());
patterns.add<CatConverter>(patterns.getContext());
patterns.add<SplitConverter>(patterns.getContext());
patterns.add<JoinConverter>(patterns.getContext());
patterns.add<FpToFpConverter>(patterns.getContext());
patterns.add<ClampConverter>(patterns.getContext());
patterns.add<MatmulConverter>(patterns.getContext());
patterns.add<SplatConverter>(patterns.getContext());
patterns.add<UnsplatConverter>(patterns.getContext());
patterns.add<DenseConstantConverter>(patterns.getContext());
patterns.add<CumSumConverter>(patterns.getContext());
patterns.add<ReshapeConverter>(patterns.getContext());
patterns.add<GatherConverter>(patterns.getContext());
populateExternElementwiseOpToMLIROps(patterns);
// Reduce converters
// Triton's reduce op is idential to linalg.reduce op, so we can clone
// `tt.reduce` body to `linalg.reduce`. Unfortunately, we still need to
// perform pattern matching to know what reduce ops we are dealing with
// so that we know how to initialize the initial reduce values correctly.
//
// We can do this in a generic way without pattern matching by always using
// the first elements along the reduction axis and perform the reduction on
// the remaining elements. However, this results in creatings sub-tensors that
// aren't always multiple of 2s, which are sub-optimal for certain hardwares.
patterns.add<ArgMinConverter>(patterns.getContext());
patterns.add<ArgMaxConverter>(patterns.getContext());
patterns.add<ReduceConverter>(patterns.getContext(), transposeReduceToRank0);
// Note: the ordering here matters!
// These patterns are added last to they will be tried last.
linalg::populateElementwiseToLinalgConversionPatterns(patterns);
}