react-native-vision-camera-spoof-detector 1.1.23 → 1.1.24

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (199) hide show
  1. package/android/CMakeLists.txt +12 -0
  2. package/android/build.gradle +10 -9
  3. package/android/src/main/cpp/cpp-adapter.cpp +6 -3
  4. package/package.json +1 -1
  5. package/android/src/main/cpp/CMakeLists.txt +0 -33
  6. package/android/src/main/cpp/FaceAntiSpoofJSI.cpp +0 -142
  7. package/android/src/main/cpp/FastYuvJni.cpp +0 -111
  8. package/android/src/main/cpp/fast_yuv.cpp +0 -342
  9. package/android/src/main/cpp/fast_yuv.h +0 -23
  10. package/android/src/main/cpp/libyuv/.clang-format +0 -6
  11. package/android/src/main/cpp/libyuv/.gn +0 -40
  12. package/android/src/main/cpp/libyuv/.vpython3 +0 -410
  13. package/android/src/main/cpp/libyuv/AUTHORS +0 -7
  14. package/android/src/main/cpp/libyuv/Android.bp +0 -202
  15. package/android/src/main/cpp/libyuv/Android.mk +0 -106
  16. package/android/src/main/cpp/libyuv/BUILD.gn +0 -490
  17. package/android/src/main/cpp/libyuv/CM_linux_packages.cmake +0 -70
  18. package/android/src/main/cpp/libyuv/CMakeLists.txt +0 -259
  19. package/android/src/main/cpp/libyuv/DEPS +0 -935
  20. package/android/src/main/cpp/libyuv/DIR_METADATA +0 -3
  21. package/android/src/main/cpp/libyuv/LICENSE +0 -29
  22. package/android/src/main/cpp/libyuv/OWNERS +0 -11
  23. package/android/src/main/cpp/libyuv/PATENTS +0 -24
  24. package/android/src/main/cpp/libyuv/PRESUBMIT.py +0 -65
  25. package/android/src/main/cpp/libyuv/README.chromium +0 -11
  26. package/android/src/main/cpp/libyuv/README.md +0 -19
  27. package/android/src/main/cpp/libyuv/build_overrides/build.gni +0 -60
  28. package/android/src/main/cpp/libyuv/build_overrides/gtest.gni +0 -19
  29. package/android/src/main/cpp/libyuv/build_overrides/partition_alloc.gni +0 -17
  30. package/android/src/main/cpp/libyuv/codereview.settings +0 -5
  31. package/android/src/main/cpp/libyuv/docs/deprecated_builds.md +0 -409
  32. package/android/src/main/cpp/libyuv/docs/environment_variables.md +0 -64
  33. package/android/src/main/cpp/libyuv/docs/feature_detection.md +0 -108
  34. package/android/src/main/cpp/libyuv/docs/filtering.md +0 -196
  35. package/android/src/main/cpp/libyuv/docs/formats.md +0 -208
  36. package/android/src/main/cpp/libyuv/docs/getting_started.md +0 -296
  37. package/android/src/main/cpp/libyuv/docs/rotation.md +0 -107
  38. package/android/src/main/cpp/libyuv/download_vs_toolchain.py +0 -29
  39. package/android/src/main/cpp/libyuv/include/libyuv/basic_types.h +0 -68
  40. package/android/src/main/cpp/libyuv/include/libyuv/compare.h +0 -111
  41. package/android/src/main/cpp/libyuv/include/libyuv/compare_row.h +0 -112
  42. package/android/src/main/cpp/libyuv/include/libyuv/convert.h +0 -1117
  43. package/android/src/main/cpp/libyuv/include/libyuv/convert_argb.h +0 -2335
  44. package/android/src/main/cpp/libyuv/include/libyuv/convert_from.h +0 -203
  45. package/android/src/main/cpp/libyuv/include/libyuv/convert_from_argb.h +0 -394
  46. package/android/src/main/cpp/libyuv/include/libyuv/cpu_id.h +0 -147
  47. package/android/src/main/cpp/libyuv/include/libyuv/cpu_support.h +0 -99
  48. package/android/src/main/cpp/libyuv/include/libyuv/loongson_intrinsics.h +0 -1949
  49. package/android/src/main/cpp/libyuv/include/libyuv/mjpeg_decoder.h +0 -195
  50. package/android/src/main/cpp/libyuv/include/libyuv/planar_functions.h +0 -1131
  51. package/android/src/main/cpp/libyuv/include/libyuv/rotate.h +0 -296
  52. package/android/src/main/cpp/libyuv/include/libyuv/rotate_argb.h +0 -37
  53. package/android/src/main/cpp/libyuv/include/libyuv/rotate_row.h +0 -265
  54. package/android/src/main/cpp/libyuv/include/libyuv/row.h +0 -6738
  55. package/android/src/main/cpp/libyuv/include/libyuv/row_sve.h +0 -2154
  56. package/android/src/main/cpp/libyuv/include/libyuv/scale.h +0 -336
  57. package/android/src/main/cpp/libyuv/include/libyuv/scale_argb.h +0 -76
  58. package/android/src/main/cpp/libyuv/include/libyuv/scale_rgb.h +0 -42
  59. package/android/src/main/cpp/libyuv/include/libyuv/scale_row.h +0 -1726
  60. package/android/src/main/cpp/libyuv/include/libyuv/scale_uv.h +0 -51
  61. package/android/src/main/cpp/libyuv/include/libyuv/version.h +0 -16
  62. package/android/src/main/cpp/libyuv/include/libyuv/video_common.h +0 -222
  63. package/android/src/main/cpp/libyuv/include/libyuv.h +0 -33
  64. package/android/src/main/cpp/libyuv/infra/config/OWNERS +0 -3
  65. package/android/src/main/cpp/libyuv/infra/config/PRESUBMIT.py +0 -17
  66. package/android/src/main/cpp/libyuv/infra/config/README.md +0 -2
  67. package/android/src/main/cpp/libyuv/infra/config/codereview.settings +0 -6
  68. package/android/src/main/cpp/libyuv/infra/config/commit-queue.cfg +0 -144
  69. package/android/src/main/cpp/libyuv/infra/config/cr-buildbucket.cfg +0 -1185
  70. package/android/src/main/cpp/libyuv/infra/config/luci-logdog.cfg +0 -9
  71. package/android/src/main/cpp/libyuv/infra/config/luci-milo.cfg +0 -246
  72. package/android/src/main/cpp/libyuv/infra/config/luci-scheduler.cfg +0 -385
  73. package/android/src/main/cpp/libyuv/infra/config/main.star +0 -402
  74. package/android/src/main/cpp/libyuv/infra/config/project.cfg +0 -16
  75. package/android/src/main/cpp/libyuv/infra/config/realms.cfg +0 -111
  76. package/android/src/main/cpp/libyuv/libyuv.gni +0 -34
  77. package/android/src/main/cpp/libyuv/libyuv.gyp +0 -149
  78. package/android/src/main/cpp/libyuv/libyuv.gypi +0 -87
  79. package/android/src/main/cpp/libyuv/linux.mk +0 -96
  80. package/android/src/main/cpp/libyuv/public.mk +0 -13
  81. package/android/src/main/cpp/libyuv/pylintrc +0 -49
  82. package/android/src/main/cpp/libyuv/riscv_script/prepare_toolchain_qemu.sh +0 -74
  83. package/android/src/main/cpp/libyuv/riscv_script/riscv-clang.cmake +0 -56
  84. package/android/src/main/cpp/libyuv/riscv_script/run_qemu.sh +0 -15
  85. package/android/src/main/cpp/libyuv/source/compare.cc +0 -435
  86. package/android/src/main/cpp/libyuv/source/compare_common.cc +0 -74
  87. package/android/src/main/cpp/libyuv/source/compare_gcc.cc +0 -362
  88. package/android/src/main/cpp/libyuv/source/compare_neon.cc +0 -96
  89. package/android/src/main/cpp/libyuv/source/compare_neon64.cc +0 -223
  90. package/android/src/main/cpp/libyuv/source/compare_win.cc +0 -241
  91. package/android/src/main/cpp/libyuv/source/convert.cc +0 -4746
  92. package/android/src/main/cpp/libyuv/source/convert_argb.cc +0 -9179
  93. package/android/src/main/cpp/libyuv/source/convert_from.cc +0 -866
  94. package/android/src/main/cpp/libyuv/source/convert_from_argb.cc +0 -3671
  95. package/android/src/main/cpp/libyuv/source/convert_jpeg.cc +0 -602
  96. package/android/src/main/cpp/libyuv/source/convert_to_argb.cc +0 -391
  97. package/android/src/main/cpp/libyuv/source/convert_to_i420.cc +0 -288
  98. package/android/src/main/cpp/libyuv/source/cpu_id.cc +0 -496
  99. package/android/src/main/cpp/libyuv/source/mjpeg_decoder.cc +0 -580
  100. package/android/src/main/cpp/libyuv/source/mjpeg_validate.cc +0 -71
  101. package/android/src/main/cpp/libyuv/source/planar_functions.cc +0 -5663
  102. package/android/src/main/cpp/libyuv/source/rotate.cc +0 -1241
  103. package/android/src/main/cpp/libyuv/source/rotate_any.cc +0 -76
  104. package/android/src/main/cpp/libyuv/source/rotate_argb.cc +0 -259
  105. package/android/src/main/cpp/libyuv/source/rotate_common.cc +0 -208
  106. package/android/src/main/cpp/libyuv/source/rotate_gcc.cc +0 -505
  107. package/android/src/main/cpp/libyuv/source/rotate_lsx.cc +0 -233
  108. package/android/src/main/cpp/libyuv/source/rotate_neon.cc +0 -219
  109. package/android/src/main/cpp/libyuv/source/rotate_neon64.cc +0 -273
  110. package/android/src/main/cpp/libyuv/source/rotate_sme.cc +0 -174
  111. package/android/src/main/cpp/libyuv/source/rotate_win.cc +0 -253
  112. package/android/src/main/cpp/libyuv/source/row_any.cc +0 -2519
  113. package/android/src/main/cpp/libyuv/source/row_common.cc +0 -4461
  114. package/android/src/main/cpp/libyuv/source/row_gcc.cc +0 -9570
  115. package/android/src/main/cpp/libyuv/source/row_lasx.cc +0 -2343
  116. package/android/src/main/cpp/libyuv/source/row_lsx.cc +0 -3030
  117. package/android/src/main/cpp/libyuv/source/row_neon.cc +0 -4026
  118. package/android/src/main/cpp/libyuv/source/row_neon64.cc +0 -5617
  119. package/android/src/main/cpp/libyuv/source/row_rvv.cc +0 -2599
  120. package/android/src/main/cpp/libyuv/source/row_sme.cc +0 -1183
  121. package/android/src/main/cpp/libyuv/source/row_sve.cc +0 -1088
  122. package/android/src/main/cpp/libyuv/source/row_win.cc +0 -6453
  123. package/android/src/main/cpp/libyuv/source/scale.cc +0 -2710
  124. package/android/src/main/cpp/libyuv/source/scale_any.cc +0 -991
  125. package/android/src/main/cpp/libyuv/source/scale_argb.cc +0 -1158
  126. package/android/src/main/cpp/libyuv/source/scale_common.cc +0 -1977
  127. package/android/src/main/cpp/libyuv/source/scale_gcc.cc +0 -2947
  128. package/android/src/main/cpp/libyuv/source/scale_lsx.cc +0 -739
  129. package/android/src/main/cpp/libyuv/source/scale_neon.cc +0 -1449
  130. package/android/src/main/cpp/libyuv/source/scale_neon64.cc +0 -1552
  131. package/android/src/main/cpp/libyuv/source/scale_rgb.cc +0 -82
  132. package/android/src/main/cpp/libyuv/source/scale_rvv.cc +0 -1971
  133. package/android/src/main/cpp/libyuv/source/scale_sme.cc +0 -555
  134. package/android/src/main/cpp/libyuv/source/scale_uv.cc +0 -1159
  135. package/android/src/main/cpp/libyuv/source/scale_win.cc +0 -1392
  136. package/android/src/main/cpp/libyuv/source/test.sh +0 -35
  137. package/android/src/main/cpp/libyuv/source/video_common.cc +0 -62
  138. package/android/src/main/cpp/libyuv/tools_libyuv/OWNERS +0 -4
  139. package/android/src/main/cpp/libyuv/tools_libyuv/autoroller/roll_deps.py +0 -931
  140. package/android/src/main/cpp/libyuv/tools_libyuv/autoroller/unittests/roll_deps_test.py +0 -164
  141. package/android/src/main/cpp/libyuv/tools_libyuv/autoroller/unittests/testdata/DEPS +0 -21
  142. package/android/src/main/cpp/libyuv/tools_libyuv/autoroller/unittests/testdata/DEPS.chromium.new +0 -13
  143. package/android/src/main/cpp/libyuv/tools_libyuv/autoroller/unittests/testdata/DEPS.chromium.old +0 -13
  144. package/android/src/main/cpp/libyuv/tools_libyuv/get_landmines.py +0 -38
  145. package/android/src/main/cpp/libyuv/tools_libyuv/msan/OWNERS +0 -3
  146. package/android/src/main/cpp/libyuv/tools_libyuv/msan/blacklist.txt +0 -9
  147. package/android/src/main/cpp/libyuv/tools_libyuv/ubsan/OWNERS +0 -3
  148. package/android/src/main/cpp/libyuv/tools_libyuv/ubsan/blacklist.txt +0 -15
  149. package/android/src/main/cpp/libyuv/tools_libyuv/ubsan/vptr_blacklist.txt +0 -25
  150. package/android/src/main/cpp/libyuv/unit_test/basictypes_test.cc +0 -43
  151. package/android/src/main/cpp/libyuv/unit_test/color_test.cc +0 -848
  152. package/android/src/main/cpp/libyuv/unit_test/compare_test.cc +0 -739
  153. package/android/src/main/cpp/libyuv/unit_test/convert_argb_test.cc +0 -2867
  154. package/android/src/main/cpp/libyuv/unit_test/convert_test.cc +0 -2133
  155. package/android/src/main/cpp/libyuv/unit_test/cpu_test.cc +0 -427
  156. package/android/src/main/cpp/libyuv/unit_test/cpu_thread_test.cc +0 -63
  157. package/android/src/main/cpp/libyuv/unit_test/math_test.cc +0 -160
  158. package/android/src/main/cpp/libyuv/unit_test/planar_test.cc +0 -4731
  159. package/android/src/main/cpp/libyuv/unit_test/rotate_argb_test.cc +0 -334
  160. package/android/src/main/cpp/libyuv/unit_test/rotate_test.cc +0 -962
  161. package/android/src/main/cpp/libyuv/unit_test/scale_argb_test.cc +0 -590
  162. package/android/src/main/cpp/libyuv/unit_test/scale_plane_test.cc +0 -465
  163. package/android/src/main/cpp/libyuv/unit_test/scale_rgb_test.cc +0 -280
  164. package/android/src/main/cpp/libyuv/unit_test/scale_test.cc +0 -1135
  165. package/android/src/main/cpp/libyuv/unit_test/scale_uv_test.cc +0 -249
  166. package/android/src/main/cpp/libyuv/unit_test/testdata/arm_v7.txt +0 -12
  167. package/android/src/main/cpp/libyuv/unit_test/testdata/mips.txt +0 -7
  168. package/android/src/main/cpp/libyuv/unit_test/testdata/mips_loongson2k.txt +0 -5
  169. package/android/src/main/cpp/libyuv/unit_test/testdata/mips_loongson3.txt +0 -10
  170. package/android/src/main/cpp/libyuv/unit_test/testdata/mips_loongson_mmi.txt +0 -7
  171. package/android/src/main/cpp/libyuv/unit_test/testdata/riscv64.txt +0 -4
  172. package/android/src/main/cpp/libyuv/unit_test/testdata/riscv64_rvv.txt +0 -4
  173. package/android/src/main/cpp/libyuv/unit_test/testdata/riscv64_rvv_zvfh.txt +0 -4
  174. package/android/src/main/cpp/libyuv/unit_test/testdata/tegra3.txt +0 -23
  175. package/android/src/main/cpp/libyuv/unit_test/testdata/test0.jpg +0 -0
  176. package/android/src/main/cpp/libyuv/unit_test/testdata/test1.jpg +0 -0
  177. package/android/src/main/cpp/libyuv/unit_test/testdata/test2.jpg +0 -0
  178. package/android/src/main/cpp/libyuv/unit_test/testdata/test3.jpg +0 -0
  179. package/android/src/main/cpp/libyuv/unit_test/testdata/test4.jpg +0 -0
  180. package/android/src/main/cpp/libyuv/unit_test/unit_test.cc +0 -581
  181. package/android/src/main/cpp/libyuv/unit_test/unit_test.h +0 -232
  182. package/android/src/main/cpp/libyuv/unit_test/video_common_test.cc +0 -112
  183. package/android/src/main/cpp/libyuv/util/Makefile +0 -9
  184. package/android/src/main/cpp/libyuv/util/color.cc +0 -120
  185. package/android/src/main/cpp/libyuv/util/compare.cc +0 -67
  186. package/android/src/main/cpp/libyuv/util/cpuid.c +0 -211
  187. package/android/src/main/cpp/libyuv/util/i444tonv12_eg.cc +0 -28
  188. package/android/src/main/cpp/libyuv/util/psnr.cc +0 -291
  189. package/android/src/main/cpp/libyuv/util/psnr.h +0 -47
  190. package/android/src/main/cpp/libyuv/util/psnr_main.cc +0 -620
  191. package/android/src/main/cpp/libyuv/util/ssim.cc +0 -364
  192. package/android/src/main/cpp/libyuv/util/ssim.h +0 -38
  193. package/android/src/main/cpp/libyuv/util/yuvconstants.c +0 -114
  194. package/android/src/main/cpp/libyuv/util/yuvconvert.cc +0 -367
  195. package/android/src/main/cpp/libyuv/winarm.mk +0 -47
  196. package/android/src/main/java/com/faceantispoof/ByteBufferPool.kt +0 -68
  197. package/android/src/main/java/com/faceantispoof/FastYuv.kt +0 -51
  198. package/android/src/main/java/com/faceantispoof/YuvToFloatArrayConverter.kt +0 -584
  199. package/android/src/main/java/com/faceantispoof/YuvToRgbConverter.kt +0 -73
@@ -1,3030 +0,0 @@
1
- /*
2
- * Copyright 2022 The LibYuv Project Authors. All rights reserved.
3
- *
4
- * Copyright (c) 2022 Loongson Technology Corporation Limited
5
- *
6
- * Use of this source code is governed by a BSD-style license
7
- * that can be found in the LICENSE file in the root of the source
8
- * tree. An additional intellectual property rights grant can be found
9
- * in the file PATENTS. All contributing project authors may
10
- * be found in the AUTHORS file in the root of the source tree.
11
- */
12
-
13
- #include "libyuv/row.h"
14
-
15
- #if !defined(LIBYUV_DISABLE_LSX) && defined(__loongarch_sx)
16
- #include "libyuv/loongson_intrinsics.h"
17
-
18
- #ifdef __cplusplus
19
- namespace libyuv {
20
- extern "C" {
21
- #endif
22
-
23
- // Fill YUV -> RGB conversion constants into vectors
24
- #define YUVTORGB_SETUP(yuvconst, vr, ub, vg, ug, yg, yb) \
25
- { \
26
- ub = __lsx_vreplgr2vr_h(yuvconst->kUVToB[0]); \
27
- vr = __lsx_vreplgr2vr_h(yuvconst->kUVToR[1]); \
28
- ug = __lsx_vreplgr2vr_h(yuvconst->kUVToG[0]); \
29
- vg = __lsx_vreplgr2vr_h(yuvconst->kUVToG[1]); \
30
- yg = __lsx_vreplgr2vr_h(yuvconst->kYToRgb[0]); \
31
- yb = __lsx_vreplgr2vr_w(yuvconst->kYBiasToRgb[0]); \
32
- }
33
-
34
- // Load 32 YUV422 pixel data
35
- #define READYUV422_D(psrc_y, psrc_u, psrc_v, out_y, uv_l, uv_h) \
36
- { \
37
- __m128i temp0, temp1; \
38
- \
39
- DUP2_ARG2(__lsx_vld, psrc_y, 0, psrc_u, 0, out_y, temp0); \
40
- temp1 = __lsx_vld(psrc_v, 0); \
41
- temp0 = __lsx_vsub_b(temp0, const_80); \
42
- temp1 = __lsx_vsub_b(temp1, const_80); \
43
- temp0 = __lsx_vsllwil_h_b(temp0, 0); \
44
- temp1 = __lsx_vsllwil_h_b(temp1, 0); \
45
- uv_l = __lsx_vilvl_h(temp0, temp1); \
46
- uv_h = __lsx_vilvh_h(temp0, temp1); \
47
- }
48
-
49
- // Load 16 YUV422 pixel data
50
- #define READYUV422(psrc_y, psrc_u, psrc_v, out_y, uv) \
51
- { \
52
- __m128i temp0, temp1; \
53
- \
54
- out_y = __lsx_vld(psrc_y, 0); \
55
- temp0 = __lsx_vldrepl_d(psrc_u, 0); \
56
- temp1 = __lsx_vldrepl_d(psrc_v, 0); \
57
- uv = __lsx_vilvl_b(temp0, temp1); \
58
- uv = __lsx_vsub_b(uv, const_80); \
59
- uv = __lsx_vsllwil_h_b(uv, 0); \
60
- }
61
-
62
- // Convert 16 pixels of YUV420 to RGB.
63
- #define YUVTORGB_D(in_y, in_uvl, in_uvh, ubvr, ugvg, yg, yb, b_l, b_h, g_l, \
64
- g_h, r_l, r_h) \
65
- { \
66
- __m128i u_l, u_h, v_l, v_h; \
67
- __m128i yl_ev, yl_od, yh_ev, yh_od; \
68
- __m128i temp0, temp1, temp2, temp3; \
69
- \
70
- temp0 = __lsx_vilvl_b(in_y, in_y); \
71
- temp1 = __lsx_vilvh_b(in_y, in_y); \
72
- yl_ev = __lsx_vmulwev_w_hu_h(temp0, yg); \
73
- yl_od = __lsx_vmulwod_w_hu_h(temp0, yg); \
74
- yh_ev = __lsx_vmulwev_w_hu_h(temp1, yg); \
75
- yh_od = __lsx_vmulwod_w_hu_h(temp1, yg); \
76
- DUP4_ARG2(__lsx_vsrai_w, yl_ev, 16, yl_od, 16, yh_ev, 16, yh_od, 16, \
77
- yl_ev, yl_od, yh_ev, yh_od); \
78
- yl_ev = __lsx_vadd_w(yl_ev, yb); \
79
- yl_od = __lsx_vadd_w(yl_od, yb); \
80
- yh_ev = __lsx_vadd_w(yh_ev, yb); \
81
- yh_od = __lsx_vadd_w(yh_od, yb); \
82
- v_l = __lsx_vmulwev_w_h(in_uvl, ubvr); \
83
- u_l = __lsx_vmulwod_w_h(in_uvl, ubvr); \
84
- v_h = __lsx_vmulwev_w_h(in_uvh, ubvr); \
85
- u_h = __lsx_vmulwod_w_h(in_uvh, ubvr); \
86
- temp0 = __lsx_vadd_w(yl_ev, u_l); \
87
- temp1 = __lsx_vadd_w(yl_od, u_l); \
88
- temp2 = __lsx_vadd_w(yh_ev, u_h); \
89
- temp3 = __lsx_vadd_w(yh_od, u_h); \
90
- DUP4_ARG2(__lsx_vsrai_w, temp0, 6, temp1, 6, temp2, 6, temp3, 6, temp0, \
91
- temp1, temp2, temp3); \
92
- DUP4_ARG1(__lsx_vclip255_w, temp0, temp1, temp2, temp3, temp0, temp1, \
93
- temp2, temp3); \
94
- b_l = __lsx_vpackev_h(temp1, temp0); \
95
- b_h = __lsx_vpackev_h(temp3, temp2); \
96
- temp0 = __lsx_vadd_w(yl_ev, v_l); \
97
- temp1 = __lsx_vadd_w(yl_od, v_l); \
98
- temp2 = __lsx_vadd_w(yh_ev, v_h); \
99
- temp3 = __lsx_vadd_w(yh_od, v_h); \
100
- DUP4_ARG2(__lsx_vsrai_w, temp0, 6, temp1, 6, temp2, 6, temp3, 6, temp0, \
101
- temp1, temp2, temp3); \
102
- DUP4_ARG1(__lsx_vclip255_w, temp0, temp1, temp2, temp3, temp0, temp1, \
103
- temp2, temp3); \
104
- r_l = __lsx_vpackev_h(temp1, temp0); \
105
- r_h = __lsx_vpackev_h(temp3, temp2); \
106
- DUP2_ARG2(__lsx_vdp2_w_h, in_uvl, ugvg, in_uvh, ugvg, u_l, u_h); \
107
- temp0 = __lsx_vsub_w(yl_ev, u_l); \
108
- temp1 = __lsx_vsub_w(yl_od, u_l); \
109
- temp2 = __lsx_vsub_w(yh_ev, u_h); \
110
- temp3 = __lsx_vsub_w(yh_od, u_h); \
111
- DUP4_ARG2(__lsx_vsrai_w, temp0, 6, temp1, 6, temp2, 6, temp3, 6, temp0, \
112
- temp1, temp2, temp3); \
113
- DUP4_ARG1(__lsx_vclip255_w, temp0, temp1, temp2, temp3, temp0, temp1, \
114
- temp2, temp3); \
115
- g_l = __lsx_vpackev_h(temp1, temp0); \
116
- g_h = __lsx_vpackev_h(temp3, temp2); \
117
- }
118
-
119
- // Convert 8 pixels of YUV420 to RGB.
120
- #define YUVTORGB(in_y, in_vu, vrub, vgug, yg, yb, out_b, out_g, out_r) \
121
- { \
122
- __m128i y_ev, y_od, u_l, v_l; \
123
- __m128i tmp0, tmp1, tmp2, tmp3; \
124
- \
125
- tmp0 = __lsx_vilvl_b(in_y, in_y); \
126
- y_ev = __lsx_vmulwev_w_hu_h(tmp0, yg); \
127
- y_od = __lsx_vmulwod_w_hu_h(tmp0, yg); \
128
- y_ev = __lsx_vsrai_w(y_ev, 16); \
129
- y_od = __lsx_vsrai_w(y_od, 16); \
130
- y_ev = __lsx_vadd_w(y_ev, yb); \
131
- y_od = __lsx_vadd_w(y_od, yb); \
132
- in_vu = __lsx_vilvl_b(zero, in_vu); \
133
- in_vu = __lsx_vsub_h(in_vu, const_80); \
134
- u_l = __lsx_vmulwev_w_h(in_vu, vrub); \
135
- v_l = __lsx_vmulwod_w_h(in_vu, vrub); \
136
- tmp0 = __lsx_vadd_w(y_ev, u_l); \
137
- tmp1 = __lsx_vadd_w(y_od, u_l); \
138
- tmp2 = __lsx_vadd_w(y_ev, v_l); \
139
- tmp3 = __lsx_vadd_w(y_od, v_l); \
140
- tmp0 = __lsx_vsrai_w(tmp0, 6); \
141
- tmp1 = __lsx_vsrai_w(tmp1, 6); \
142
- tmp2 = __lsx_vsrai_w(tmp2, 6); \
143
- tmp3 = __lsx_vsrai_w(tmp3, 6); \
144
- tmp0 = __lsx_vclip255_w(tmp0); \
145
- tmp1 = __lsx_vclip255_w(tmp1); \
146
- tmp2 = __lsx_vclip255_w(tmp2); \
147
- tmp3 = __lsx_vclip255_w(tmp3); \
148
- out_b = __lsx_vpackev_h(tmp1, tmp0); \
149
- out_r = __lsx_vpackev_h(tmp3, tmp2); \
150
- tmp0 = __lsx_vdp2_w_h(in_vu, vgug); \
151
- tmp1 = __lsx_vsub_w(y_ev, tmp0); \
152
- tmp2 = __lsx_vsub_w(y_od, tmp0); \
153
- tmp1 = __lsx_vsrai_w(tmp1, 6); \
154
- tmp2 = __lsx_vsrai_w(tmp2, 6); \
155
- tmp1 = __lsx_vclip255_w(tmp1); \
156
- tmp2 = __lsx_vclip255_w(tmp2); \
157
- out_g = __lsx_vpackev_h(tmp2, tmp1); \
158
- }
159
-
160
- // Convert I444 pixels of YUV420 to RGB.
161
- #define I444TORGB(in_yy, in_u, in_v, ub, vr, ugvg, yg, yb, out_b, out_g, \
162
- out_r) \
163
- { \
164
- __m128i y_ev, y_od, u_ev, v_ev, u_od, v_od; \
165
- __m128i tmp0, tmp1, tmp2, tmp3; \
166
- \
167
- y_ev = __lsx_vmulwev_w_hu_h(in_yy, yg); \
168
- y_od = __lsx_vmulwod_w_hu_h(in_yy, yg); \
169
- y_ev = __lsx_vsrai_w(y_ev, 16); \
170
- y_od = __lsx_vsrai_w(y_od, 16); \
171
- y_ev = __lsx_vadd_w(y_ev, yb); \
172
- y_od = __lsx_vadd_w(y_od, yb); \
173
- in_u = __lsx_vsub_h(in_u, const_80); \
174
- in_v = __lsx_vsub_h(in_v, const_80); \
175
- u_ev = __lsx_vmulwev_w_h(in_u, ub); \
176
- u_od = __lsx_vmulwod_w_h(in_u, ub); \
177
- v_ev = __lsx_vmulwev_w_h(in_v, vr); \
178
- v_od = __lsx_vmulwod_w_h(in_v, vr); \
179
- tmp0 = __lsx_vadd_w(y_ev, u_ev); \
180
- tmp1 = __lsx_vadd_w(y_od, u_od); \
181
- tmp2 = __lsx_vadd_w(y_ev, v_ev); \
182
- tmp3 = __lsx_vadd_w(y_od, v_od); \
183
- tmp0 = __lsx_vsrai_w(tmp0, 6); \
184
- tmp1 = __lsx_vsrai_w(tmp1, 6); \
185
- tmp2 = __lsx_vsrai_w(tmp2, 6); \
186
- tmp3 = __lsx_vsrai_w(tmp3, 6); \
187
- tmp0 = __lsx_vclip255_w(tmp0); \
188
- tmp1 = __lsx_vclip255_w(tmp1); \
189
- tmp2 = __lsx_vclip255_w(tmp2); \
190
- tmp3 = __lsx_vclip255_w(tmp3); \
191
- out_b = __lsx_vpackev_h(tmp1, tmp0); \
192
- out_r = __lsx_vpackev_h(tmp3, tmp2); \
193
- u_ev = __lsx_vpackev_h(in_u, in_v); \
194
- u_od = __lsx_vpackod_h(in_u, in_v); \
195
- v_ev = __lsx_vdp2_w_h(u_ev, ugvg); \
196
- v_od = __lsx_vdp2_w_h(u_od, ugvg); \
197
- tmp0 = __lsx_vsub_w(y_ev, v_ev); \
198
- tmp1 = __lsx_vsub_w(y_od, v_od); \
199
- tmp0 = __lsx_vsrai_w(tmp0, 6); \
200
- tmp1 = __lsx_vsrai_w(tmp1, 6); \
201
- tmp0 = __lsx_vclip255_w(tmp0); \
202
- tmp1 = __lsx_vclip255_w(tmp1); \
203
- out_g = __lsx_vpackev_h(tmp1, tmp0); \
204
- }
205
-
206
- // Pack and Store 16 ARGB values.
207
- #define STOREARGB_D(a_l, a_h, r_l, r_h, g_l, g_h, b_l, b_h, pdst_argb) \
208
- { \
209
- __m128i temp0, temp1, temp2, temp3; \
210
- temp0 = __lsx_vpackev_b(g_l, b_l); \
211
- temp1 = __lsx_vpackev_b(a_l, r_l); \
212
- temp2 = __lsx_vpackev_b(g_h, b_h); \
213
- temp3 = __lsx_vpackev_b(a_h, r_h); \
214
- r_l = __lsx_vilvl_h(temp1, temp0); \
215
- r_h = __lsx_vilvh_h(temp1, temp0); \
216
- g_l = __lsx_vilvl_h(temp3, temp2); \
217
- g_h = __lsx_vilvh_h(temp3, temp2); \
218
- __lsx_vst(r_l, pdst_argb, 0); \
219
- __lsx_vst(r_h, pdst_argb, 16); \
220
- __lsx_vst(g_l, pdst_argb, 32); \
221
- __lsx_vst(g_h, pdst_argb, 48); \
222
- pdst_argb += 64; \
223
- }
224
-
225
- // Pack and Store 8 ARGB values.
226
- #define STOREARGB(in_a, in_r, in_g, in_b, pdst_argb) \
227
- { \
228
- __m128i temp0, temp1; \
229
- __m128i dst0, dst1; \
230
- \
231
- temp0 = __lsx_vpackev_b(in_g, in_b); \
232
- temp1 = __lsx_vpackev_b(in_a, in_r); \
233
- dst0 = __lsx_vilvl_h(temp1, temp0); \
234
- dst1 = __lsx_vilvh_h(temp1, temp0); \
235
- __lsx_vst(dst0, pdst_argb, 0); \
236
- __lsx_vst(dst1, pdst_argb, 16); \
237
- pdst_argb += 32; \
238
- }
239
-
240
- #define RGBTOUV(_tmpb, _tmpg, _tmpr, _nexb, _nexg, _nexr, _dst0) \
241
- { \
242
- __m128i _tmp0, _tmp1, _tmp2, _tmp3, _tmp4, _tmp5; \
243
- __m128i _reg0, _reg1; \
244
- _tmp0 = __lsx_vaddwev_h_bu(_tmpb, _nexb); \
245
- _tmp1 = __lsx_vaddwod_h_bu(_tmpb, _nexb); \
246
- _tmp2 = __lsx_vaddwev_h_bu(_tmpg, _nexg); \
247
- _tmp3 = __lsx_vaddwod_h_bu(_tmpg, _nexg); \
248
- _reg0 = __lsx_vaddwev_h_bu(_tmpr, _nexr); \
249
- _reg1 = __lsx_vaddwod_h_bu(_tmpr, _nexr); \
250
- _tmp4 = __lsx_vaddwev_w_hu(_tmp0, _tmp1); \
251
- _tmp5 = __lsx_vaddwod_w_hu(_tmp0, _tmp1); \
252
- _tmp0 = __lsx_vilvl_w(_tmp5, _tmp4); \
253
- _tmp1 = __lsx_vilvh_w(_tmp5, _tmp4); \
254
- _tmpb = __lsx_vssrarni_hu_w(_tmp1, _tmp0, 2); \
255
- _tmp4 = __lsx_vaddwev_w_hu(_tmp2, _tmp3); \
256
- _tmp5 = __lsx_vaddwod_w_hu(_tmp2, _tmp3); \
257
- _tmp2 = __lsx_vilvl_w(_tmp5, _tmp4); \
258
- _tmp3 = __lsx_vilvh_w(_tmp5, _tmp4); \
259
- _tmpg = __lsx_vssrarni_hu_w(_tmp3, _tmp2, 2); \
260
- _tmp4 = __lsx_vaddwev_w_hu(_reg0, _reg1); \
261
- _tmp5 = __lsx_vaddwod_w_hu(_reg0, _reg1); \
262
- _tmp0 = __lsx_vilvl_w(_tmp5, _tmp4); \
263
- _tmp1 = __lsx_vilvh_w(_tmp5, _tmp4); \
264
- _tmpr = __lsx_vssrarni_hu_w(_tmp1, _tmp0, 2); \
265
- _reg0 = __lsx_vmadd_h(const_8000, const_112, _tmpb); \
266
- _reg1 = __lsx_vmadd_h(const_8000, const_112, _tmpr); \
267
- _reg0 = __lsx_vmsub_h(_reg0, const_74, _tmpg); \
268
- _reg1 = __lsx_vmsub_h(_reg1, const_94, _tmpg); \
269
- _reg0 = __lsx_vmsub_h(_reg0, const_38, _tmpr); \
270
- _reg1 = __lsx_vmsub_h(_reg1, const_18, _tmpb); \
271
- _dst0 = __lsx_vpickod_b(_reg1, _reg0); \
272
- }
273
-
274
- void MirrorRow_LSX(const uint8_t* src, uint8_t* dst, int width) {
275
- int x;
276
- int len = width / 32;
277
- __m128i src0, src1;
278
- __m128i shuffler = {0x08090A0B0C0D0E0F, 0x0001020304050607};
279
- src += width - 32;
280
- for (x = 0; x < len; x++) {
281
- DUP2_ARG2(__lsx_vld, src, 0, src, 16, src0, src1);
282
- DUP2_ARG3(__lsx_vshuf_b, src0, src0, shuffler, src1, src1, shuffler, src0,
283
- src1);
284
- __lsx_vst(src1, dst, 0);
285
- __lsx_vst(src0, dst, 16);
286
- dst += 32;
287
- src -= 32;
288
- }
289
- }
290
-
291
- void MirrorUVRow_LSX(const uint8_t* src_uv, uint8_t* dst_uv, int width) {
292
- int x;
293
- int len = width / 8;
294
- __m128i src, dst;
295
- __m128i shuffler = {0x0004000500060007, 0x0000000100020003};
296
-
297
- src_uv += (width - 8) << 1;
298
- for (x = 0; x < len; x++) {
299
- src = __lsx_vld(src_uv, 0);
300
- dst = __lsx_vshuf_h(shuffler, src, src);
301
- __lsx_vst(dst, dst_uv, 0);
302
- src_uv -= 16;
303
- dst_uv += 16;
304
- }
305
- }
306
-
307
- void ARGBMirrorRow_LSX(const uint8_t* src, uint8_t* dst, int width) {
308
- int x;
309
- int len = width / 8;
310
- __m128i src0, src1;
311
- __m128i shuffler = {0x0B0A09080F0E0D0C, 0x0302010007060504};
312
-
313
- src += (width * 4) - 32;
314
- for (x = 0; x < len; x++) {
315
- DUP2_ARG2(__lsx_vld, src, 0, src, 16, src0, src1);
316
- DUP2_ARG3(__lsx_vshuf_b, src0, src0, shuffler, src1, src1, shuffler, src0,
317
- src1);
318
- __lsx_vst(src1, dst, 0);
319
- __lsx_vst(src0, dst, 16);
320
- dst += 32;
321
- src -= 32;
322
- }
323
- }
324
-
325
- void I422ToYUY2Row_LSX(const uint8_t* src_y,
326
- const uint8_t* src_u,
327
- const uint8_t* src_v,
328
- uint8_t* dst_yuy2,
329
- int width) {
330
- int x;
331
- int len = width / 16;
332
- __m128i src_u0, src_v0, src_y0, vec_uv0;
333
- __m128i vec_yuy2_0, vec_yuy2_1;
334
-
335
- for (x = 0; x < len; x++) {
336
- DUP2_ARG2(__lsx_vld, src_u, 0, src_v, 0, src_u0, src_v0);
337
- src_y0 = __lsx_vld(src_y, 0);
338
- vec_uv0 = __lsx_vilvl_b(src_v0, src_u0);
339
- vec_yuy2_0 = __lsx_vilvl_b(vec_uv0, src_y0);
340
- vec_yuy2_1 = __lsx_vilvh_b(vec_uv0, src_y0);
341
- __lsx_vst(vec_yuy2_0, dst_yuy2, 0);
342
- __lsx_vst(vec_yuy2_1, dst_yuy2, 16);
343
- src_u += 8;
344
- src_v += 8;
345
- src_y += 16;
346
- dst_yuy2 += 32;
347
- }
348
- }
349
-
350
- void I422ToUYVYRow_LSX(const uint8_t* src_y,
351
- const uint8_t* src_u,
352
- const uint8_t* src_v,
353
- uint8_t* dst_uyvy,
354
- int width) {
355
- int x;
356
- int len = width / 16;
357
- __m128i src_u0, src_v0, src_y0, vec_uv0;
358
- __m128i vec_uyvy0, vec_uyvy1;
359
-
360
- for (x = 0; x < len; x++) {
361
- DUP2_ARG2(__lsx_vld, src_u, 0, src_v, 0, src_u0, src_v0);
362
- src_y0 = __lsx_vld(src_y, 0);
363
- vec_uv0 = __lsx_vilvl_b(src_v0, src_u0);
364
- vec_uyvy0 = __lsx_vilvl_b(src_y0, vec_uv0);
365
- vec_uyvy1 = __lsx_vilvh_b(src_y0, vec_uv0);
366
- __lsx_vst(vec_uyvy0, dst_uyvy, 0);
367
- __lsx_vst(vec_uyvy1, dst_uyvy, 16);
368
- src_u += 8;
369
- src_v += 8;
370
- src_y += 16;
371
- dst_uyvy += 32;
372
- }
373
- }
374
-
375
- void I422ToARGBRow_LSX(const uint8_t* src_y,
376
- const uint8_t* src_u,
377
- const uint8_t* src_v,
378
- uint8_t* dst_argb,
379
- const struct YuvConstants* yuvconstants,
380
- int width) {
381
- int x;
382
- int len = width / 16;
383
- __m128i vec_yb, vec_yg, vec_ub, vec_ug, vec_vr, vec_vg;
384
- __m128i vec_ubvr, vec_ugvg;
385
- __m128i alpha = __lsx_vldi(0xFF);
386
- __m128i const_80 = __lsx_vldi(0x80);
387
-
388
- YUVTORGB_SETUP(yuvconstants, vec_vr, vec_ub, vec_vg, vec_ug, vec_yg, vec_yb);
389
- vec_ubvr = __lsx_vilvl_h(vec_ub, vec_vr);
390
- vec_ugvg = __lsx_vilvl_h(vec_ug, vec_vg);
391
-
392
- for (x = 0; x < len; x++) {
393
- __m128i y, uv_l, uv_h, b_l, b_h, g_l, g_h, r_l, r_h;
394
-
395
- READYUV422_D(src_y, src_u, src_v, y, uv_l, uv_h);
396
- YUVTORGB_D(y, uv_l, uv_h, vec_ubvr, vec_ugvg, vec_yg, vec_yb, b_l, b_h, g_l,
397
- g_h, r_l, r_h);
398
- STOREARGB_D(alpha, alpha, r_l, r_h, g_l, g_h, b_l, b_h, dst_argb);
399
- src_y += 16;
400
- src_u += 8;
401
- src_v += 8;
402
- }
403
- }
404
-
405
- void I422ToRGBARow_LSX(const uint8_t* src_y,
406
- const uint8_t* src_u,
407
- const uint8_t* src_v,
408
- uint8_t* dst_argb,
409
- const struct YuvConstants* yuvconstants,
410
- int width) {
411
- int x;
412
- int len = width / 16;
413
- __m128i vec_yb, vec_yg, vec_ub, vec_vr, vec_ug, vec_vg;
414
- __m128i vec_ubvr, vec_ugvg;
415
- __m128i alpha = __lsx_vldi(0xFF);
416
- __m128i const_80 = __lsx_vldi(0x80);
417
-
418
- YUVTORGB_SETUP(yuvconstants, vec_vr, vec_ub, vec_vg, vec_ug, vec_yg, vec_yb);
419
- vec_ubvr = __lsx_vilvl_h(vec_ub, vec_vr);
420
- vec_ugvg = __lsx_vilvl_h(vec_ug, vec_vg);
421
-
422
- for (x = 0; x < len; x++) {
423
- __m128i y, uv_l, uv_h, b_l, b_h, g_l, g_h, r_l, r_h;
424
-
425
- READYUV422_D(src_y, src_u, src_v, y, uv_l, uv_h);
426
- YUVTORGB_D(y, uv_l, uv_h, vec_ubvr, vec_ugvg, vec_yg, vec_yb, b_l, b_h, g_l,
427
- g_h, r_l, r_h);
428
- STOREARGB_D(r_l, r_h, g_l, g_h, b_l, b_h, alpha, alpha, dst_argb);
429
- src_y += 16;
430
- src_u += 8;
431
- src_v += 8;
432
- }
433
- }
434
-
435
- void I422AlphaToARGBRow_LSX(const uint8_t* src_y,
436
- const uint8_t* src_u,
437
- const uint8_t* src_v,
438
- const uint8_t* src_a,
439
- uint8_t* dst_argb,
440
- const struct YuvConstants* yuvconstants,
441
- int width) {
442
- int x;
443
- int len = width / 16;
444
- int res = width & 15;
445
- __m128i vec_yb, vec_yg, vec_ub, vec_vr, vec_ug, vec_vg;
446
- __m128i vec_ubvr, vec_ugvg;
447
- __m128i zero = __lsx_vldi(0);
448
- __m128i const_80 = __lsx_vldi(0x80);
449
-
450
- YUVTORGB_SETUP(yuvconstants, vec_vr, vec_ub, vec_vg, vec_ug, vec_yg, vec_yb);
451
- vec_ubvr = __lsx_vilvl_h(vec_ub, vec_vr);
452
- vec_ugvg = __lsx_vilvl_h(vec_ug, vec_vg);
453
-
454
- for (x = 0; x < len; x++) {
455
- __m128i y, uv_l, uv_h, b_l, b_h, g_l, g_h, r_l, r_h, a_l, a_h;
456
-
457
- y = __lsx_vld(src_a, 0);
458
- a_l = __lsx_vilvl_b(zero, y);
459
- a_h = __lsx_vilvh_b(zero, y);
460
- READYUV422_D(src_y, src_u, src_v, y, uv_l, uv_h);
461
- YUVTORGB_D(y, uv_l, uv_h, vec_ubvr, vec_ugvg, vec_yg, vec_yb, b_l, b_h, g_l,
462
- g_h, r_l, r_h);
463
- STOREARGB_D(a_l, a_h, r_l, r_h, g_l, g_h, b_l, b_h, dst_argb);
464
- src_y += 16;
465
- src_u += 8;
466
- src_v += 8;
467
- src_a += 16;
468
- }
469
- if (res) {
470
- __m128i y, uv, r, g, b, a;
471
- a = __lsx_vld(src_a, 0);
472
- a = __lsx_vsllwil_hu_bu(a, 0);
473
- READYUV422(src_y, src_u, src_v, y, uv);
474
- YUVTORGB(y, uv, vec_ubvr, vec_ugvg, vec_yg, vec_yb, b, g, r);
475
- STOREARGB(a, r, g, b, dst_argb);
476
- }
477
- }
478
-
479
- void I422ToRGB24Row_LSX(const uint8_t* src_y,
480
- const uint8_t* src_u,
481
- const uint8_t* src_v,
482
- uint8_t* dst_argb,
483
- const struct YuvConstants* yuvconstants,
484
- int32_t width) {
485
- int x;
486
- int len = width / 16;
487
- __m128i vec_yb, vec_yg, vec_ub, vec_vr, vec_ug, vec_vg;
488
- __m128i vec_ubvr, vec_ugvg;
489
- __m128i const_80 = __lsx_vldi(0x80);
490
- __m128i shuffler0 = {0x0504120302100100, 0x0A18090816070614};
491
- __m128i shuffler1 = {0x1E0F0E1C0D0C1A0B, 0x1E0F0E1C0D0C1A0B};
492
-
493
- YUVTORGB_SETUP(yuvconstants, vec_vr, vec_ub, vec_vg, vec_ug, vec_yg, vec_yb);
494
- vec_ubvr = __lsx_vilvl_h(vec_ub, vec_vr);
495
- vec_ugvg = __lsx_vilvl_h(vec_ug, vec_vg);
496
-
497
- for (x = 0; x < len; x++) {
498
- __m128i y, uv_l, uv_h, b_l, b_h, g_l, g_h, r_l, r_h;
499
- __m128i temp0, temp1, temp2, temp3;
500
-
501
- READYUV422_D(src_y, src_u, src_v, y, uv_l, uv_h);
502
- YUVTORGB_D(y, uv_l, uv_h, vec_ubvr, vec_ugvg, vec_yg, vec_yb, b_l, b_h, g_l,
503
- g_h, r_l, r_h);
504
- temp0 = __lsx_vpackev_b(g_l, b_l);
505
- temp1 = __lsx_vpackev_b(g_h, b_h);
506
- DUP4_ARG3(__lsx_vshuf_b, r_l, temp0, shuffler1, r_h, temp1, shuffler1, r_l,
507
- temp0, shuffler0, r_h, temp1, shuffler0, temp2, temp3, temp0,
508
- temp1);
509
-
510
- b_l = __lsx_vilvl_d(temp1, temp2);
511
- b_h = __lsx_vilvh_d(temp3, temp1);
512
- __lsx_vst(temp0, dst_argb, 0);
513
- __lsx_vst(b_l, dst_argb, 16);
514
- __lsx_vst(b_h, dst_argb, 32);
515
- dst_argb += 48;
516
- src_y += 16;
517
- src_u += 8;
518
- src_v += 8;
519
- }
520
- }
521
-
522
- // TODO(fbarchard): Consider AND instead of shift to isolate 5 upper bits of R.
523
- void I422ToRGB565Row_LSX(const uint8_t* src_y,
524
- const uint8_t* src_u,
525
- const uint8_t* src_v,
526
- uint8_t* dst_rgb565,
527
- const struct YuvConstants* yuvconstants,
528
- int width) {
529
- int x;
530
- int len = width / 16;
531
- __m128i vec_yb, vec_yg, vec_ub, vec_vr, vec_ug, vec_vg;
532
- __m128i vec_ubvr, vec_ugvg;
533
- __m128i const_80 = __lsx_vldi(0x80);
534
-
535
- YUVTORGB_SETUP(yuvconstants, vec_vr, vec_ub, vec_vg, vec_ug, vec_yg, vec_yb);
536
- vec_ubvr = __lsx_vilvl_h(vec_ub, vec_vr);
537
- vec_ugvg = __lsx_vilvl_h(vec_ug, vec_vg);
538
-
539
- for (x = 0; x < len; x++) {
540
- __m128i y, uv_l, uv_h, b_l, b_h, g_l, g_h, r_l, r_h;
541
-
542
- READYUV422_D(src_y, src_u, src_v, y, uv_l, uv_h);
543
- YUVTORGB_D(y, uv_l, uv_h, vec_ubvr, vec_ugvg, vec_yg, vec_yb, b_l, b_h, g_l,
544
- g_h, r_l, r_h);
545
- b_l = __lsx_vsrli_h(b_l, 3);
546
- b_h = __lsx_vsrli_h(b_h, 3);
547
- g_l = __lsx_vsrli_h(g_l, 2);
548
- g_h = __lsx_vsrli_h(g_h, 2);
549
- r_l = __lsx_vsrli_h(r_l, 3);
550
- r_h = __lsx_vsrli_h(r_h, 3);
551
- r_l = __lsx_vslli_h(r_l, 11);
552
- r_h = __lsx_vslli_h(r_h, 11);
553
- g_l = __lsx_vslli_h(g_l, 5);
554
- g_h = __lsx_vslli_h(g_h, 5);
555
- r_l = __lsx_vor_v(r_l, g_l);
556
- r_l = __lsx_vor_v(r_l, b_l);
557
- r_h = __lsx_vor_v(r_h, g_h);
558
- r_h = __lsx_vor_v(r_h, b_h);
559
- __lsx_vst(r_l, dst_rgb565, 0);
560
- __lsx_vst(r_h, dst_rgb565, 16);
561
- dst_rgb565 += 32;
562
- src_y += 16;
563
- src_u += 8;
564
- src_v += 8;
565
- }
566
- }
567
-
568
- // TODO(fbarchard): Consider AND instead of shift to isolate 4 upper bits of G.
569
- void I422ToARGB4444Row_LSX(const uint8_t* src_y,
570
- const uint8_t* src_u,
571
- const uint8_t* src_v,
572
- uint8_t* dst_argb4444,
573
- const struct YuvConstants* yuvconstants,
574
- int width) {
575
- int x;
576
- int len = width / 16;
577
- __m128i vec_yb, vec_yg, vec_ub, vec_vr, vec_ug, vec_vg;
578
- __m128i vec_ubvr, vec_ugvg;
579
- __m128i const_80 = __lsx_vldi(0x80);
580
- __m128i alpha = (__m128i)v2u64{0xF000F000F000F000, 0xF000F000F000F000};
581
- __m128i mask = {0x00F000F000F000F0, 0x00F000F000F000F0};
582
-
583
- YUVTORGB_SETUP(yuvconstants, vec_vr, vec_ub, vec_vg, vec_ug, vec_yg, vec_yb);
584
- vec_ubvr = __lsx_vilvl_h(vec_ub, vec_vr);
585
- vec_ugvg = __lsx_vilvl_h(vec_ug, vec_vg);
586
-
587
- for (x = 0; x < len; x++) {
588
- __m128i y, uv_l, uv_h, b_l, b_h, g_l, g_h, r_l, r_h;
589
-
590
- READYUV422_D(src_y, src_u, src_v, y, uv_l, uv_h);
591
- YUVTORGB_D(y, uv_l, uv_h, vec_ubvr, vec_ugvg, vec_yg, vec_yb, b_l, b_h, g_l,
592
- g_h, r_l, r_h);
593
- b_l = __lsx_vsrli_h(b_l, 4);
594
- b_h = __lsx_vsrli_h(b_h, 4);
595
- r_l = __lsx_vsrli_h(r_l, 4);
596
- r_h = __lsx_vsrli_h(r_h, 4);
597
- g_l = __lsx_vand_v(g_l, mask);
598
- g_h = __lsx_vand_v(g_h, mask);
599
- r_l = __lsx_vslli_h(r_l, 8);
600
- r_h = __lsx_vslli_h(r_h, 8);
601
- r_l = __lsx_vor_v(r_l, alpha);
602
- r_h = __lsx_vor_v(r_h, alpha);
603
- r_l = __lsx_vor_v(r_l, g_l);
604
- r_h = __lsx_vor_v(r_h, g_h);
605
- r_l = __lsx_vor_v(r_l, b_l);
606
- r_h = __lsx_vor_v(r_h, b_h);
607
- __lsx_vst(r_l, dst_argb4444, 0);
608
- __lsx_vst(r_h, dst_argb4444, 16);
609
- dst_argb4444 += 32;
610
- src_y += 16;
611
- src_u += 8;
612
- src_v += 8;
613
- }
614
- }
615
-
616
- void I422ToARGB1555Row_LSX(const uint8_t* src_y,
617
- const uint8_t* src_u,
618
- const uint8_t* src_v,
619
- uint8_t* dst_argb1555,
620
- const struct YuvConstants* yuvconstants,
621
- int width) {
622
- int x;
623
- int len = width / 16;
624
- __m128i vec_yb, vec_yg, vec_ub, vec_vr, vec_ug, vec_vg;
625
- __m128i vec_ubvr, vec_ugvg;
626
- __m128i const_80 = __lsx_vldi(0x80);
627
- __m128i alpha = (__m128i)v2u64{0x8000800080008000, 0x8000800080008000};
628
-
629
- YUVTORGB_SETUP(yuvconstants, vec_vr, vec_ub, vec_vg, vec_ug, vec_yg, vec_yb);
630
- vec_ubvr = __lsx_vilvl_h(vec_ub, vec_vr);
631
- vec_ugvg = __lsx_vilvl_h(vec_ug, vec_vg);
632
-
633
- for (x = 0; x < len; x++) {
634
- __m128i y, uv_l, uv_h, b_l, b_h, g_l, g_h, r_l, r_h;
635
-
636
- READYUV422_D(src_y, src_u, src_v, y, uv_l, uv_h);
637
- YUVTORGB_D(y, uv_l, uv_h, vec_ubvr, vec_ugvg, vec_yg, vec_yb, b_l, b_h, g_l,
638
- g_h, r_l, r_h);
639
- b_l = __lsx_vsrli_h(b_l, 3);
640
- b_h = __lsx_vsrli_h(b_h, 3);
641
- g_l = __lsx_vsrli_h(g_l, 3);
642
-
643
- g_h = __lsx_vsrli_h(g_h, 3);
644
- g_l = __lsx_vslli_h(g_l, 5);
645
- g_h = __lsx_vslli_h(g_h, 5);
646
- r_l = __lsx_vsrli_h(r_l, 3);
647
- r_h = __lsx_vsrli_h(r_h, 3);
648
- r_l = __lsx_vslli_h(r_l, 10);
649
- r_h = __lsx_vslli_h(r_h, 10);
650
- r_l = __lsx_vor_v(r_l, alpha);
651
- r_h = __lsx_vor_v(r_h, alpha);
652
- r_l = __lsx_vor_v(r_l, g_l);
653
- r_h = __lsx_vor_v(r_h, g_h);
654
- r_l = __lsx_vor_v(r_l, b_l);
655
- r_h = __lsx_vor_v(r_h, b_h);
656
- __lsx_vst(r_l, dst_argb1555, 0);
657
- __lsx_vst(r_h, dst_argb1555, 16);
658
- dst_argb1555 += 32;
659
- src_y += 16;
660
- src_u += 8;
661
- src_v += 8;
662
- }
663
- }
664
-
665
- void YUY2ToYRow_LSX(const uint8_t* src_yuy2, uint8_t* dst_y, int width) {
666
- int x;
667
- int len = width / 16;
668
- __m128i src0, src1, dst0;
669
-
670
- for (x = 0; x < len; x++) {
671
- DUP2_ARG2(__lsx_vld, src_yuy2, 0, src_yuy2, 16, src0, src1);
672
- dst0 = __lsx_vpickev_b(src1, src0);
673
- __lsx_vst(dst0, dst_y, 0);
674
- src_yuy2 += 32;
675
- dst_y += 16;
676
- }
677
- }
678
-
679
- void YUY2ToUVRow_LSX(const uint8_t* src_yuy2,
680
- int src_stride_yuy2,
681
- uint8_t* dst_u,
682
- uint8_t* dst_v,
683
- int width) {
684
- const uint8_t* src_yuy2_next = src_yuy2 + src_stride_yuy2;
685
- int x;
686
- int len = width / 16;
687
- __m128i src0, src1, src2, src3;
688
- __m128i tmp0, dst0, dst1;
689
-
690
- for (x = 0; x < len; x++) {
691
- DUP4_ARG2(__lsx_vld, src_yuy2, 0, src_yuy2, 16, src_yuy2_next, 0,
692
- src_yuy2_next, 16, src0, src1, src2, src3);
693
- src0 = __lsx_vpickod_b(src1, src0);
694
- src1 = __lsx_vpickod_b(src3, src2);
695
- tmp0 = __lsx_vavgr_bu(src1, src0);
696
- dst0 = __lsx_vpickev_b(tmp0, tmp0);
697
- dst1 = __lsx_vpickod_b(tmp0, tmp0);
698
- __lsx_vstelm_d(dst0, dst_u, 0, 0);
699
- __lsx_vstelm_d(dst1, dst_v, 0, 0);
700
- src_yuy2 += 32;
701
- src_yuy2_next += 32;
702
- dst_u += 8;
703
- dst_v += 8;
704
- }
705
- }
706
-
707
- void YUY2ToUV422Row_LSX(const uint8_t* src_yuy2,
708
- uint8_t* dst_u,
709
- uint8_t* dst_v,
710
- int width) {
711
- int x;
712
- int len = width / 16;
713
- __m128i src0, src1, tmp0, dst0, dst1;
714
-
715
- for (x = 0; x < len; x++) {
716
- DUP2_ARG2(__lsx_vld, src_yuy2, 0, src_yuy2, 16, src0, src1);
717
- tmp0 = __lsx_vpickod_b(src1, src0);
718
- dst0 = __lsx_vpickev_b(tmp0, tmp0);
719
- dst1 = __lsx_vpickod_b(tmp0, tmp0);
720
- __lsx_vstelm_d(dst0, dst_u, 0, 0);
721
- __lsx_vstelm_d(dst1, dst_v, 0, 0);
722
- src_yuy2 += 32;
723
- dst_u += 8;
724
- dst_v += 8;
725
- }
726
- }
727
-
728
- void UYVYToYRow_LSX(const uint8_t* src_uyvy, uint8_t* dst_y, int width) {
729
- int x;
730
- int len = width / 16;
731
- __m128i src0, src1, dst0;
732
-
733
- for (x = 0; x < len; x++) {
734
- DUP2_ARG2(__lsx_vld, src_uyvy, 0, src_uyvy, 16, src0, src1);
735
- dst0 = __lsx_vpickod_b(src1, src0);
736
- __lsx_vst(dst0, dst_y, 0);
737
- src_uyvy += 32;
738
- dst_y += 16;
739
- }
740
- }
741
-
742
- void UYVYToUVRow_LSX(const uint8_t* src_uyvy,
743
- int src_stride_uyvy,
744
- uint8_t* dst_u,
745
- uint8_t* dst_v,
746
- int width) {
747
- const uint8_t* src_uyvy_next = src_uyvy + src_stride_uyvy;
748
- int x;
749
- int len = width / 16;
750
- __m128i src0, src1, src2, src3, tmp0, dst0, dst1;
751
-
752
- for (x = 0; x < len; x++) {
753
- DUP4_ARG2(__lsx_vld, src_uyvy, 0, src_uyvy, 16, src_uyvy_next, 0,
754
- src_uyvy_next, 16, src0, src1, src2, src3);
755
- src0 = __lsx_vpickev_b(src1, src0);
756
- src1 = __lsx_vpickev_b(src3, src2);
757
- tmp0 = __lsx_vavgr_bu(src1, src0);
758
- dst0 = __lsx_vpickev_b(tmp0, tmp0);
759
- dst1 = __lsx_vpickod_b(tmp0, tmp0);
760
- __lsx_vstelm_d(dst0, dst_u, 0, 0);
761
- __lsx_vstelm_d(dst1, dst_v, 0, 0);
762
- src_uyvy += 32;
763
- src_uyvy_next += 32;
764
- dst_u += 8;
765
- dst_v += 8;
766
- }
767
- }
768
-
769
- void UYVYToUV422Row_LSX(const uint8_t* src_uyvy,
770
- uint8_t* dst_u,
771
- uint8_t* dst_v,
772
- int width) {
773
- int x;
774
- int len = width / 16;
775
- __m128i src0, src1, tmp0, dst0, dst1;
776
-
777
- for (x = 0; x < len; x++) {
778
- DUP2_ARG2(__lsx_vld, src_uyvy, 0, src_uyvy, 16, src0, src1);
779
- tmp0 = __lsx_vpickev_b(src1, src0);
780
- dst0 = __lsx_vpickev_b(tmp0, tmp0);
781
- dst1 = __lsx_vpickod_b(tmp0, tmp0);
782
- __lsx_vstelm_d(dst0, dst_u, 0, 0);
783
- __lsx_vstelm_d(dst1, dst_v, 0, 0);
784
- src_uyvy += 32;
785
- dst_u += 8;
786
- dst_v += 8;
787
- }
788
- }
789
-
790
- void ARGBToUVRow_LSX(const uint8_t* src_argb0,
791
- int src_stride_argb,
792
- uint8_t* dst_u,
793
- uint8_t* dst_v,
794
- int width) {
795
- int x;
796
- int len = width / 16;
797
- const uint8_t* src_argb1 = src_argb0 + src_stride_argb;
798
-
799
- __m128i src0, src1, src2, src3, src4, src5, src6, src7;
800
- __m128i vec0, vec1, vec2, vec3;
801
- __m128i tmp0, tmp1, tmp2, tmp3, tmp4, tmp5, dst0, dst1;
802
- __m128i const_0x70 = __lsx_vldi(0x470);
803
- __m128i const_0x4A = __lsx_vldi(0x44A);
804
- __m128i const_0x26 = __lsx_vldi(0x426);
805
- __m128i const_0x5E = __lsx_vldi(0x45E);
806
- __m128i const_0x12 = __lsx_vldi(0x412);
807
- __m128i const_0x8000 = (__m128i)v2u64{0x8000800080008000, 0x8000800080008000};
808
- for (x = 0; x < len; x++) {
809
- DUP4_ARG2(__lsx_vld, src_argb0, 0, src_argb0, 16, src_argb0, 32, src_argb0,
810
- 48, src0, src1, src2, src3);
811
- DUP4_ARG2(__lsx_vld, src_argb1, 0, src_argb1, 16, src_argb1, 32, src_argb1,
812
- 48, src4, src5, src6, src7);
813
- vec0 = __lsx_vaddwev_h_bu(src0, src4);
814
- vec1 = __lsx_vaddwev_h_bu(src1, src5);
815
- vec2 = __lsx_vaddwev_h_bu(src2, src6);
816
- vec3 = __lsx_vaddwev_h_bu(src3, src7);
817
- tmp0 = __lsx_vpickev_h(vec1, vec0);
818
- tmp1 = __lsx_vpickev_h(vec3, vec2);
819
- tmp2 = __lsx_vpickod_h(vec1, vec0);
820
- tmp3 = __lsx_vpickod_h(vec3, vec2);
821
- vec0 = __lsx_vaddwod_h_bu(src0, src4);
822
- vec1 = __lsx_vaddwod_h_bu(src1, src5);
823
- vec2 = __lsx_vaddwod_h_bu(src2, src6);
824
- vec3 = __lsx_vaddwod_h_bu(src3, src7);
825
- tmp4 = __lsx_vpickev_h(vec1, vec0);
826
- tmp5 = __lsx_vpickev_h(vec3, vec2);
827
- vec0 = __lsx_vpickev_h(tmp1, tmp0);
828
- vec1 = __lsx_vpickod_h(tmp1, tmp0);
829
- src0 = __lsx_vadd_h(vec0, vec1);
830
- src0 = __lsx_vsrari_h(src0, 2);
831
- vec0 = __lsx_vpickev_h(tmp3, tmp2);
832
- vec1 = __lsx_vpickod_h(tmp3, tmp2);
833
- src1 = __lsx_vadd_h(vec0, vec1);
834
- src1 = __lsx_vsrari_h(src1, 2);
835
- vec0 = __lsx_vpickev_h(tmp5, tmp4);
836
- vec1 = __lsx_vpickod_h(tmp5, tmp4);
837
- src2 = __lsx_vadd_h(vec0, vec1);
838
- src2 = __lsx_vsrari_h(src2, 2);
839
- dst0 = __lsx_vmadd_h(const_0x8000, src0, const_0x70);
840
- dst0 = __lsx_vmsub_h(dst0, src2, const_0x4A);
841
- dst0 = __lsx_vmsub_h(dst0, src1, const_0x26);
842
- dst1 = __lsx_vmadd_h(const_0x8000, src1, const_0x70);
843
- dst1 = __lsx_vmsub_h(dst1, src2, const_0x5E);
844
- dst1 = __lsx_vmsub_h(dst1, src0, const_0x12);
845
- dst0 = __lsx_vsrai_h(dst0, 8);
846
- dst1 = __lsx_vsrai_h(dst1, 8);
847
- dst0 = __lsx_vpickev_b(dst1, dst0);
848
- __lsx_vstelm_d(dst0, dst_u, 0, 0);
849
- __lsx_vstelm_d(dst0, dst_v, 0, 1);
850
- src_argb0 += 64;
851
- src_argb1 += 64;
852
- dst_u += 8;
853
- dst_v += 8;
854
- }
855
- }
856
-
857
- void ARGBToRGB24Row_LSX(const uint8_t* src_argb, uint8_t* dst_rgb, int width) {
858
- int x;
859
- int len = (width / 16) - 1;
860
- __m128i src0, src1, src2, src3;
861
- __m128i tmp0, tmp1, tmp2, tmp3;
862
- __m128i shuf = {0x0908060504020100, 0x000000000E0D0C0A};
863
- for (x = 0; x < len; x++) {
864
- DUP4_ARG2(__lsx_vld, src_argb, 0, src_argb, 16, src_argb, 32, src_argb, 48,
865
- src0, src1, src2, src3);
866
- tmp0 = __lsx_vshuf_b(src0, src0, shuf);
867
- tmp1 = __lsx_vshuf_b(src1, src1, shuf);
868
- tmp2 = __lsx_vshuf_b(src2, src2, shuf);
869
- tmp3 = __lsx_vshuf_b(src3, src3, shuf);
870
- __lsx_vst(tmp0, dst_rgb, 0);
871
- __lsx_vst(tmp1, dst_rgb, 12);
872
- __lsx_vst(tmp2, dst_rgb, 24);
873
- __lsx_vst(tmp3, dst_rgb, 36);
874
- dst_rgb += 48;
875
- src_argb += 64;
876
- }
877
- DUP4_ARG2(__lsx_vld, src_argb, 0, src_argb, 16, src_argb, 32, src_argb, 48,
878
- src0, src1, src2, src3);
879
- tmp0 = __lsx_vshuf_b(src0, src0, shuf);
880
- tmp1 = __lsx_vshuf_b(src1, src1, shuf);
881
- tmp2 = __lsx_vshuf_b(src2, src2, shuf);
882
- tmp3 = __lsx_vshuf_b(src3, src3, shuf);
883
- __lsx_vst(tmp0, dst_rgb, 0);
884
- __lsx_vst(tmp1, dst_rgb, 12);
885
- __lsx_vst(tmp2, dst_rgb, 24);
886
- dst_rgb += 36;
887
- __lsx_vst(tmp3, dst_rgb, 0);
888
- }
889
-
890
- void ARGBToRAWRow_LSX(const uint8_t* src_argb, uint8_t* dst_rgb, int width) {
891
- int x;
892
- int len = (width / 16) - 1;
893
- __m128i src0, src1, src2, src3;
894
- __m128i tmp0, tmp1, tmp2, tmp3;
895
- __m128i shuf = {0x090A040506000102, 0x000000000C0D0E08};
896
- for (x = 0; x < len; x++) {
897
- DUP4_ARG2(__lsx_vld, src_argb, 0, src_argb, 16, src_argb, 32, src_argb, 48,
898
- src0, src1, src2, src3);
899
- tmp0 = __lsx_vshuf_b(src0, src0, shuf);
900
- tmp1 = __lsx_vshuf_b(src1, src1, shuf);
901
- tmp2 = __lsx_vshuf_b(src2, src2, shuf);
902
- tmp3 = __lsx_vshuf_b(src3, src3, shuf);
903
- __lsx_vst(tmp0, dst_rgb, 0);
904
- __lsx_vst(tmp1, dst_rgb, 12);
905
- __lsx_vst(tmp2, dst_rgb, 24);
906
- __lsx_vst(tmp3, dst_rgb, 36);
907
- dst_rgb += 48;
908
- src_argb += 64;
909
- }
910
- DUP4_ARG2(__lsx_vld, src_argb, 0, src_argb, 16, src_argb, 32, src_argb, 48,
911
- src0, src1, src2, src3);
912
- tmp0 = __lsx_vshuf_b(src0, src0, shuf);
913
- tmp1 = __lsx_vshuf_b(src1, src1, shuf);
914
- tmp2 = __lsx_vshuf_b(src2, src2, shuf);
915
- tmp3 = __lsx_vshuf_b(src3, src3, shuf);
916
- __lsx_vst(tmp0, dst_rgb, 0);
917
- __lsx_vst(tmp1, dst_rgb, 12);
918
- __lsx_vst(tmp2, dst_rgb, 24);
919
- dst_rgb += 36;
920
- __lsx_vst(tmp3, dst_rgb, 0);
921
- }
922
-
923
- void ARGBToRGB565Row_LSX(const uint8_t* src_argb, uint8_t* dst_rgb, int width) {
924
- int x;
925
- int len = width / 8;
926
- __m128i zero = __lsx_vldi(0);
927
- __m128i src0, src1, tmp0, tmp1, dst0;
928
- __m128i shift = {0x0300030003000300, 0x0300030003000300};
929
-
930
- for (x = 0; x < len; x++) {
931
- DUP2_ARG2(__lsx_vld, src_argb, 0, src_argb, 16, src0, src1);
932
- tmp0 = __lsx_vpickev_b(src1, src0);
933
- tmp1 = __lsx_vpickod_b(src1, src0);
934
- tmp0 = __lsx_vsrli_b(tmp0, 3);
935
- tmp1 = __lsx_vpackev_b(zero, tmp1);
936
- tmp1 = __lsx_vsrli_h(tmp1, 2);
937
- tmp0 = __lsx_vsll_b(tmp0, shift);
938
- tmp1 = __lsx_vslli_h(tmp1, 5);
939
- dst0 = __lsx_vor_v(tmp0, tmp1);
940
- __lsx_vst(dst0, dst_rgb, 0);
941
- dst_rgb += 16;
942
- src_argb += 32;
943
- }
944
- }
945
-
946
- void ARGBToARGB1555Row_LSX(const uint8_t* src_argb,
947
- uint8_t* dst_rgb,
948
- int width) {
949
- int x;
950
- int len = width / 8;
951
- __m128i zero = __lsx_vldi(0);
952
- __m128i src0, src1, tmp0, tmp1, tmp2, tmp3, dst0;
953
- __m128i shift1 = {0x0703070307030703, 0x0703070307030703};
954
- __m128i shift2 = {0x0200020002000200, 0x0200020002000200};
955
-
956
- for (x = 0; x < len; x++) {
957
- DUP2_ARG2(__lsx_vld, src_argb, 0, src_argb, 16, src0, src1);
958
- tmp0 = __lsx_vpickev_b(src1, src0);
959
- tmp1 = __lsx_vpickod_b(src1, src0);
960
- tmp0 = __lsx_vsrli_b(tmp0, 3);
961
- tmp1 = __lsx_vsrl_b(tmp1, shift1);
962
- tmp0 = __lsx_vsll_b(tmp0, shift2);
963
- tmp2 = __lsx_vpackev_b(zero, tmp1);
964
- tmp3 = __lsx_vpackod_b(zero, tmp1);
965
- tmp2 = __lsx_vslli_h(tmp2, 5);
966
- tmp3 = __lsx_vslli_h(tmp3, 15);
967
- dst0 = __lsx_vor_v(tmp0, tmp2);
968
- dst0 = __lsx_vor_v(dst0, tmp3);
969
- __lsx_vst(dst0, dst_rgb, 0);
970
- dst_rgb += 16;
971
- src_argb += 32;
972
- }
973
- }
974
-
975
- void ARGBToARGB4444Row_LSX(const uint8_t* src_argb,
976
- uint8_t* dst_rgb,
977
- int width) {
978
- int x;
979
- int len = width / 8;
980
- __m128i src0, src1, tmp0, tmp1, dst0;
981
-
982
- for (x = 0; x < len; x++) {
983
- DUP2_ARG2(__lsx_vld, src_argb, 0, src_argb, 16, src0, src1);
984
- tmp0 = __lsx_vpickev_b(src1, src0);
985
- tmp1 = __lsx_vpickod_b(src1, src0);
986
- tmp1 = __lsx_vandi_b(tmp1, 0xF0);
987
- tmp0 = __lsx_vsrli_b(tmp0, 4);
988
- dst0 = __lsx_vor_v(tmp1, tmp0);
989
- __lsx_vst(dst0, dst_rgb, 0);
990
- dst_rgb += 16;
991
- src_argb += 32;
992
- }
993
- }
994
-
995
- void ARGBToUV444Row_LSX(const uint8_t* src_argb,
996
- uint8_t* dst_u,
997
- uint8_t* dst_v,
998
- int32_t width) {
999
- int x;
1000
- int len = width / 16;
1001
- __m128i src0, src1, src2, src3;
1002
- __m128i tmp0, tmp1, tmp2, tmp3;
1003
- __m128i reg0, reg1, reg2, reg3, dst0, dst1;
1004
- __m128i const_112 = __lsx_vldi(112);
1005
- __m128i const_74 = __lsx_vldi(74);
1006
- __m128i const_38 = __lsx_vldi(38);
1007
- __m128i const_94 = __lsx_vldi(94);
1008
- __m128i const_18 = __lsx_vldi(18);
1009
- __m128i const_0x8000 = (__m128i)v2u64{0x8000800080008000, 0x8000800080008000};
1010
- for (x = 0; x < len; x++) {
1011
- DUP4_ARG2(__lsx_vld, src_argb, 0, src_argb, 16, src_argb, 32, src_argb, 48,
1012
- src0, src1, src2, src3);
1013
- tmp0 = __lsx_vpickev_h(src1, src0);
1014
- tmp1 = __lsx_vpickod_h(src1, src0);
1015
- tmp2 = __lsx_vpickev_h(src3, src2);
1016
- tmp3 = __lsx_vpickod_h(src3, src2);
1017
- reg0 = __lsx_vmaddwev_h_bu(const_0x8000, tmp0, const_112);
1018
- reg1 = __lsx_vmaddwev_h_bu(const_0x8000, tmp2, const_112);
1019
- reg2 = __lsx_vmulwod_h_bu(tmp0, const_74);
1020
- reg3 = __lsx_vmulwod_h_bu(tmp2, const_74);
1021
- reg2 = __lsx_vmaddwev_h_bu(reg2, tmp1, const_38);
1022
- reg3 = __lsx_vmaddwev_h_bu(reg3, tmp3, const_38);
1023
- reg0 = __lsx_vsub_h(reg0, reg2);
1024
- reg1 = __lsx_vsub_h(reg1, reg3);
1025
- reg0 = __lsx_vsrai_h(reg0, 8);
1026
- reg1 = __lsx_vsrai_h(reg1, 8);
1027
- dst0 = __lsx_vpickev_b(reg1, reg0);
1028
-
1029
- reg0 = __lsx_vmaddwev_h_bu(const_0x8000, tmp1, const_112);
1030
- reg1 = __lsx_vmaddwev_h_bu(const_0x8000, tmp3, const_112);
1031
- reg2 = __lsx_vmulwev_h_bu(tmp0, const_18);
1032
- reg3 = __lsx_vmulwev_h_bu(tmp2, const_18);
1033
- reg2 = __lsx_vmaddwod_h_bu(reg2, tmp0, const_94);
1034
- reg3 = __lsx_vmaddwod_h_bu(reg3, tmp2, const_94);
1035
- reg0 = __lsx_vsub_h(reg0, reg2);
1036
- reg1 = __lsx_vsub_h(reg1, reg3);
1037
- reg0 = __lsx_vsrai_h(reg0, 8);
1038
- reg1 = __lsx_vsrai_h(reg1, 8);
1039
- dst1 = __lsx_vpickev_b(reg1, reg0);
1040
-
1041
- __lsx_vst(dst0, dst_u, 0);
1042
- __lsx_vst(dst1, dst_v, 0);
1043
- dst_u += 16;
1044
- dst_v += 16;
1045
- src_argb += 64;
1046
- }
1047
- }
1048
-
1049
- void ARGBMultiplyRow_LSX(const uint8_t* src_argb0,
1050
- const uint8_t* src_argb1,
1051
- uint8_t* dst_argb,
1052
- int width) {
1053
- int x;
1054
- int len = width / 4;
1055
- __m128i zero = __lsx_vldi(0);
1056
- __m128i src0, src1, dst0, dst1;
1057
- __m128i tmp0, tmp1, tmp2, tmp3;
1058
-
1059
- for (x = 0; x < len; x++) {
1060
- DUP2_ARG2(__lsx_vld, src_argb0, 0, src_argb1, 0, src0, src1);
1061
- tmp0 = __lsx_vilvl_b(src0, src0);
1062
- tmp1 = __lsx_vilvh_b(src0, src0);
1063
- tmp2 = __lsx_vilvl_b(zero, src1);
1064
- tmp3 = __lsx_vilvh_b(zero, src1);
1065
- dst0 = __lsx_vmuh_hu(tmp0, tmp2);
1066
- dst1 = __lsx_vmuh_hu(tmp1, tmp3);
1067
- dst0 = __lsx_vpickev_b(dst1, dst0);
1068
- __lsx_vst(dst0, dst_argb, 0);
1069
- src_argb0 += 16;
1070
- src_argb1 += 16;
1071
- dst_argb += 16;
1072
- }
1073
- }
1074
-
1075
- void ARGBAddRow_LSX(const uint8_t* src_argb0,
1076
- const uint8_t* src_argb1,
1077
- uint8_t* dst_argb,
1078
- int width) {
1079
- int x;
1080
- int len = width / 4;
1081
- __m128i src0, src1, dst0;
1082
-
1083
- for (x = 0; x < len; x++) {
1084
- DUP2_ARG2(__lsx_vld, src_argb0, 0, src_argb1, 0, src0, src1);
1085
- dst0 = __lsx_vsadd_bu(src0, src1);
1086
- __lsx_vst(dst0, dst_argb, 0);
1087
- src_argb0 += 16;
1088
- src_argb1 += 16;
1089
- dst_argb += 16;
1090
- }
1091
- }
1092
-
1093
- void ARGBSubtractRow_LSX(const uint8_t* src_argb0,
1094
- const uint8_t* src_argb1,
1095
- uint8_t* dst_argb,
1096
- int width) {
1097
- int x;
1098
- int len = width / 4;
1099
- __m128i src0, src1, dst0;
1100
-
1101
- for (x = 0; x < len; x++) {
1102
- DUP2_ARG2(__lsx_vld, src_argb0, 0, src_argb1, 0, src0, src1);
1103
- dst0 = __lsx_vssub_bu(src0, src1);
1104
- __lsx_vst(dst0, dst_argb, 0);
1105
- src_argb0 += 16;
1106
- src_argb1 += 16;
1107
- dst_argb += 16;
1108
- }
1109
- }
1110
-
1111
- void ARGBAttenuateRow_LSX(const uint8_t* src_argb,
1112
- uint8_t* dst_argb,
1113
- int width) {
1114
- int x;
1115
- int len = width / 8;
1116
- __m128i src0, src1, tmp0, tmp1;
1117
- __m128i reg0, reg1, reg2, reg3, reg4, reg5;
1118
- __m128i b, g, r, a, dst0, dst1;
1119
- __m128i control = {0x0005000100040000, 0x0007000300060002};
1120
- __m128i zero = __lsx_vldi(0);
1121
- __m128i const_add = __lsx_vldi(0x8ff);
1122
-
1123
- for (x = 0; x < len; x++) {
1124
- DUP2_ARG2(__lsx_vld, src_argb, 0, src_argb, 16, src0, src1);
1125
- tmp0 = __lsx_vpickev_b(src1, src0);
1126
- tmp1 = __lsx_vpickod_b(src1, src0);
1127
- b = __lsx_vpackev_b(zero, tmp0);
1128
- r = __lsx_vpackod_b(zero, tmp0);
1129
- g = __lsx_vpackev_b(zero, tmp1);
1130
- a = __lsx_vpackod_b(zero, tmp1);
1131
- reg0 = __lsx_vmaddwev_w_hu(const_add, b, a);
1132
- reg1 = __lsx_vmaddwod_w_hu(const_add, b, a);
1133
- reg2 = __lsx_vmaddwev_w_hu(const_add, r, a);
1134
- reg3 = __lsx_vmaddwod_w_hu(const_add, r, a);
1135
- reg4 = __lsx_vmaddwev_w_hu(const_add, g, a);
1136
- reg5 = __lsx_vmaddwod_w_hu(const_add, g, a);
1137
- reg0 = __lsx_vssrani_h_w(reg1, reg0, 8);
1138
- reg2 = __lsx_vssrani_h_w(reg3, reg2, 8);
1139
- reg4 = __lsx_vssrani_h_w(reg5, reg4, 8);
1140
- reg0 = __lsx_vshuf_h(control, reg0, reg0);
1141
- reg2 = __lsx_vshuf_h(control, reg2, reg2);
1142
- reg4 = __lsx_vshuf_h(control, reg4, reg4);
1143
- tmp0 = __lsx_vpackev_b(reg4, reg0);
1144
- tmp1 = __lsx_vpackev_b(a, reg2);
1145
- dst0 = __lsx_vilvl_h(tmp1, tmp0);
1146
- dst1 = __lsx_vilvh_h(tmp1, tmp0);
1147
- __lsx_vst(dst0, dst_argb, 0);
1148
- __lsx_vst(dst1, dst_argb, 16);
1149
- dst_argb += 32;
1150
- src_argb += 32;
1151
- }
1152
- }
1153
-
1154
- void ARGBToRGB565DitherRow_LSX(const uint8_t* src_argb,
1155
- uint8_t* dst_rgb,
1156
- uint32_t dither4,
1157
- int width) {
1158
- int x;
1159
- int len = width / 8;
1160
- __m128i src0, src1, tmp0, tmp1, dst0;
1161
- __m128i b, g, r;
1162
- __m128i zero = __lsx_vldi(0);
1163
- __m128i vec_dither = __lsx_vldrepl_w(&dither4, 0);
1164
-
1165
- vec_dither = __lsx_vilvl_b(zero, vec_dither);
1166
- for (x = 0; x < len; x++) {
1167
- DUP2_ARG2(__lsx_vld, src_argb, 0, src_argb, 16, src0, src1);
1168
- tmp0 = __lsx_vpickev_b(src1, src0);
1169
- tmp1 = __lsx_vpickod_b(src1, src0);
1170
- b = __lsx_vpackev_b(zero, tmp0);
1171
- r = __lsx_vpackod_b(zero, tmp0);
1172
- g = __lsx_vpackev_b(zero, tmp1);
1173
- b = __lsx_vadd_h(b, vec_dither);
1174
- g = __lsx_vadd_h(g, vec_dither);
1175
- r = __lsx_vadd_h(r, vec_dither);
1176
- DUP2_ARG1(__lsx_vclip255_h, b, g, b, g);
1177
- r = __lsx_vclip255_h(r);
1178
- b = __lsx_vsrai_h(b, 3);
1179
- g = __lsx_vsrai_h(g, 2);
1180
- r = __lsx_vsrai_h(r, 3);
1181
- g = __lsx_vslli_h(g, 5);
1182
- r = __lsx_vslli_h(r, 11);
1183
- dst0 = __lsx_vor_v(b, g);
1184
- dst0 = __lsx_vor_v(dst0, r);
1185
- __lsx_vst(dst0, dst_rgb, 0);
1186
- src_argb += 32;
1187
- dst_rgb += 16;
1188
- }
1189
- }
1190
-
1191
- void ARGBShuffleRow_LSX(const uint8_t* src_argb,
1192
- uint8_t* dst_argb,
1193
- const uint8_t* shuffler,
1194
- int width) {
1195
- int x;
1196
- int len = width / 8;
1197
- __m128i src0, src1, dst0, dst1;
1198
- __m128i shuf = {0x0404040400000000, 0x0C0C0C0C08080808};
1199
- __m128i temp = __lsx_vldrepl_w(shuffler, 0);
1200
-
1201
- shuf = __lsx_vadd_b(shuf, temp);
1202
- for (x = 0; x < len; x++) {
1203
- DUP2_ARG2(__lsx_vld, src_argb, 0, src_argb, 16, src0, src1);
1204
- dst0 = __lsx_vshuf_b(src0, src0, shuf);
1205
- dst1 = __lsx_vshuf_b(src1, src1, shuf);
1206
- __lsx_vst(dst0, dst_argb, 0);
1207
- __lsx_vst(dst1, dst_argb, 16);
1208
- src_argb += 32;
1209
- dst_argb += 32;
1210
- }
1211
- }
1212
-
1213
- void ARGBShadeRow_LSX(const uint8_t* src_argb,
1214
- uint8_t* dst_argb,
1215
- int width,
1216
- uint32_t value) {
1217
- int x;
1218
- int len = width / 4;
1219
- __m128i src0, dst0, tmp0, tmp1;
1220
- __m128i vec_value = __lsx_vreplgr2vr_w(value);
1221
-
1222
- vec_value = __lsx_vilvl_b(vec_value, vec_value);
1223
- for (x = 0; x < len; x++) {
1224
- src0 = __lsx_vld(src_argb, 0);
1225
- tmp0 = __lsx_vilvl_b(src0, src0);
1226
- tmp1 = __lsx_vilvh_b(src0, src0);
1227
- tmp0 = __lsx_vmuh_hu(tmp0, vec_value);
1228
- tmp1 = __lsx_vmuh_hu(tmp1, vec_value);
1229
- dst0 = __lsx_vpickod_b(tmp1, tmp0);
1230
- __lsx_vst(dst0, dst_argb, 0);
1231
- src_argb += 16;
1232
- dst_argb += 16;
1233
- }
1234
- }
1235
-
1236
- void ARGBGrayRow_LSX(const uint8_t* src_argb, uint8_t* dst_argb, int width) {
1237
- int x;
1238
- int len = width / 8;
1239
- __m128i src0, src1, tmp0, tmp1;
1240
- __m128i reg0, reg1, reg2, dst0, dst1;
1241
- __m128i const_128 = __lsx_vldi(0x480);
1242
- __m128i const_150 = __lsx_vldi(0x96);
1243
- __m128i const_br = {0x4D1D4D1D4D1D4D1D, 0x4D1D4D1D4D1D4D1D};
1244
-
1245
- for (x = 0; x < len; x++) {
1246
- DUP2_ARG2(__lsx_vld, src_argb, 0, src_argb, 16, src0, src1);
1247
- tmp0 = __lsx_vpickev_b(src1, src0);
1248
- tmp1 = __lsx_vpickod_b(src1, src0);
1249
- reg0 = __lsx_vdp2_h_bu(tmp0, const_br);
1250
- reg1 = __lsx_vmaddwev_h_bu(const_128, tmp1, const_150);
1251
- reg2 = __lsx_vadd_h(reg0, reg1);
1252
- tmp0 = __lsx_vpackod_b(reg2, reg2);
1253
- tmp1 = __lsx_vpackod_b(tmp1, reg2);
1254
- dst0 = __lsx_vilvl_h(tmp1, tmp0);
1255
- dst1 = __lsx_vilvh_h(tmp1, tmp0);
1256
- __lsx_vst(dst0, dst_argb, 0);
1257
- __lsx_vst(dst1, dst_argb, 16);
1258
- src_argb += 32;
1259
- dst_argb += 32;
1260
- }
1261
- }
1262
-
1263
- void ARGBSepiaRow_LSX(uint8_t* dst_argb, int width) {
1264
- int x;
1265
- int len = width / 8;
1266
- __m128i src0, src1, tmp0, tmp1;
1267
- __m128i reg0, reg1, spb, spg, spr;
1268
- __m128i dst0, dst1;
1269
- __m128i spb_g = __lsx_vldi(68);
1270
- __m128i spg_g = __lsx_vldi(88);
1271
- __m128i spr_g = __lsx_vldi(98);
1272
- __m128i spb_br = {0x2311231123112311, 0x2311231123112311};
1273
- __m128i spg_br = {0x2D162D162D162D16, 0x2D162D162D162D16};
1274
- __m128i spr_br = {0x3218321832183218, 0x3218321832183218};
1275
- __m128i shuff = {0x1706150413021100, 0x1F0E1D0C1B0A1908};
1276
-
1277
- for (x = 0; x < len; x++) {
1278
- DUP2_ARG2(__lsx_vld, dst_argb, 0, dst_argb, 16, src0, src1);
1279
- tmp0 = __lsx_vpickev_b(src1, src0);
1280
- tmp1 = __lsx_vpickod_b(src1, src0);
1281
- DUP2_ARG2(__lsx_vdp2_h_bu, tmp0, spb_br, tmp0, spg_br, spb, spg);
1282
- spr = __lsx_vdp2_h_bu(tmp0, spr_br);
1283
- spb = __lsx_vmaddwev_h_bu(spb, tmp1, spb_g);
1284
- spg = __lsx_vmaddwev_h_bu(spg, tmp1, spg_g);
1285
- spr = __lsx_vmaddwev_h_bu(spr, tmp1, spr_g);
1286
- spb = __lsx_vsrli_h(spb, 7);
1287
- spg = __lsx_vsrli_h(spg, 7);
1288
- spr = __lsx_vsrli_h(spr, 7);
1289
- spg = __lsx_vsat_hu(spg, 7);
1290
- spr = __lsx_vsat_hu(spr, 7);
1291
- reg0 = __lsx_vpackev_b(spg, spb);
1292
- reg1 = __lsx_vshuf_b(tmp1, spr, shuff);
1293
- dst0 = __lsx_vilvl_h(reg1, reg0);
1294
- dst1 = __lsx_vilvh_h(reg1, reg0);
1295
- __lsx_vst(dst0, dst_argb, 0);
1296
- __lsx_vst(dst1, dst_argb, 16);
1297
- dst_argb += 32;
1298
- }
1299
- }
1300
-
1301
- void ARGB4444ToARGBRow_LSX(const uint8_t* src_argb4444,
1302
- uint8_t* dst_argb,
1303
- int width) {
1304
- int x;
1305
- int len = width / 16;
1306
- __m128i src0, src1;
1307
- __m128i tmp0, tmp1, tmp2, tmp3;
1308
- __m128i reg0, reg1, reg2, reg3;
1309
- __m128i dst0, dst1, dst2, dst3;
1310
-
1311
- for (x = 0; x < len; x++) {
1312
- src0 = __lsx_vld(src_argb4444, 0);
1313
- src1 = __lsx_vld(src_argb4444, 16);
1314
- tmp0 = __lsx_vandi_b(src0, 0x0F);
1315
- tmp1 = __lsx_vandi_b(src0, 0xF0);
1316
- tmp2 = __lsx_vandi_b(src1, 0x0F);
1317
- tmp3 = __lsx_vandi_b(src1, 0xF0);
1318
- reg0 = __lsx_vslli_b(tmp0, 4);
1319
- reg2 = __lsx_vslli_b(tmp2, 4);
1320
- reg1 = __lsx_vsrli_b(tmp1, 4);
1321
- reg3 = __lsx_vsrli_b(tmp3, 4);
1322
- DUP4_ARG2(__lsx_vor_v, tmp0, reg0, tmp1, reg1, tmp2, reg2, tmp3, reg3, tmp0,
1323
- tmp1, tmp2, tmp3);
1324
- dst0 = __lsx_vilvl_b(tmp1, tmp0);
1325
- dst2 = __lsx_vilvl_b(tmp3, tmp2);
1326
- dst1 = __lsx_vilvh_b(tmp1, tmp0);
1327
- dst3 = __lsx_vilvh_b(tmp3, tmp2);
1328
- __lsx_vst(dst0, dst_argb, 0);
1329
- __lsx_vst(dst1, dst_argb, 16);
1330
- __lsx_vst(dst2, dst_argb, 32);
1331
- __lsx_vst(dst3, dst_argb, 48);
1332
- dst_argb += 64;
1333
- src_argb4444 += 32;
1334
- }
1335
- }
1336
-
1337
- void ARGB1555ToARGBRow_LSX(const uint8_t* src_argb1555,
1338
- uint8_t* dst_argb,
1339
- int width) {
1340
- int x;
1341
- int len = width / 16;
1342
- __m128i src0, src1;
1343
- __m128i tmp0, tmp1, tmpb, tmpg, tmpr, tmpa;
1344
- __m128i reg0, reg1, reg2;
1345
- __m128i dst0, dst1, dst2, dst3;
1346
-
1347
- for (x = 0; x < len; x++) {
1348
- src0 = __lsx_vld(src_argb1555, 0);
1349
- src1 = __lsx_vld(src_argb1555, 16);
1350
- tmp0 = __lsx_vpickev_b(src1, src0);
1351
- tmp1 = __lsx_vpickod_b(src1, src0);
1352
- tmpb = __lsx_vandi_b(tmp0, 0x1F);
1353
- tmpg = __lsx_vsrli_b(tmp0, 5);
1354
- reg0 = __lsx_vandi_b(tmp1, 0x03);
1355
- reg0 = __lsx_vslli_b(reg0, 3);
1356
- tmpg = __lsx_vor_v(tmpg, reg0);
1357
- reg1 = __lsx_vandi_b(tmp1, 0x7C);
1358
- tmpr = __lsx_vsrli_b(reg1, 2);
1359
- tmpa = __lsx_vsrli_b(tmp1, 7);
1360
- tmpa = __lsx_vneg_b(tmpa);
1361
- reg0 = __lsx_vslli_b(tmpb, 3);
1362
- reg1 = __lsx_vslli_b(tmpg, 3);
1363
- reg2 = __lsx_vslli_b(tmpr, 3);
1364
- tmpb = __lsx_vsrli_b(tmpb, 2);
1365
- tmpg = __lsx_vsrli_b(tmpg, 2);
1366
- tmpr = __lsx_vsrli_b(tmpr, 2);
1367
- tmpb = __lsx_vor_v(reg0, tmpb);
1368
- tmpg = __lsx_vor_v(reg1, tmpg);
1369
- tmpr = __lsx_vor_v(reg2, tmpr);
1370
- DUP2_ARG2(__lsx_vilvl_b, tmpg, tmpb, tmpa, tmpr, reg0, reg1);
1371
- dst0 = __lsx_vilvl_h(reg1, reg0);
1372
- dst1 = __lsx_vilvh_h(reg1, reg0);
1373
- DUP2_ARG2(__lsx_vilvh_b, tmpg, tmpb, tmpa, tmpr, reg0, reg1);
1374
- dst2 = __lsx_vilvl_h(reg1, reg0);
1375
- dst3 = __lsx_vilvh_h(reg1, reg0);
1376
- __lsx_vst(dst0, dst_argb, 0);
1377
- __lsx_vst(dst1, dst_argb, 16);
1378
- __lsx_vst(dst2, dst_argb, 32);
1379
- __lsx_vst(dst3, dst_argb, 48);
1380
- dst_argb += 64;
1381
- src_argb1555 += 32;
1382
- }
1383
- }
1384
-
1385
- void RGB565ToARGBRow_LSX(const uint8_t* src_rgb565,
1386
- uint8_t* dst_argb,
1387
- int width) {
1388
- int x;
1389
- int len = width / 16;
1390
- __m128i src0, src1;
1391
- __m128i tmp0, tmp1, tmpb, tmpg, tmpr;
1392
- __m128i reg0, reg1, dst0, dst1, dst2, dst3;
1393
- __m128i alpha = __lsx_vldi(0xFF);
1394
-
1395
- for (x = 0; x < len; x++) {
1396
- src0 = __lsx_vld(src_rgb565, 0);
1397
- src1 = __lsx_vld(src_rgb565, 16);
1398
- tmp0 = __lsx_vpickev_b(src1, src0);
1399
- tmp1 = __lsx_vpickod_b(src1, src0);
1400
- tmpb = __lsx_vandi_b(tmp0, 0x1F);
1401
- tmpr = __lsx_vandi_b(tmp1, 0xF8);
1402
- reg1 = __lsx_vandi_b(tmp1, 0x07);
1403
- reg0 = __lsx_vsrli_b(tmp0, 5);
1404
- reg1 = __lsx_vslli_b(reg1, 3);
1405
- tmpg = __lsx_vor_v(reg1, reg0);
1406
- reg0 = __lsx_vslli_b(tmpb, 3);
1407
- reg1 = __lsx_vsrli_b(tmpb, 2);
1408
- tmpb = __lsx_vor_v(reg1, reg0);
1409
- reg0 = __lsx_vslli_b(tmpg, 2);
1410
- reg1 = __lsx_vsrli_b(tmpg, 4);
1411
- tmpg = __lsx_vor_v(reg1, reg0);
1412
- reg0 = __lsx_vsrli_b(tmpr, 5);
1413
- tmpr = __lsx_vor_v(tmpr, reg0);
1414
- DUP2_ARG2(__lsx_vilvl_b, tmpg, tmpb, alpha, tmpr, reg0, reg1);
1415
- dst0 = __lsx_vilvl_h(reg1, reg0);
1416
- dst1 = __lsx_vilvh_h(reg1, reg0);
1417
- DUP2_ARG2(__lsx_vilvh_b, tmpg, tmpb, alpha, tmpr, reg0, reg1);
1418
- dst2 = __lsx_vilvl_h(reg1, reg0);
1419
- dst3 = __lsx_vilvh_h(reg1, reg0);
1420
- __lsx_vst(dst0, dst_argb, 0);
1421
- __lsx_vst(dst1, dst_argb, 16);
1422
- __lsx_vst(dst2, dst_argb, 32);
1423
- __lsx_vst(dst3, dst_argb, 48);
1424
- dst_argb += 64;
1425
- src_rgb565 += 32;
1426
- }
1427
- }
1428
-
1429
- void RGB24ToARGBRow_LSX(const uint8_t* src_rgb24,
1430
- uint8_t* dst_argb,
1431
- int width) {
1432
- int x;
1433
- int len = width / 16;
1434
- __m128i src0, src1, src2;
1435
- __m128i tmp0, tmp1, tmp2;
1436
- __m128i dst0, dst1, dst2, dst3;
1437
- __m128i alpha = __lsx_vldi(0xFF);
1438
- __m128i shuf0 = {0x131211100F0E0D0C, 0x1B1A191817161514};
1439
- __m128i shuf1 = {0x1F1E1D1C1B1A1918, 0x0706050403020100};
1440
- __m128i shuf2 = {0x0B0A090807060504, 0x131211100F0E0D0C};
1441
- __m128i shuf3 = {0x1005040310020100, 0x100B0A0910080706};
1442
-
1443
- for (x = 0; x < len; x++) {
1444
- src0 = __lsx_vld(src_rgb24, 0);
1445
- src1 = __lsx_vld(src_rgb24, 16);
1446
- src2 = __lsx_vld(src_rgb24, 32);
1447
- DUP2_ARG3(__lsx_vshuf_b, src1, src0, shuf0, src1, src2, shuf1, tmp0, tmp1);
1448
- tmp2 = __lsx_vshuf_b(src1, src2, shuf2);
1449
- DUP4_ARG3(__lsx_vshuf_b, alpha, src0, shuf3, alpha, tmp0, shuf3, alpha,
1450
- tmp1, shuf3, alpha, tmp2, shuf3, dst0, dst1, dst2, dst3);
1451
- __lsx_vst(dst0, dst_argb, 0);
1452
- __lsx_vst(dst1, dst_argb, 16);
1453
- __lsx_vst(dst2, dst_argb, 32);
1454
- __lsx_vst(dst3, dst_argb, 48);
1455
- dst_argb += 64;
1456
- src_rgb24 += 48;
1457
- }
1458
- }
1459
-
1460
- void RAWToARGBRow_LSX(const uint8_t* src_raw, uint8_t* dst_argb, int width) {
1461
- int x;
1462
- int len = width / 16;
1463
- __m128i src0, src1, src2;
1464
- __m128i tmp0, tmp1, tmp2;
1465
- __m128i dst0, dst1, dst2, dst3;
1466
- __m128i alpha = __lsx_vldi(0xFF);
1467
- __m128i shuf0 = {0x131211100F0E0D0C, 0x1B1A191817161514};
1468
- __m128i shuf1 = {0x1F1E1D1C1B1A1918, 0x0706050403020100};
1469
- __m128i shuf2 = {0x0B0A090807060504, 0x131211100F0E0D0C};
1470
- __m128i shuf3 = {0x1003040510000102, 0x10090A0B10060708};
1471
-
1472
- for (x = 0; x < len; x++) {
1473
- src0 = __lsx_vld(src_raw, 0);
1474
- src1 = __lsx_vld(src_raw, 16);
1475
- src2 = __lsx_vld(src_raw, 32);
1476
- DUP2_ARG3(__lsx_vshuf_b, src1, src0, shuf0, src1, src2, shuf1, tmp0, tmp1);
1477
- tmp2 = __lsx_vshuf_b(src1, src2, shuf2);
1478
- DUP4_ARG3(__lsx_vshuf_b, alpha, src0, shuf3, alpha, tmp0, shuf3, alpha,
1479
- tmp1, shuf3, alpha, tmp2, shuf3, dst0, dst1, dst2, dst3);
1480
- __lsx_vst(dst0, dst_argb, 0);
1481
- __lsx_vst(dst1, dst_argb, 16);
1482
- __lsx_vst(dst2, dst_argb, 32);
1483
- __lsx_vst(dst3, dst_argb, 48);
1484
- dst_argb += 64;
1485
- src_raw += 48;
1486
- }
1487
- }
1488
-
1489
- void ARGB1555ToYRow_LSX(const uint8_t* src_argb1555,
1490
- uint8_t* dst_y,
1491
- int width) {
1492
- int x;
1493
- int len = width / 16;
1494
- __m128i src0, src1;
1495
- __m128i tmp0, tmp1, tmpb, tmpg, tmpr;
1496
- __m128i reg0, reg1, reg2, dst0;
1497
- __m128i const_66 = __lsx_vldi(66);
1498
- __m128i const_129 = __lsx_vldi(129);
1499
- __m128i const_25 = __lsx_vldi(25);
1500
- __m128i const_1080 = {0x1080108010801080, 0x1080108010801080};
1501
-
1502
- for (x = 0; x < len; x++) {
1503
- src0 = __lsx_vld(src_argb1555, 0);
1504
- src1 = __lsx_vld(src_argb1555, 16);
1505
- tmp0 = __lsx_vpickev_b(src1, src0);
1506
- tmp1 = __lsx_vpickod_b(src1, src0);
1507
- tmpb = __lsx_vandi_b(tmp0, 0x1F);
1508
- tmpg = __lsx_vsrli_b(tmp0, 5);
1509
- reg0 = __lsx_vandi_b(tmp1, 0x03);
1510
- reg0 = __lsx_vslli_b(reg0, 3);
1511
- tmpg = __lsx_vor_v(tmpg, reg0);
1512
- reg1 = __lsx_vandi_b(tmp1, 0x7C);
1513
- tmpr = __lsx_vsrli_b(reg1, 2);
1514
- reg0 = __lsx_vslli_b(tmpb, 3);
1515
- reg1 = __lsx_vslli_b(tmpg, 3);
1516
- reg2 = __lsx_vslli_b(tmpr, 3);
1517
- tmpb = __lsx_vsrli_b(tmpb, 2);
1518
- tmpg = __lsx_vsrli_b(tmpg, 2);
1519
- tmpr = __lsx_vsrli_b(tmpr, 2);
1520
- tmpb = __lsx_vor_v(reg0, tmpb);
1521
- tmpg = __lsx_vor_v(reg1, tmpg);
1522
- tmpr = __lsx_vor_v(reg2, tmpr);
1523
- reg0 = __lsx_vmaddwev_h_bu(const_1080, tmpb, const_25);
1524
- reg1 = __lsx_vmaddwod_h_bu(const_1080, tmpb, const_25);
1525
- reg0 = __lsx_vmaddwev_h_bu(reg0, tmpg, const_129);
1526
- reg1 = __lsx_vmaddwod_h_bu(reg1, tmpg, const_129);
1527
- reg0 = __lsx_vmaddwev_h_bu(reg0, tmpr, const_66);
1528
- reg1 = __lsx_vmaddwod_h_bu(reg1, tmpr, const_66);
1529
- dst0 = __lsx_vpackod_b(reg1, reg0);
1530
- __lsx_vst(dst0, dst_y, 0);
1531
- dst_y += 16;
1532
- src_argb1555 += 32;
1533
- }
1534
- }
1535
-
1536
- void ARGB1555ToUVRow_LSX(const uint8_t* src_argb1555,
1537
- int src_stride_argb1555,
1538
- uint8_t* dst_u,
1539
- uint8_t* dst_v,
1540
- int width) {
1541
- int x;
1542
- int len = width / 16;
1543
- const uint8_t* next_argb1555 = src_argb1555 + src_stride_argb1555;
1544
- __m128i src0, src1, src2, src3;
1545
- __m128i tmp0, tmp1, tmp2, tmp3;
1546
- __m128i tmpb, tmpg, tmpr, nexb, nexg, nexr;
1547
- __m128i reg0, reg1, reg2, reg3, dst0;
1548
- __m128i const_112 = __lsx_vldi(0x470);
1549
- __m128i const_74 = __lsx_vldi(0x44A);
1550
- __m128i const_38 = __lsx_vldi(0x426);
1551
- __m128i const_94 = __lsx_vldi(0x45E);
1552
- __m128i const_18 = __lsx_vldi(0x412);
1553
- __m128i const_8000 = (__m128i)v2u64{0x8000800080008000, 0x8000800080008000};
1554
-
1555
- for (x = 0; x < len; x++) {
1556
- DUP4_ARG2(__lsx_vld, src_argb1555, 0, src_argb1555, 16, next_argb1555, 0,
1557
- next_argb1555, 16, src0, src1, src2, src3);
1558
- DUP2_ARG2(__lsx_vpickev_b, src1, src0, src3, src2, tmp0, tmp2);
1559
- DUP2_ARG2(__lsx_vpickod_b, src1, src0, src3, src2, tmp1, tmp3);
1560
- tmpb = __lsx_vandi_b(tmp0, 0x1F);
1561
- nexb = __lsx_vandi_b(tmp2, 0x1F);
1562
- tmpg = __lsx_vsrli_b(tmp0, 5);
1563
- nexg = __lsx_vsrli_b(tmp2, 5);
1564
- reg0 = __lsx_vandi_b(tmp1, 0x03);
1565
- reg2 = __lsx_vandi_b(tmp3, 0x03);
1566
- reg0 = __lsx_vslli_b(reg0, 3);
1567
- reg2 = __lsx_vslli_b(reg2, 3);
1568
- tmpg = __lsx_vor_v(tmpg, reg0);
1569
- nexg = __lsx_vor_v(nexg, reg2);
1570
- reg1 = __lsx_vandi_b(tmp1, 0x7C);
1571
- reg3 = __lsx_vandi_b(tmp3, 0x7C);
1572
- tmpr = __lsx_vsrli_b(reg1, 2);
1573
- nexr = __lsx_vsrli_b(reg3, 2);
1574
- reg0 = __lsx_vslli_b(tmpb, 3);
1575
- reg1 = __lsx_vslli_b(tmpg, 3);
1576
- reg2 = __lsx_vslli_b(tmpr, 3);
1577
- tmpb = __lsx_vsrli_b(tmpb, 2);
1578
- tmpg = __lsx_vsrli_b(tmpg, 2);
1579
- tmpr = __lsx_vsrli_b(tmpr, 2);
1580
- tmpb = __lsx_vor_v(reg0, tmpb);
1581
- tmpg = __lsx_vor_v(reg1, tmpg);
1582
- tmpr = __lsx_vor_v(reg2, tmpr);
1583
- reg0 = __lsx_vslli_b(nexb, 3);
1584
- reg1 = __lsx_vslli_b(nexg, 3);
1585
- reg2 = __lsx_vslli_b(nexr, 3);
1586
- nexb = __lsx_vsrli_b(nexb, 2);
1587
- nexg = __lsx_vsrli_b(nexg, 2);
1588
- nexr = __lsx_vsrli_b(nexr, 2);
1589
- nexb = __lsx_vor_v(reg0, nexb);
1590
- nexg = __lsx_vor_v(reg1, nexg);
1591
- nexr = __lsx_vor_v(reg2, nexr);
1592
- RGBTOUV(tmpb, tmpg, tmpr, nexb, nexg, nexr, dst0);
1593
- __lsx_vstelm_d(dst0, dst_u, 0, 0);
1594
- __lsx_vstelm_d(dst0, dst_v, 0, 1);
1595
- dst_u += 8;
1596
- dst_v += 8;
1597
- src_argb1555 += 32;
1598
- next_argb1555 += 32;
1599
- }
1600
- }
1601
-
1602
- void RGB565ToYRow_LSX(const uint8_t* src_rgb565, uint8_t* dst_y, int width) {
1603
- int x;
1604
- int len = width / 16;
1605
- __m128i src0, src1;
1606
- __m128i tmp0, tmp1, tmpb, tmpg, tmpr;
1607
- __m128i reg0, reg1, dst0;
1608
- __m128i const_66 = __lsx_vldi(66);
1609
- __m128i const_129 = __lsx_vldi(129);
1610
- __m128i const_25 = __lsx_vldi(25);
1611
- __m128i const_1080 = {0x1080108010801080, 0x1080108010801080};
1612
-
1613
- for (x = 0; x < len; x++) {
1614
- src0 = __lsx_vld(src_rgb565, 0);
1615
- src1 = __lsx_vld(src_rgb565, 16);
1616
- tmp0 = __lsx_vpickev_b(src1, src0);
1617
- tmp1 = __lsx_vpickod_b(src1, src0);
1618
- tmpb = __lsx_vandi_b(tmp0, 0x1F);
1619
- tmpr = __lsx_vandi_b(tmp1, 0xF8);
1620
- reg1 = __lsx_vandi_b(tmp1, 0x07);
1621
- reg0 = __lsx_vsrli_b(tmp0, 5);
1622
- reg1 = __lsx_vslli_b(reg1, 3);
1623
- tmpg = __lsx_vor_v(reg1, reg0);
1624
- reg0 = __lsx_vslli_b(tmpb, 3);
1625
- reg1 = __lsx_vsrli_b(tmpb, 2);
1626
- tmpb = __lsx_vor_v(reg1, reg0);
1627
- reg0 = __lsx_vslli_b(tmpg, 2);
1628
- reg1 = __lsx_vsrli_b(tmpg, 4);
1629
- tmpg = __lsx_vor_v(reg1, reg0);
1630
- reg0 = __lsx_vsrli_b(tmpr, 5);
1631
- tmpr = __lsx_vor_v(tmpr, reg0);
1632
- reg0 = __lsx_vmaddwev_h_bu(const_1080, tmpb, const_25);
1633
- reg1 = __lsx_vmaddwod_h_bu(const_1080, tmpb, const_25);
1634
- reg0 = __lsx_vmaddwev_h_bu(reg0, tmpg, const_129);
1635
- reg1 = __lsx_vmaddwod_h_bu(reg1, tmpg, const_129);
1636
- reg0 = __lsx_vmaddwev_h_bu(reg0, tmpr, const_66);
1637
- reg1 = __lsx_vmaddwod_h_bu(reg1, tmpr, const_66);
1638
- dst0 = __lsx_vpackod_b(reg1, reg0);
1639
- __lsx_vst(dst0, dst_y, 0);
1640
- dst_y += 16;
1641
- src_rgb565 += 32;
1642
- }
1643
- }
1644
-
1645
- void RGB565ToUVRow_LSX(const uint8_t* src_rgb565,
1646
- int src_stride_rgb565,
1647
- uint8_t* dst_u,
1648
- uint8_t* dst_v,
1649
- int width) {
1650
- int x;
1651
- int len = width / 16;
1652
- const uint8_t* next_rgb565 = src_rgb565 + src_stride_rgb565;
1653
- __m128i src0, src1, src2, src3;
1654
- __m128i tmp0, tmp1, tmp2, tmp3;
1655
- __m128i tmpb, tmpg, tmpr, nexb, nexg, nexr;
1656
- __m128i reg0, reg1, reg2, reg3, dst0;
1657
- __m128i const_112 = __lsx_vldi(0x470);
1658
- __m128i const_74 = __lsx_vldi(0x44A);
1659
- __m128i const_38 = __lsx_vldi(0x426);
1660
- __m128i const_94 = __lsx_vldi(0x45E);
1661
- __m128i const_18 = __lsx_vldi(0x412);
1662
- __m128i const_8000 = (__m128i)v2u64{0x8000800080008000, 0x8000800080008000};
1663
-
1664
- for (x = 0; x < len; x++) {
1665
- DUP4_ARG2(__lsx_vld, src_rgb565, 0, src_rgb565, 16, next_rgb565, 0,
1666
- next_rgb565, 16, src0, src1, src2, src3);
1667
- DUP2_ARG2(__lsx_vpickev_b, src1, src0, src3, src2, tmp0, tmp2);
1668
- DUP2_ARG2(__lsx_vpickod_b, src1, src0, src3, src2, tmp1, tmp3);
1669
- tmpb = __lsx_vandi_b(tmp0, 0x1F);
1670
- tmpr = __lsx_vandi_b(tmp1, 0xF8);
1671
- nexb = __lsx_vandi_b(tmp2, 0x1F);
1672
- nexr = __lsx_vandi_b(tmp3, 0xF8);
1673
- reg1 = __lsx_vandi_b(tmp1, 0x07);
1674
- reg3 = __lsx_vandi_b(tmp3, 0x07);
1675
- reg0 = __lsx_vsrli_b(tmp0, 5);
1676
- reg1 = __lsx_vslli_b(reg1, 3);
1677
- reg2 = __lsx_vsrli_b(tmp2, 5);
1678
- reg3 = __lsx_vslli_b(reg3, 3);
1679
- tmpg = __lsx_vor_v(reg1, reg0);
1680
- nexg = __lsx_vor_v(reg2, reg3);
1681
- reg0 = __lsx_vslli_b(tmpb, 3);
1682
- reg1 = __lsx_vsrli_b(tmpb, 2);
1683
- reg2 = __lsx_vslli_b(nexb, 3);
1684
- reg3 = __lsx_vsrli_b(nexb, 2);
1685
- tmpb = __lsx_vor_v(reg1, reg0);
1686
- nexb = __lsx_vor_v(reg2, reg3);
1687
- reg0 = __lsx_vslli_b(tmpg, 2);
1688
- reg1 = __lsx_vsrli_b(tmpg, 4);
1689
- reg2 = __lsx_vslli_b(nexg, 2);
1690
- reg3 = __lsx_vsrli_b(nexg, 4);
1691
- tmpg = __lsx_vor_v(reg1, reg0);
1692
- nexg = __lsx_vor_v(reg2, reg3);
1693
- reg0 = __lsx_vsrli_b(tmpr, 5);
1694
- reg2 = __lsx_vsrli_b(nexr, 5);
1695
- tmpr = __lsx_vor_v(tmpr, reg0);
1696
- nexr = __lsx_vor_v(nexr, reg2);
1697
- RGBTOUV(tmpb, tmpg, tmpr, nexb, nexg, nexr, dst0);
1698
- __lsx_vstelm_d(dst0, dst_u, 0, 0);
1699
- __lsx_vstelm_d(dst0, dst_v, 0, 1);
1700
- dst_u += 8;
1701
- dst_v += 8;
1702
- src_rgb565 += 32;
1703
- next_rgb565 += 32;
1704
- }
1705
- }
1706
-
1707
- void RGB24ToUVRow_LSX(const uint8_t* src_rgb24,
1708
- int src_stride_rgb24,
1709
- uint8_t* dst_u,
1710
- uint8_t* dst_v,
1711
- int width) {
1712
- int x;
1713
- const uint8_t* next_rgb24 = src_rgb24 + src_stride_rgb24;
1714
- int len = width / 16;
1715
- __m128i src0, src1, src2;
1716
- __m128i nex0, nex1, nex2, dst0;
1717
- __m128i tmpb, tmpg, tmpr, nexb, nexg, nexr;
1718
- __m128i const_112 = __lsx_vldi(0x470);
1719
- __m128i const_74 = __lsx_vldi(0x44A);
1720
- __m128i const_38 = __lsx_vldi(0x426);
1721
- __m128i const_94 = __lsx_vldi(0x45E);
1722
- __m128i const_18 = __lsx_vldi(0x412);
1723
- __m128i const_8000 = (__m128i)v2u64{0x8000800080008000, 0x8000800080008000};
1724
- __m128i shuff0_b = {0x15120F0C09060300, 0x00000000001E1B18};
1725
- __m128i shuff1_b = {0x0706050403020100, 0x1D1A1714110A0908};
1726
- __m128i shuff0_g = {0x1613100D0A070401, 0x00000000001F1C19};
1727
- __m128i shuff1_g = {0x0706050403020100, 0x1E1B1815120A0908};
1728
- __m128i shuff0_r = {0x1714110E0B080502, 0x0000000000001D1A};
1729
- __m128i shuff1_r = {0x0706050403020100, 0x1F1C191613100908};
1730
-
1731
- for (x = 0; x < len; x++) {
1732
- src0 = __lsx_vld(src_rgb24, 0);
1733
- src1 = __lsx_vld(src_rgb24, 16);
1734
- src2 = __lsx_vld(src_rgb24, 32);
1735
- nex0 = __lsx_vld(next_rgb24, 0);
1736
- nex1 = __lsx_vld(next_rgb24, 16);
1737
- nex2 = __lsx_vld(next_rgb24, 32);
1738
- DUP2_ARG3(__lsx_vshuf_b, src1, src0, shuff0_b, nex1, nex0, shuff0_b, tmpb,
1739
- nexb);
1740
- DUP2_ARG3(__lsx_vshuf_b, src1, src0, shuff0_g, nex1, nex0, shuff0_g, tmpg,
1741
- nexg);
1742
- DUP2_ARG3(__lsx_vshuf_b, src1, src0, shuff0_r, nex1, nex0, shuff0_r, tmpr,
1743
- nexr);
1744
- DUP2_ARG3(__lsx_vshuf_b, src2, tmpb, shuff1_b, nex2, nexb, shuff1_b, tmpb,
1745
- nexb);
1746
- DUP2_ARG3(__lsx_vshuf_b, src2, tmpg, shuff1_g, nex2, nexg, shuff1_g, tmpg,
1747
- nexg);
1748
- DUP2_ARG3(__lsx_vshuf_b, src2, tmpr, shuff1_r, nex2, nexr, shuff1_r, tmpr,
1749
- nexr);
1750
- RGBTOUV(tmpb, tmpg, tmpr, nexb, nexg, nexr, dst0);
1751
- __lsx_vstelm_d(dst0, dst_u, 0, 0);
1752
- __lsx_vstelm_d(dst0, dst_v, 0, 1);
1753
- dst_u += 8;
1754
- dst_v += 8;
1755
- src_rgb24 += 48;
1756
- next_rgb24 += 48;
1757
- }
1758
- }
1759
-
1760
- void RAWToUVRow_LSX(const uint8_t* src_raw,
1761
- int src_stride_raw,
1762
- uint8_t* dst_u,
1763
- uint8_t* dst_v,
1764
- int width) {
1765
- int x;
1766
- const uint8_t* next_raw = src_raw + src_stride_raw;
1767
- int len = width / 16;
1768
- __m128i src0, src1, src2;
1769
- __m128i nex0, nex1, nex2, dst0;
1770
- __m128i tmpb, tmpg, tmpr, nexb, nexg, nexr;
1771
- __m128i const_112 = __lsx_vldi(0x470);
1772
- __m128i const_74 = __lsx_vldi(0x44A);
1773
- __m128i const_38 = __lsx_vldi(0x426);
1774
- __m128i const_94 = __lsx_vldi(0x45E);
1775
- __m128i const_18 = __lsx_vldi(0x412);
1776
- __m128i const_8000 = (__m128i)v2u64{0x8000800080008000, 0x8000800080008000};
1777
- __m128i shuff0_r = {0x15120F0C09060300, 0x00000000001E1B18};
1778
- __m128i shuff1_r = {0x0706050403020100, 0x1D1A1714110A0908};
1779
- __m128i shuff0_g = {0x1613100D0A070401, 0x00000000001F1C19};
1780
- __m128i shuff1_g = {0x0706050403020100, 0x1E1B1815120A0908};
1781
- __m128i shuff0_b = {0x1714110E0B080502, 0x0000000000001D1A};
1782
- __m128i shuff1_b = {0x0706050403020100, 0x1F1C191613100908};
1783
-
1784
- for (x = 0; x < len; x++) {
1785
- src0 = __lsx_vld(src_raw, 0);
1786
- src1 = __lsx_vld(src_raw, 16);
1787
- src2 = __lsx_vld(src_raw, 32);
1788
- nex0 = __lsx_vld(next_raw, 0);
1789
- nex1 = __lsx_vld(next_raw, 16);
1790
- nex2 = __lsx_vld(next_raw, 32);
1791
- DUP2_ARG3(__lsx_vshuf_b, src1, src0, shuff0_b, nex1, nex0, shuff0_b, tmpb,
1792
- nexb);
1793
- DUP2_ARG3(__lsx_vshuf_b, src1, src0, shuff0_g, nex1, nex0, shuff0_g, tmpg,
1794
- nexg);
1795
- DUP2_ARG3(__lsx_vshuf_b, src1, src0, shuff0_r, nex1, nex0, shuff0_r, tmpr,
1796
- nexr);
1797
- DUP2_ARG3(__lsx_vshuf_b, src2, tmpb, shuff1_b, nex2, nexb, shuff1_b, tmpb,
1798
- nexb);
1799
- DUP2_ARG3(__lsx_vshuf_b, src2, tmpg, shuff1_g, nex2, nexg, shuff1_g, tmpg,
1800
- nexg);
1801
- DUP2_ARG3(__lsx_vshuf_b, src2, tmpr, shuff1_r, nex2, nexr, shuff1_r, tmpr,
1802
- nexr);
1803
- RGBTOUV(tmpb, tmpg, tmpr, nexb, nexg, nexr, dst0);
1804
- __lsx_vstelm_d(dst0, dst_u, 0, 0);
1805
- __lsx_vstelm_d(dst0, dst_v, 0, 1);
1806
- dst_u += 8;
1807
- dst_v += 8;
1808
- src_raw += 48;
1809
- next_raw += 48;
1810
- }
1811
- }
1812
-
1813
- void NV12ToARGBRow_LSX(const uint8_t* src_y,
1814
- const uint8_t* src_uv,
1815
- uint8_t* dst_argb,
1816
- const struct YuvConstants* yuvconstants,
1817
- int width) {
1818
- int x;
1819
- int len = width / 8;
1820
- __m128i vec_y, vec_vu;
1821
- __m128i vec_vr, vec_ub, vec_vg, vec_ug, vec_yg, vec_yb;
1822
- __m128i vec_vrub, vec_vgug;
1823
- __m128i out_b, out_g, out_r;
1824
- __m128i const_80 = __lsx_vldi(0x480);
1825
- __m128i alpha = __lsx_vldi(0xFF);
1826
- __m128i zero = __lsx_vldi(0);
1827
-
1828
- YUVTORGB_SETUP(yuvconstants, vec_vr, vec_ub, vec_vg, vec_ug, vec_yg, vec_yb);
1829
- vec_vrub = __lsx_vilvl_h(vec_vr, vec_ub);
1830
- vec_vgug = __lsx_vilvl_h(vec_vg, vec_ug);
1831
-
1832
- for (x = 0; x < len; x++) {
1833
- vec_y = __lsx_vld(src_y, 0);
1834
- vec_vu = __lsx_vld(src_uv, 0);
1835
- YUVTORGB(vec_y, vec_vu, vec_vrub, vec_vgug, vec_yg, vec_yb, out_b, out_g,
1836
- out_r);
1837
- STOREARGB(alpha, out_r, out_g, out_b, dst_argb);
1838
- src_y += 8;
1839
- src_uv += 8;
1840
- }
1841
- }
1842
-
1843
- void NV12ToRGB565Row_LSX(const uint8_t* src_y,
1844
- const uint8_t* src_uv,
1845
- uint8_t* dst_rgb565,
1846
- const struct YuvConstants* yuvconstants,
1847
- int width) {
1848
- int x;
1849
- int len = width / 8;
1850
- __m128i vec_y, vec_vu;
1851
- __m128i vec_vr, vec_ub, vec_vg, vec_ug, vec_yg, vec_yb;
1852
- __m128i vec_vrub, vec_vgug;
1853
- __m128i out_b, out_g, out_r;
1854
- __m128i const_80 = __lsx_vldi(0x480);
1855
- __m128i zero = __lsx_vldi(0);
1856
-
1857
- YUVTORGB_SETUP(yuvconstants, vec_vr, vec_ub, vec_vg, vec_ug, vec_yg, vec_yb);
1858
- vec_vrub = __lsx_vilvl_h(vec_vr, vec_ub);
1859
- vec_vgug = __lsx_vilvl_h(vec_vg, vec_ug);
1860
-
1861
- for (x = 0; x < len; x++) {
1862
- vec_y = __lsx_vld(src_y, 0);
1863
- vec_vu = __lsx_vld(src_uv, 0);
1864
- YUVTORGB(vec_y, vec_vu, vec_vrub, vec_vgug, vec_yg, vec_yb, out_b, out_g,
1865
- out_r);
1866
- out_b = __lsx_vsrli_h(out_b, 3);
1867
- out_g = __lsx_vsrli_h(out_g, 2);
1868
- out_r = __lsx_vsrli_h(out_r, 3);
1869
- out_g = __lsx_vslli_h(out_g, 5);
1870
- out_r = __lsx_vslli_h(out_r, 11);
1871
- out_r = __lsx_vor_v(out_r, out_g);
1872
- out_r = __lsx_vor_v(out_r, out_b);
1873
- __lsx_vst(out_r, dst_rgb565, 0);
1874
- src_y += 8;
1875
- src_uv += 8;
1876
- dst_rgb565 += 16;
1877
- }
1878
- }
1879
-
1880
- void NV21ToARGBRow_LSX(const uint8_t* src_y,
1881
- const uint8_t* src_vu,
1882
- uint8_t* dst_argb,
1883
- const struct YuvConstants* yuvconstants,
1884
- int width) {
1885
- int x;
1886
- int len = width / 8;
1887
- __m128i vec_y, vec_uv;
1888
- __m128i vec_vr, vec_ub, vec_vg, vec_ug, vec_yg, vec_yb;
1889
- __m128i vec_ubvr, vec_ugvg;
1890
- __m128i out_b, out_g, out_r;
1891
- __m128i const_80 = __lsx_vldi(0x480);
1892
- __m128i alpha = __lsx_vldi(0xFF);
1893
- __m128i zero = __lsx_vldi(0);
1894
-
1895
- YUVTORGB_SETUP(yuvconstants, vec_vr, vec_ub, vec_vg, vec_ug, vec_yg, vec_yb);
1896
- vec_ubvr = __lsx_vilvl_h(vec_ub, vec_vr);
1897
- vec_ugvg = __lsx_vilvl_h(vec_ug, vec_vg);
1898
-
1899
- for (x = 0; x < len; x++) {
1900
- vec_y = __lsx_vld(src_y, 0);
1901
- vec_uv = __lsx_vld(src_vu, 0);
1902
- YUVTORGB(vec_y, vec_uv, vec_ubvr, vec_ugvg, vec_yg, vec_yb, out_r, out_g,
1903
- out_b);
1904
- STOREARGB(alpha, out_r, out_g, out_b, dst_argb);
1905
- src_y += 8;
1906
- src_vu += 8;
1907
- }
1908
- }
1909
-
1910
- void SobelRow_LSX(const uint8_t* src_sobelx,
1911
- const uint8_t* src_sobely,
1912
- uint8_t* dst_argb,
1913
- int width) {
1914
- int x;
1915
- int len = width / 16;
1916
- __m128i src0, src1, tmp0;
1917
- __m128i out0, out1, out2, out3;
1918
- __m128i alpha = __lsx_vldi(0xFF);
1919
- __m128i shuff0 = {0x1001010110000000, 0x1003030310020202};
1920
- __m128i shuff1 = __lsx_vaddi_bu(shuff0, 0x04);
1921
- __m128i shuff2 = __lsx_vaddi_bu(shuff1, 0x04);
1922
- __m128i shuff3 = __lsx_vaddi_bu(shuff2, 0x04);
1923
-
1924
- for (x = 0; x < len; x++) {
1925
- src0 = __lsx_vld(src_sobelx, 0);
1926
- src1 = __lsx_vld(src_sobely, 0);
1927
- tmp0 = __lsx_vsadd_bu(src0, src1);
1928
- DUP4_ARG3(__lsx_vshuf_b, alpha, tmp0, shuff0, alpha, tmp0, shuff1, alpha,
1929
- tmp0, shuff2, alpha, tmp0, shuff3, out0, out1, out2, out3);
1930
- __lsx_vst(out0, dst_argb, 0);
1931
- __lsx_vst(out1, dst_argb, 16);
1932
- __lsx_vst(out2, dst_argb, 32);
1933
- __lsx_vst(out3, dst_argb, 48);
1934
- src_sobelx += 16;
1935
- src_sobely += 16;
1936
- dst_argb += 64;
1937
- }
1938
- }
1939
-
1940
- void SobelToPlaneRow_LSX(const uint8_t* src_sobelx,
1941
- const uint8_t* src_sobely,
1942
- uint8_t* dst_y,
1943
- int width) {
1944
- int x;
1945
- int len = width / 32;
1946
- __m128i src0, src1, src2, src3, dst0, dst1;
1947
-
1948
- for (x = 0; x < len; x++) {
1949
- DUP2_ARG2(__lsx_vld, src_sobelx, 0, src_sobelx, 16, src0, src1);
1950
- DUP2_ARG2(__lsx_vld, src_sobely, 0, src_sobely, 16, src2, src3);
1951
- dst0 = __lsx_vsadd_bu(src0, src2);
1952
- dst1 = __lsx_vsadd_bu(src1, src3);
1953
- __lsx_vst(dst0, dst_y, 0);
1954
- __lsx_vst(dst1, dst_y, 16);
1955
- src_sobelx += 32;
1956
- src_sobely += 32;
1957
- dst_y += 32;
1958
- }
1959
- }
1960
-
1961
- void SobelXYRow_LSX(const uint8_t* src_sobelx,
1962
- const uint8_t* src_sobely,
1963
- uint8_t* dst_argb,
1964
- int width) {
1965
- int x;
1966
- int len = width / 16;
1967
- __m128i src_r, src_b, src_g;
1968
- __m128i tmp0, tmp1, tmp2, tmp3;
1969
- __m128i dst0, dst1, dst2, dst3;
1970
- __m128i alpha = __lsx_vldi(0xFF);
1971
-
1972
- for (x = 0; x < len; x++) {
1973
- src_r = __lsx_vld(src_sobelx, 0);
1974
- src_b = __lsx_vld(src_sobely, 0);
1975
- src_g = __lsx_vsadd_bu(src_r, src_b);
1976
- tmp0 = __lsx_vilvl_b(src_g, src_b);
1977
- tmp1 = __lsx_vilvh_b(src_g, src_b);
1978
- tmp2 = __lsx_vilvl_b(alpha, src_r);
1979
- tmp3 = __lsx_vilvh_b(alpha, src_r);
1980
- dst0 = __lsx_vilvl_h(tmp2, tmp0);
1981
- dst1 = __lsx_vilvh_h(tmp2, tmp0);
1982
- dst2 = __lsx_vilvl_h(tmp3, tmp1);
1983
- dst3 = __lsx_vilvh_h(tmp3, tmp1);
1984
- __lsx_vst(dst0, dst_argb, 0);
1985
- __lsx_vst(dst1, dst_argb, 16);
1986
- __lsx_vst(dst2, dst_argb, 32);
1987
- __lsx_vst(dst3, dst_argb, 48);
1988
- src_sobelx += 16;
1989
- src_sobely += 16;
1990
- dst_argb += 64;
1991
- }
1992
- }
1993
-
1994
- void BGRAToUVRow_LSX(const uint8_t* src_bgra,
1995
- int src_stride_bgra,
1996
- uint8_t* dst_u,
1997
- uint8_t* dst_v,
1998
- int width) {
1999
- int x;
2000
- const uint8_t* next_bgra = src_bgra + src_stride_bgra;
2001
- int len = width / 16;
2002
- __m128i src0, src1, src2, src3;
2003
- __m128i nex0, nex1, nex2, nex3;
2004
- __m128i tmp0, tmp1, tmp2, tmp3, dst0;
2005
- __m128i tmpb, tmpg, tmpr, nexb, nexg, nexr;
2006
- __m128i const_112 = __lsx_vldi(0x470);
2007
- __m128i const_74 = __lsx_vldi(0x44A);
2008
- __m128i const_38 = __lsx_vldi(0x426);
2009
- __m128i const_94 = __lsx_vldi(0x45E);
2010
- __m128i const_18 = __lsx_vldi(0x412);
2011
- __m128i const_8000 = (__m128i)v2u64{0x8000800080008000, 0x8000800080008000};
2012
-
2013
- for (x = 0; x < len; x++) {
2014
- DUP4_ARG2(__lsx_vld, src_bgra, 0, src_bgra, 16, src_bgra, 32, src_bgra, 48,
2015
- src0, src1, src2, src3);
2016
- DUP4_ARG2(__lsx_vld, next_bgra, 0, next_bgra, 16, next_bgra, 32, next_bgra,
2017
- 48, nex0, nex1, nex2, nex3);
2018
- tmp0 = __lsx_vpickod_b(src1, src0);
2019
- tmp1 = __lsx_vpickev_b(src1, src0);
2020
- tmp2 = __lsx_vpickod_b(src3, src2);
2021
- tmp3 = __lsx_vpickev_b(src3, src2);
2022
- tmpb = __lsx_vpickod_b(tmp2, tmp0);
2023
- tmpr = __lsx_vpickev_b(tmp2, tmp0);
2024
- tmpg = __lsx_vpickod_b(tmp3, tmp1);
2025
- tmp0 = __lsx_vpickod_b(nex1, nex0);
2026
- tmp1 = __lsx_vpickev_b(nex1, nex0);
2027
- tmp2 = __lsx_vpickod_b(nex3, nex2);
2028
- tmp3 = __lsx_vpickev_b(nex3, nex2);
2029
- nexb = __lsx_vpickod_b(tmp2, tmp0);
2030
- nexr = __lsx_vpickev_b(tmp2, tmp0);
2031
- nexg = __lsx_vpickod_b(tmp3, tmp1);
2032
- RGBTOUV(tmpb, tmpg, tmpr, nexb, nexg, nexr, dst0);
2033
- __lsx_vstelm_d(dst0, dst_u, 0, 0);
2034
- __lsx_vstelm_d(dst0, dst_v, 0, 1);
2035
- dst_u += 8;
2036
- dst_v += 8;
2037
- src_bgra += 64;
2038
- next_bgra += 64;
2039
- }
2040
- }
2041
-
2042
- void ABGRToUVRow_LSX(const uint8_t* src_abgr,
2043
- int src_stride_abgr,
2044
- uint8_t* dst_u,
2045
- uint8_t* dst_v,
2046
- int width) {
2047
- int x;
2048
- const uint8_t* next_abgr = src_abgr + src_stride_abgr;
2049
- int len = width / 16;
2050
- __m128i src0, src1, src2, src3;
2051
- __m128i nex0, nex1, nex2, nex3;
2052
- __m128i tmp0, tmp1, tmp2, tmp3, dst0;
2053
- __m128i tmpb, tmpg, tmpr, nexb, nexg, nexr;
2054
- __m128i const_112 = __lsx_vldi(0x470);
2055
- __m128i const_74 = __lsx_vldi(0x44A);
2056
- __m128i const_38 = __lsx_vldi(0x426);
2057
- __m128i const_94 = __lsx_vldi(0x45E);
2058
- __m128i const_18 = __lsx_vldi(0x412);
2059
- __m128i const_8000 = (__m128i)v2u64{0x8000800080008000, 0x8000800080008000};
2060
-
2061
- for (x = 0; x < len; x++) {
2062
- DUP4_ARG2(__lsx_vld, src_abgr, 0, src_abgr, 16, src_abgr, 32, src_abgr, 48,
2063
- src0, src1, src2, src3);
2064
- DUP4_ARG2(__lsx_vld, next_abgr, 0, next_abgr, 16, next_abgr, 32, next_abgr,
2065
- 48, nex0, nex1, nex2, nex3);
2066
- tmp0 = __lsx_vpickev_b(src1, src0);
2067
- tmp1 = __lsx_vpickod_b(src1, src0);
2068
- tmp2 = __lsx_vpickev_b(src3, src2);
2069
- tmp3 = __lsx_vpickod_b(src3, src2);
2070
- tmpb = __lsx_vpickod_b(tmp2, tmp0);
2071
- tmpr = __lsx_vpickev_b(tmp2, tmp0);
2072
- tmpg = __lsx_vpickev_b(tmp3, tmp1);
2073
- tmp0 = __lsx_vpickev_b(nex1, nex0);
2074
- tmp1 = __lsx_vpickod_b(nex1, nex0);
2075
- tmp2 = __lsx_vpickev_b(nex3, nex2);
2076
- tmp3 = __lsx_vpickod_b(nex3, nex2);
2077
- nexb = __lsx_vpickod_b(tmp2, tmp0);
2078
- nexr = __lsx_vpickev_b(tmp2, tmp0);
2079
- nexg = __lsx_vpickev_b(tmp3, tmp1);
2080
- RGBTOUV(tmpb, tmpg, tmpr, nexb, nexg, nexr, dst0);
2081
- __lsx_vstelm_d(dst0, dst_u, 0, 0);
2082
- __lsx_vstelm_d(dst0, dst_v, 0, 1);
2083
- dst_u += 8;
2084
- dst_v += 8;
2085
- src_abgr += 64;
2086
- next_abgr += 64;
2087
- }
2088
- }
2089
-
2090
- void RGBAToUVRow_LSX(const uint8_t* src_rgba,
2091
- int src_stride_rgba,
2092
- uint8_t* dst_u,
2093
- uint8_t* dst_v,
2094
- int width) {
2095
- int x;
2096
- const uint8_t* next_rgba = src_rgba + src_stride_rgba;
2097
- int len = width / 16;
2098
- __m128i src0, src1, src2, src3;
2099
- __m128i nex0, nex1, nex2, nex3;
2100
- __m128i tmp0, tmp1, tmp2, tmp3, dst0;
2101
- __m128i tmpb, tmpg, tmpr, nexb, nexg, nexr;
2102
- __m128i const_112 = __lsx_vldi(0x470);
2103
- __m128i const_74 = __lsx_vldi(0x44A);
2104
- __m128i const_38 = __lsx_vldi(0x426);
2105
- __m128i const_94 = __lsx_vldi(0x45E);
2106
- __m128i const_18 = __lsx_vldi(0x412);
2107
- __m128i const_8000 = (__m128i)v2u64{0x8000800080008000, 0x8000800080008000};
2108
-
2109
- for (x = 0; x < len; x++) {
2110
- DUP4_ARG2(__lsx_vld, src_rgba, 0, src_rgba, 16, src_rgba, 32, src_rgba, 48,
2111
- src0, src1, src2, src3);
2112
- DUP4_ARG2(__lsx_vld, next_rgba, 0, next_rgba, 16, next_rgba, 32, next_rgba,
2113
- 48, nex0, nex1, nex2, nex3);
2114
- tmp0 = __lsx_vpickod_b(src1, src0);
2115
- tmp1 = __lsx_vpickev_b(src1, src0);
2116
- tmp2 = __lsx_vpickod_b(src3, src2);
2117
- tmp3 = __lsx_vpickev_b(src3, src2);
2118
- tmpr = __lsx_vpickod_b(tmp2, tmp0);
2119
- tmpb = __lsx_vpickev_b(tmp2, tmp0);
2120
- tmpg = __lsx_vpickod_b(tmp3, tmp1);
2121
- tmp0 = __lsx_vpickod_b(nex1, nex0);
2122
- tmp1 = __lsx_vpickev_b(nex1, nex0);
2123
- tmp2 = __lsx_vpickod_b(nex3, nex2);
2124
- tmp3 = __lsx_vpickev_b(nex3, nex2);
2125
- nexr = __lsx_vpickod_b(tmp2, tmp0);
2126
- nexb = __lsx_vpickev_b(tmp2, tmp0);
2127
- nexg = __lsx_vpickod_b(tmp3, tmp1);
2128
- RGBTOUV(tmpb, tmpg, tmpr, nexb, nexg, nexr, dst0);
2129
- __lsx_vstelm_d(dst0, dst_u, 0, 0);
2130
- __lsx_vstelm_d(dst0, dst_v, 0, 1);
2131
- dst_u += 8;
2132
- dst_v += 8;
2133
- src_rgba += 64;
2134
- next_rgba += 64;
2135
- }
2136
- }
2137
-
2138
- void ARGBToUVJRow_LSX(const uint8_t* src_argb,
2139
- int src_stride_argb,
2140
- uint8_t* dst_u,
2141
- uint8_t* dst_v,
2142
- int width) {
2143
- int x;
2144
- const uint8_t* next_argb = src_argb + src_stride_argb;
2145
- int len = width / 16;
2146
- __m128i src0, src1, src2, src3;
2147
- __m128i nex0, nex1, nex2, nex3;
2148
- __m128i tmp0, tmp1, tmp2, tmp3, tmp4, tmp5;
2149
- __m128i reg0, reg1, dst0;
2150
- __m128i tmpb, tmpg, tmpr, nexb, nexg, nexr;
2151
- __m128i const_128 = __lsx_vldi(0x480);
2152
- __m128i const_85 = __lsx_vldi(0x455);
2153
- __m128i const_43 = __lsx_vldi(0x42B);
2154
- __m128i const_107 = __lsx_vldi(0x46B);
2155
- __m128i const_21 = __lsx_vldi(0x415);
2156
- __m128i const_8000 = (__m128i)v2u64{0x8000800080008000, 0x8000800080008000};
2157
-
2158
- for (x = 0; x < len; x++) {
2159
- DUP4_ARG2(__lsx_vld, src_argb, 0, src_argb, 16, src_argb, 32, src_argb, 48,
2160
- src0, src1, src2, src3);
2161
- DUP4_ARG2(__lsx_vld, next_argb, 0, next_argb, 16, next_argb, 32, next_argb,
2162
- 48, nex0, nex1, nex2, nex3);
2163
- tmp0 = __lsx_vpickev_b(src1, src0);
2164
- tmp1 = __lsx_vpickod_b(src1, src0);
2165
- tmp2 = __lsx_vpickev_b(src3, src2);
2166
- tmp3 = __lsx_vpickod_b(src3, src2);
2167
- tmpr = __lsx_vpickod_b(tmp2, tmp0);
2168
- tmpb = __lsx_vpickev_b(tmp2, tmp0);
2169
- tmpg = __lsx_vpickev_b(tmp3, tmp1);
2170
- tmp0 = __lsx_vpickev_b(nex1, nex0);
2171
- tmp1 = __lsx_vpickod_b(nex1, nex0);
2172
- tmp2 = __lsx_vpickev_b(nex3, nex2);
2173
- tmp3 = __lsx_vpickod_b(nex3, nex2);
2174
- nexr = __lsx_vpickod_b(tmp2, tmp0);
2175
- nexb = __lsx_vpickev_b(tmp2, tmp0);
2176
- nexg = __lsx_vpickev_b(tmp3, tmp1);
2177
- tmp0 = __lsx_vaddwev_h_bu(tmpb, nexb);
2178
- tmp1 = __lsx_vaddwod_h_bu(tmpb, nexb);
2179
- tmp2 = __lsx_vaddwev_h_bu(tmpg, nexg);
2180
- tmp3 = __lsx_vaddwod_h_bu(tmpg, nexg);
2181
- reg0 = __lsx_vaddwev_h_bu(tmpr, nexr);
2182
- reg1 = __lsx_vaddwod_h_bu(tmpr, nexr);
2183
- tmp4 = __lsx_vaddwev_w_hu(tmp0, tmp1);
2184
- tmp5 = __lsx_vaddwod_w_hu(tmp0, tmp1);
2185
- tmp0 = __lsx_vilvl_w(tmp5, tmp4);
2186
- tmp1 = __lsx_vilvh_w(tmp5, tmp4);
2187
- tmpb = __lsx_vssrarni_hu_w(tmp1, tmp0, 2);
2188
- tmp4 = __lsx_vaddwev_w_hu(tmp2, tmp3);
2189
- tmp5 = __lsx_vaddwod_w_hu(tmp2, tmp3);
2190
- tmp2 = __lsx_vilvl_w(tmp5, tmp4);
2191
- tmp3 = __lsx_vilvh_w(tmp5, tmp4);
2192
- tmpg = __lsx_vssrarni_hu_w(tmp3, tmp2, 2);
2193
- tmp4 = __lsx_vaddwev_w_hu(reg0, reg1);
2194
- tmp5 = __lsx_vaddwod_w_hu(reg0, reg1);
2195
- tmp0 = __lsx_vilvl_w(tmp5, tmp4);
2196
- tmp1 = __lsx_vilvh_w(tmp5, tmp4);
2197
- tmpr = __lsx_vssrarni_hu_w(tmp1, tmp0, 2);
2198
- reg0 = __lsx_vmadd_h(const_8000, const_128, tmpb);
2199
- reg1 = __lsx_vmadd_h(const_8000, const_128, tmpr);
2200
- reg0 = __lsx_vmsub_h(reg0, const_85, tmpg);
2201
- reg1 = __lsx_vmsub_h(reg1, const_107, tmpg);
2202
- reg0 = __lsx_vmsub_h(reg0, const_43, tmpr);
2203
- reg1 = __lsx_vmsub_h(reg1, const_21, tmpb);
2204
- dst0 = __lsx_vpickod_b(reg1, reg0);
2205
- __lsx_vstelm_d(dst0, dst_u, 0, 0);
2206
- __lsx_vstelm_d(dst0, dst_v, 0, 1);
2207
- dst_u += 8;
2208
- dst_v += 8;
2209
- src_argb += 64;
2210
- next_argb += 64;
2211
- }
2212
- }
2213
-
2214
- void I444ToARGBRow_LSX(const uint8_t* src_y,
2215
- const uint8_t* src_u,
2216
- const uint8_t* src_v,
2217
- uint8_t* dst_argb,
2218
- const struct YuvConstants* yuvconstants,
2219
- int width) {
2220
- int x;
2221
- int len = width / 16;
2222
- __m128i vec_y, vec_u, vec_v, out_b, out_g, out_r;
2223
- __m128i vec_yl, vec_yh, vec_ul, vec_vl, vec_uh, vec_vh;
2224
- __m128i vec_vr, vec_ub, vec_vg, vec_ug, vec_yg, vec_yb, vec_ugvg;
2225
- __m128i const_80 = __lsx_vldi(0x480);
2226
- __m128i alpha = __lsx_vldi(0xFF);
2227
- __m128i zero = __lsx_vldi(0);
2228
-
2229
- YUVTORGB_SETUP(yuvconstants, vec_vr, vec_ub, vec_vg, vec_ug, vec_yg, vec_yb);
2230
- vec_ugvg = __lsx_vilvl_h(vec_ug, vec_vg);
2231
-
2232
- for (x = 0; x < len; x++) {
2233
- vec_y = __lsx_vld(src_y, 0);
2234
- vec_u = __lsx_vld(src_u, 0);
2235
- vec_v = __lsx_vld(src_v, 0);
2236
- vec_yl = __lsx_vilvl_b(vec_y, vec_y);
2237
- vec_ul = __lsx_vilvl_b(zero, vec_u);
2238
- vec_vl = __lsx_vilvl_b(zero, vec_v);
2239
- I444TORGB(vec_yl, vec_ul, vec_vl, vec_ub, vec_vr, vec_ugvg, vec_yg, vec_yb,
2240
- out_b, out_g, out_r);
2241
- STOREARGB(alpha, out_r, out_g, out_b, dst_argb);
2242
- vec_yh = __lsx_vilvh_b(vec_y, vec_y);
2243
- vec_uh = __lsx_vilvh_b(zero, vec_u);
2244
- vec_vh = __lsx_vilvh_b(zero, vec_v);
2245
- I444TORGB(vec_yh, vec_uh, vec_vh, vec_ub, vec_vr, vec_ugvg, vec_yg, vec_yb,
2246
- out_b, out_g, out_r);
2247
- STOREARGB(alpha, out_r, out_g, out_b, dst_argb);
2248
- src_y += 16;
2249
- src_u += 16;
2250
- src_v += 16;
2251
- }
2252
- }
2253
-
2254
- void I400ToARGBRow_LSX(const uint8_t* src_y,
2255
- uint8_t* dst_argb,
2256
- const struct YuvConstants* yuvconstants,
2257
- int width) {
2258
- int x;
2259
- int len = width / 16;
2260
- __m128i vec_y, vec_yl, vec_yh, out0;
2261
- __m128i y_ev, y_od, dst0, dst1, dst2, dst3;
2262
- __m128i temp0, temp1;
2263
- __m128i alpha = __lsx_vldi(0xFF);
2264
- __m128i vec_yg = __lsx_vreplgr2vr_h(yuvconstants->kYToRgb[0]);
2265
- __m128i vec_yb = __lsx_vreplgr2vr_w(yuvconstants->kYBiasToRgb[0]);
2266
-
2267
- for (x = 0; x < len; x++) {
2268
- vec_y = __lsx_vld(src_y, 0);
2269
- vec_yl = __lsx_vilvl_b(vec_y, vec_y);
2270
- y_ev = __lsx_vmulwev_w_hu_h(vec_yl, vec_yg);
2271
- y_od = __lsx_vmulwod_w_hu_h(vec_yl, vec_yg);
2272
- y_ev = __lsx_vsrai_w(y_ev, 16);
2273
- y_od = __lsx_vsrai_w(y_od, 16);
2274
- y_ev = __lsx_vadd_w(y_ev, vec_yb);
2275
- y_od = __lsx_vadd_w(y_od, vec_yb);
2276
- y_ev = __lsx_vsrai_w(y_ev, 6);
2277
- y_od = __lsx_vsrai_w(y_od, 6);
2278
- y_ev = __lsx_vclip255_w(y_ev);
2279
- y_od = __lsx_vclip255_w(y_od);
2280
- out0 = __lsx_vpackev_h(y_od, y_ev);
2281
- temp0 = __lsx_vpackev_b(out0, out0);
2282
- temp1 = __lsx_vpackev_b(alpha, out0);
2283
- dst0 = __lsx_vilvl_h(temp1, temp0);
2284
- dst1 = __lsx_vilvh_h(temp1, temp0);
2285
- vec_yh = __lsx_vilvh_b(vec_y, vec_y);
2286
- y_ev = __lsx_vmulwev_w_hu_h(vec_yh, vec_yg);
2287
- y_od = __lsx_vmulwod_w_hu_h(vec_yh, vec_yg);
2288
- y_ev = __lsx_vsrai_w(y_ev, 16);
2289
- y_od = __lsx_vsrai_w(y_od, 16);
2290
- y_ev = __lsx_vadd_w(y_ev, vec_yb);
2291
- y_od = __lsx_vadd_w(y_od, vec_yb);
2292
- y_ev = __lsx_vsrai_w(y_ev, 6);
2293
- y_od = __lsx_vsrai_w(y_od, 6);
2294
- y_ev = __lsx_vclip255_w(y_ev);
2295
- y_od = __lsx_vclip255_w(y_od);
2296
- out0 = __lsx_vpackev_h(y_od, y_ev);
2297
- temp0 = __lsx_vpackev_b(out0, out0);
2298
- temp1 = __lsx_vpackev_b(alpha, out0);
2299
- dst2 = __lsx_vilvl_h(temp1, temp0);
2300
- dst3 = __lsx_vilvh_h(temp1, temp0);
2301
- __lsx_vst(dst0, dst_argb, 0);
2302
- __lsx_vst(dst1, dst_argb, 16);
2303
- __lsx_vst(dst2, dst_argb, 32);
2304
- __lsx_vst(dst3, dst_argb, 48);
2305
- dst_argb += 64;
2306
- src_y += 16;
2307
- }
2308
- }
2309
-
2310
- void J400ToARGBRow_LSX(const uint8_t* src_y, uint8_t* dst_argb, int width) {
2311
- int x;
2312
- int len = width / 16;
2313
- __m128i vec_y, dst0, dst1, dst2, dst3;
2314
- __m128i tmp0, tmp1, tmp2, tmp3;
2315
- __m128i alpha = __lsx_vldi(0xFF);
2316
-
2317
- for (x = 0; x < len; x++) {
2318
- vec_y = __lsx_vld(src_y, 0);
2319
- tmp0 = __lsx_vilvl_b(vec_y, vec_y);
2320
- tmp1 = __lsx_vilvh_b(vec_y, vec_y);
2321
- tmp2 = __lsx_vilvl_b(alpha, vec_y);
2322
- tmp3 = __lsx_vilvh_b(alpha, vec_y);
2323
- dst0 = __lsx_vilvl_h(tmp2, tmp0);
2324
- dst1 = __lsx_vilvh_h(tmp2, tmp0);
2325
- dst2 = __lsx_vilvl_h(tmp3, tmp1);
2326
- dst3 = __lsx_vilvh_h(tmp3, tmp1);
2327
- __lsx_vst(dst0, dst_argb, 0);
2328
- __lsx_vst(dst1, dst_argb, 16);
2329
- __lsx_vst(dst2, dst_argb, 32);
2330
- __lsx_vst(dst3, dst_argb, 48);
2331
- dst_argb += 64;
2332
- src_y += 16;
2333
- }
2334
- }
2335
-
2336
- void YUY2ToARGBRow_LSX(const uint8_t* src_yuy2,
2337
- uint8_t* dst_argb,
2338
- const struct YuvConstants* yuvconstants,
2339
- int width) {
2340
- int x;
2341
- int len = width / 8;
2342
- __m128i src0, vec_y, vec_vu;
2343
- __m128i vec_vr, vec_ub, vec_vg, vec_ug, vec_yg, vec_yb;
2344
- __m128i vec_vrub, vec_vgug;
2345
- __m128i out_b, out_g, out_r;
2346
- __m128i const_80 = __lsx_vldi(0x480);
2347
- __m128i zero = __lsx_vldi(0);
2348
- __m128i alpha = __lsx_vldi(0xFF);
2349
-
2350
- YUVTORGB_SETUP(yuvconstants, vec_vr, vec_ub, vec_vg, vec_ug, vec_yg, vec_yb);
2351
- vec_vrub = __lsx_vilvl_h(vec_vr, vec_ub);
2352
- vec_vgug = __lsx_vilvl_h(vec_vg, vec_ug);
2353
-
2354
- for (x = 0; x < len; x++) {
2355
- src0 = __lsx_vld(src_yuy2, 0);
2356
- vec_y = __lsx_vpickev_b(src0, src0);
2357
- vec_vu = __lsx_vpickod_b(src0, src0);
2358
- YUVTORGB(vec_y, vec_vu, vec_vrub, vec_vgug, vec_yg, vec_yb, out_b, out_g,
2359
- out_r);
2360
- STOREARGB(alpha, out_r, out_g, out_b, dst_argb);
2361
- src_yuy2 += 16;
2362
- }
2363
- }
2364
-
2365
- void UYVYToARGBRow_LSX(const uint8_t* src_uyvy,
2366
- uint8_t* dst_argb,
2367
- const struct YuvConstants* yuvconstants,
2368
- int width) {
2369
- int x;
2370
- int len = width / 8;
2371
- __m128i src0, vec_y, vec_vu;
2372
- __m128i vec_vr, vec_ub, vec_vg, vec_ug, vec_yg, vec_yb;
2373
- __m128i vec_vrub, vec_vgug;
2374
- __m128i out_b, out_g, out_r;
2375
- __m128i const_80 = __lsx_vldi(0x480);
2376
- __m128i zero = __lsx_vldi(0);
2377
- __m128i alpha = __lsx_vldi(0xFF);
2378
-
2379
- YUVTORGB_SETUP(yuvconstants, vec_vr, vec_ub, vec_vg, vec_ug, vec_yg, vec_yb);
2380
- vec_vrub = __lsx_vilvl_h(vec_vr, vec_ub);
2381
- vec_vgug = __lsx_vilvl_h(vec_vg, vec_ug);
2382
-
2383
- for (x = 0; x < len; x++) {
2384
- src0 = __lsx_vld(src_uyvy, 0);
2385
- vec_y = __lsx_vpickod_b(src0, src0);
2386
- vec_vu = __lsx_vpickev_b(src0, src0);
2387
- YUVTORGB(vec_y, vec_vu, vec_vrub, vec_vgug, vec_yg, vec_yb, out_b, out_g,
2388
- out_r);
2389
- STOREARGB(alpha, out_r, out_g, out_b, dst_argb);
2390
- src_uyvy += 16;
2391
- }
2392
- }
2393
-
2394
- void InterpolateRow_LSX(uint8_t* dst_ptr,
2395
- const uint8_t* src_ptr,
2396
- ptrdiff_t src_stride,
2397
- int width,
2398
- int32_t source_y_fraction) {
2399
- int x;
2400
- int y1_fraction = source_y_fraction;
2401
- int y0_fraction = 256 - y1_fraction;
2402
- const uint8_t* nex_ptr = src_ptr + src_stride;
2403
- uint16_t y_fractions;
2404
- int len = width / 32;
2405
- __m128i src0, src1, nex0, nex1;
2406
- __m128i dst0, dst1, y_frac;
2407
- __m128i tmp0, tmp1, tmp2, tmp3;
2408
- __m128i const_128 = __lsx_vldi(0x480);
2409
-
2410
- if (y1_fraction == 0) {
2411
- for (x = 0; x < len; x++) {
2412
- DUP2_ARG2(__lsx_vld, src_ptr, 0, src_ptr, 16, src0, src1);
2413
- __lsx_vst(src0, dst_ptr, 0);
2414
- __lsx_vst(src1, dst_ptr, 16);
2415
- src_ptr += 32;
2416
- dst_ptr += 32;
2417
- }
2418
- return;
2419
- }
2420
-
2421
- if (y1_fraction == 128) {
2422
- for (x = 0; x < len; x++) {
2423
- DUP2_ARG2(__lsx_vld, src_ptr, 0, src_ptr, 16, src0, src1);
2424
- DUP2_ARG2(__lsx_vld, nex_ptr, 0, nex_ptr, 16, nex0, nex1);
2425
- dst0 = __lsx_vavgr_bu(src0, nex0);
2426
- dst1 = __lsx_vavgr_bu(src1, nex1);
2427
- __lsx_vst(dst0, dst_ptr, 0);
2428
- __lsx_vst(dst1, dst_ptr, 16);
2429
- src_ptr += 32;
2430
- nex_ptr += 32;
2431
- dst_ptr += 32;
2432
- }
2433
- return;
2434
- }
2435
-
2436
- y_fractions = (uint16_t)(y0_fraction + (y1_fraction << 8));
2437
- y_frac = __lsx_vreplgr2vr_h(y_fractions);
2438
-
2439
- for (x = 0; x < len; x++) {
2440
- DUP2_ARG2(__lsx_vld, src_ptr, 0, src_ptr, 16, src0, src1);
2441
- DUP2_ARG2(__lsx_vld, nex_ptr, 0, nex_ptr, 16, nex0, nex1);
2442
- tmp0 = __lsx_vilvl_b(nex0, src0);
2443
- tmp1 = __lsx_vilvh_b(nex0, src0);
2444
- tmp2 = __lsx_vilvl_b(nex1, src1);
2445
- tmp3 = __lsx_vilvh_b(nex1, src1);
2446
- tmp0 = __lsx_vdp2add_h_bu(const_128, tmp0, y_frac);
2447
- tmp1 = __lsx_vdp2add_h_bu(const_128, tmp1, y_frac);
2448
- tmp2 = __lsx_vdp2add_h_bu(const_128, tmp2, y_frac);
2449
- tmp3 = __lsx_vdp2add_h_bu(const_128, tmp3, y_frac);
2450
- dst0 = __lsx_vsrlni_b_h(tmp1, tmp0, 8);
2451
- dst1 = __lsx_vsrlni_b_h(tmp3, tmp2, 8);
2452
- __lsx_vst(dst0, dst_ptr, 0);
2453
- __lsx_vst(dst1, dst_ptr, 16);
2454
- src_ptr += 32;
2455
- nex_ptr += 32;
2456
- dst_ptr += 32;
2457
- }
2458
- }
2459
-
2460
- void ARGBSetRow_LSX(uint8_t* dst_argb, uint32_t v32, int width) {
2461
- int x;
2462
- int len = width / 4;
2463
- __m128i dst0 = __lsx_vreplgr2vr_w(v32);
2464
-
2465
- for (x = 0; x < len; x++) {
2466
- __lsx_vst(dst0, dst_argb, 0);
2467
- dst_argb += 16;
2468
- }
2469
- }
2470
-
2471
- void RAWToRGB24Row_LSX(const uint8_t* src_raw, uint8_t* dst_rgb24, int width) {
2472
- int x;
2473
- int len = width / 16;
2474
- __m128i src0, src1, src2;
2475
- __m128i dst0, dst1, dst2;
2476
- __m128i shuf0 = {0x0708030405000102, 0x110C0D0E090A0B06};
2477
- __m128i shuf1 = {0x1516171213140F10, 0x1F1E1B1C1D18191A};
2478
- __m128i shuf2 = {0x090405060102031E, 0x0D0E0F0A0B0C0708};
2479
-
2480
- for (x = 0; x < len; x++) {
2481
- DUP2_ARG2(__lsx_vld, src_raw, 0, src_raw, 16, src0, src1);
2482
- src2 = __lsx_vld(src_raw, 32);
2483
- DUP2_ARG3(__lsx_vshuf_b, src1, src0, shuf0, src1, src0, shuf1, dst0, dst1);
2484
- dst2 = __lsx_vshuf_b(src1, src2, shuf2);
2485
- dst1 = __lsx_vinsgr2vr_b(dst1, src_raw[32], 0x0E);
2486
- __lsx_vst(dst0, dst_rgb24, 0);
2487
- __lsx_vst(dst1, dst_rgb24, 16);
2488
- __lsx_vst(dst2, dst_rgb24, 32);
2489
- dst_rgb24 += 48;
2490
- src_raw += 48;
2491
- }
2492
- }
2493
-
2494
- void MergeUVRow_LSX(const uint8_t* src_u,
2495
- const uint8_t* src_v,
2496
- uint8_t* dst_uv,
2497
- int width) {
2498
- int x;
2499
- int len = width / 16;
2500
- __m128i src0, src1, dst0, dst1;
2501
-
2502
- for (x = 0; x < len; x++) {
2503
- DUP2_ARG2(__lsx_vld, src_u, 0, src_v, 0, src0, src1);
2504
- dst0 = __lsx_vilvl_b(src1, src0);
2505
- dst1 = __lsx_vilvh_b(src1, src0);
2506
- __lsx_vst(dst0, dst_uv, 0);
2507
- __lsx_vst(dst1, dst_uv, 16);
2508
- src_u += 16;
2509
- src_v += 16;
2510
- dst_uv += 32;
2511
- }
2512
- }
2513
-
2514
- void ARGBExtractAlphaRow_LSX(const uint8_t* src_argb,
2515
- uint8_t* dst_a,
2516
- int width) {
2517
- int x;
2518
- int len = width / 16;
2519
- __m128i src0, src1, src2, src3, tmp0, tmp1, dst0;
2520
-
2521
- for (x = 0; x < len; x++) {
2522
- DUP4_ARG2(__lsx_vld, src_argb, 0, src_argb, 16, src_argb, 32, src_argb, 48,
2523
- src0, src1, src2, src3);
2524
- tmp0 = __lsx_vpickod_b(src1, src0);
2525
- tmp1 = __lsx_vpickod_b(src3, src2);
2526
- dst0 = __lsx_vpickod_b(tmp1, tmp0);
2527
- __lsx_vst(dst0, dst_a, 0);
2528
- src_argb += 64;
2529
- dst_a += 16;
2530
- }
2531
- }
2532
-
2533
- void ARGBBlendRow_LSX(const uint8_t* src_argb,
2534
- const uint8_t* src_argb1,
2535
- uint8_t* dst_argb,
2536
- int width) {
2537
- int x;
2538
- int len = width / 8;
2539
- __m128i src0, src1, src2, src3;
2540
- __m128i tmp0, tmp1, dst0, dst1;
2541
- __m128i reg0, reg1, reg2, reg3;
2542
- __m128i a0, a1, a2, a3;
2543
- __m128i const_256 = __lsx_vldi(0x500);
2544
- __m128i zero = __lsx_vldi(0);
2545
- __m128i alpha = __lsx_vldi(0xFF);
2546
- __m128i control = (__m128i)v2u64{0xFF000000FF000000, 0xFF000000FF000000};
2547
-
2548
- for (x = 0; x < len; x++) {
2549
- DUP4_ARG2(__lsx_vld, src_argb, 0, src_argb, 16, src_argb1, 0, src_argb1, 16,
2550
- src0, src1, src2, src3);
2551
- tmp0 = __lsx_vshuf4i_b(src0, 0xFF);
2552
- tmp1 = __lsx_vshuf4i_b(src1, 0xFF);
2553
- a0 = __lsx_vilvl_b(zero, tmp0);
2554
- a1 = __lsx_vilvh_b(zero, tmp0);
2555
- a2 = __lsx_vilvl_b(zero, tmp1);
2556
- a3 = __lsx_vilvh_b(zero, tmp1);
2557
- reg0 = __lsx_vilvl_b(zero, src2);
2558
- reg1 = __lsx_vilvh_b(zero, src2);
2559
- reg2 = __lsx_vilvl_b(zero, src3);
2560
- reg3 = __lsx_vilvh_b(zero, src3);
2561
- DUP4_ARG2(__lsx_vsub_h, const_256, a0, const_256, a1, const_256, a2,
2562
- const_256, a3, a0, a1, a2, a3);
2563
- DUP4_ARG2(__lsx_vmul_h, a0, reg0, a1, reg1, a2, reg2, a3, reg3, reg0, reg1,
2564
- reg2, reg3);
2565
- DUP2_ARG3(__lsx_vsrani_b_h, reg1, reg0, 8, reg3, reg2, 8, dst0, dst1);
2566
- dst0 = __lsx_vsadd_bu(dst0, src0);
2567
- dst1 = __lsx_vsadd_bu(dst1, src1);
2568
- dst0 = __lsx_vbitsel_v(dst0, alpha, control);
2569
- dst1 = __lsx_vbitsel_v(dst1, alpha, control);
2570
- __lsx_vst(dst0, dst_argb, 0);
2571
- __lsx_vst(dst1, dst_argb, 16);
2572
- src_argb += 32;
2573
- src_argb1 += 32;
2574
- dst_argb += 32;
2575
- }
2576
- }
2577
-
2578
- void ARGBQuantizeRow_LSX(uint8_t* dst_argb,
2579
- int scale,
2580
- int interval_size,
2581
- int interval_offset,
2582
- int width) {
2583
- int x;
2584
- int len = width / 16;
2585
- __m128i src0, src1, src2, src3, dst0, dst1, dst2, dst3;
2586
- __m128i tmp0, tmp1, tmp2, tmp3, tmp4, tmp5, tmp6, tmp7;
2587
- __m128i reg0, reg1, reg2, reg3, reg4, reg5, reg6, reg7;
2588
- __m128i vec_size = __lsx_vreplgr2vr_b(interval_size);
2589
- __m128i vec_offset = __lsx_vreplgr2vr_b(interval_offset);
2590
- __m128i vec_scale = __lsx_vreplgr2vr_w(scale);
2591
- __m128i zero = __lsx_vldi(0);
2592
- __m128i control = (__m128i)v2u64{0xFF000000FF000000, 0xFF000000FF000000};
2593
-
2594
- for (x = 0; x < len; x++) {
2595
- DUP4_ARG2(__lsx_vld, dst_argb, 0, dst_argb, 16, dst_argb, 32, dst_argb, 48,
2596
- src0, src1, src2, src3);
2597
- reg0 = __lsx_vilvl_b(zero, src0);
2598
- reg1 = __lsx_vilvh_b(zero, src0);
2599
- reg2 = __lsx_vilvl_b(zero, src1);
2600
- reg3 = __lsx_vilvh_b(zero, src1);
2601
- reg4 = __lsx_vilvl_b(zero, src2);
2602
- reg5 = __lsx_vilvh_b(zero, src2);
2603
- reg6 = __lsx_vilvl_b(zero, src3);
2604
- reg7 = __lsx_vilvh_b(zero, src3);
2605
- tmp0 = __lsx_vilvl_h(zero, reg0);
2606
- tmp1 = __lsx_vilvh_h(zero, reg0);
2607
- tmp2 = __lsx_vilvl_h(zero, reg1);
2608
- tmp3 = __lsx_vilvh_h(zero, reg1);
2609
- tmp4 = __lsx_vilvl_h(zero, reg2);
2610
- tmp5 = __lsx_vilvh_h(zero, reg2);
2611
- tmp6 = __lsx_vilvl_h(zero, reg3);
2612
- tmp7 = __lsx_vilvh_h(zero, reg3);
2613
- DUP4_ARG2(__lsx_vmul_w, tmp0, vec_scale, tmp1, vec_scale, tmp2, vec_scale,
2614
- tmp3, vec_scale, tmp0, tmp1, tmp2, tmp3);
2615
- DUP4_ARG2(__lsx_vmul_w, tmp4, vec_scale, tmp5, vec_scale, tmp6, vec_scale,
2616
- tmp7, vec_scale, tmp4, tmp5, tmp6, tmp7);
2617
- DUP4_ARG3(__lsx_vsrani_h_w, tmp1, tmp0, 16, tmp3, tmp2, 16, tmp5, tmp4, 16,
2618
- tmp7, tmp6, 16, reg0, reg1, reg2, reg3);
2619
- dst0 = __lsx_vpickev_b(reg1, reg0);
2620
- dst1 = __lsx_vpickev_b(reg3, reg2);
2621
- tmp0 = __lsx_vilvl_h(zero, reg4);
2622
- tmp1 = __lsx_vilvh_h(zero, reg4);
2623
- tmp2 = __lsx_vilvl_h(zero, reg5);
2624
- tmp3 = __lsx_vilvh_h(zero, reg5);
2625
- tmp4 = __lsx_vilvl_h(zero, reg6);
2626
- tmp5 = __lsx_vilvh_h(zero, reg6);
2627
- tmp6 = __lsx_vilvl_h(zero, reg7);
2628
- tmp7 = __lsx_vilvh_h(zero, reg7);
2629
- DUP4_ARG2(__lsx_vmul_w, tmp0, vec_scale, tmp1, vec_scale, tmp2, vec_scale,
2630
- tmp3, vec_scale, tmp0, tmp1, tmp2, tmp3);
2631
- DUP4_ARG2(__lsx_vmul_w, tmp4, vec_scale, tmp5, vec_scale, tmp6, vec_scale,
2632
- tmp7, vec_scale, tmp4, tmp5, tmp6, tmp7);
2633
- DUP4_ARG3(__lsx_vsrani_h_w, tmp1, tmp0, 16, tmp3, tmp2, 16, tmp5, tmp4, 16,
2634
- tmp7, tmp6, 16, reg0, reg1, reg2, reg3);
2635
- dst2 = __lsx_vpickev_b(reg1, reg0);
2636
- dst3 = __lsx_vpickev_b(reg3, reg2);
2637
- DUP4_ARG2(__lsx_vmul_b, dst0, vec_size, dst1, vec_size, dst2, vec_size,
2638
- dst3, vec_size, dst0, dst1, dst2, dst3);
2639
- DUP4_ARG2(__lsx_vadd_b, dst0, vec_offset, dst1, vec_offset, dst2,
2640
- vec_offset, dst3, vec_offset, dst0, dst1, dst2, dst3);
2641
- DUP4_ARG3(__lsx_vbitsel_v, dst0, src0, control, dst1, src1, control, dst2,
2642
- src2, control, dst3, src3, control, dst0, dst1, dst2, dst3);
2643
- __lsx_vst(dst0, dst_argb, 0);
2644
- __lsx_vst(dst1, dst_argb, 16);
2645
- __lsx_vst(dst2, dst_argb, 32);
2646
- __lsx_vst(dst3, dst_argb, 48);
2647
- dst_argb += 64;
2648
- }
2649
- }
2650
-
2651
- void ARGBColorMatrixRow_LSX(const uint8_t* src_argb,
2652
- uint8_t* dst_argb,
2653
- const int8_t* matrix_argb,
2654
- int width) {
2655
- int x;
2656
- int len = width / 8;
2657
- __m128i src0, src1, tmp0, tmp1, dst0, dst1;
2658
- __m128i tmp_b, tmp_g, tmp_r, tmp_a;
2659
- __m128i reg_b, reg_g, reg_r, reg_a;
2660
- __m128i matrix_b = __lsx_vldrepl_w(matrix_argb, 0);
2661
- __m128i matrix_g = __lsx_vldrepl_w(matrix_argb, 4);
2662
- __m128i matrix_r = __lsx_vldrepl_w(matrix_argb, 8);
2663
- __m128i matrix_a = __lsx_vldrepl_w(matrix_argb, 12);
2664
-
2665
- for (x = 0; x < len; x++) {
2666
- DUP2_ARG2(__lsx_vld, src_argb, 0, src_argb, 16, src0, src1);
2667
- DUP4_ARG2(__lsx_vdp2_h_bu_b, src0, matrix_b, src0, matrix_g, src0, matrix_r,
2668
- src0, matrix_a, tmp_b, tmp_g, tmp_r, tmp_a);
2669
- DUP4_ARG2(__lsx_vdp2_h_bu_b, src1, matrix_b, src1, matrix_g, src1, matrix_r,
2670
- src1, matrix_a, reg_b, reg_g, reg_r, reg_a);
2671
- DUP4_ARG2(__lsx_vhaddw_w_h, tmp_b, tmp_b, tmp_g, tmp_g, tmp_r, tmp_r, tmp_a,
2672
- tmp_a, tmp_b, tmp_g, tmp_r, tmp_a);
2673
- DUP4_ARG2(__lsx_vhaddw_w_h, reg_b, reg_b, reg_g, reg_g, reg_r, reg_r, reg_a,
2674
- reg_a, reg_b, reg_g, reg_r, reg_a);
2675
- DUP4_ARG2(__lsx_vsrai_w, tmp_b, 6, tmp_g, 6, tmp_r, 6, tmp_a, 6, tmp_b,
2676
- tmp_g, tmp_r, tmp_a);
2677
- DUP4_ARG2(__lsx_vsrai_w, reg_b, 6, reg_g, 6, reg_r, 6, reg_a, 6, reg_b,
2678
- reg_g, reg_r, reg_a);
2679
- DUP4_ARG1(__lsx_vclip255_w, tmp_b, tmp_g, tmp_r, tmp_a, tmp_b, tmp_g, tmp_r,
2680
- tmp_a)
2681
- DUP4_ARG1(__lsx_vclip255_w, reg_b, reg_g, reg_r, reg_a, reg_b, reg_g, reg_r,
2682
- reg_a)
2683
- DUP4_ARG2(__lsx_vpickev_h, reg_b, tmp_b, reg_g, tmp_g, reg_r, tmp_r, reg_a,
2684
- tmp_a, tmp_b, tmp_g, tmp_r, tmp_a);
2685
- tmp0 = __lsx_vpackev_b(tmp_g, tmp_b);
2686
- tmp1 = __lsx_vpackev_b(tmp_a, tmp_r);
2687
- dst0 = __lsx_vilvl_h(tmp1, tmp0);
2688
- dst1 = __lsx_vilvh_h(tmp1, tmp0);
2689
- __lsx_vst(dst0, dst_argb, 0);
2690
- __lsx_vst(dst1, dst_argb, 16);
2691
- src_argb += 32;
2692
- dst_argb += 32;
2693
- }
2694
- }
2695
-
2696
- void SplitUVRow_LSX(const uint8_t* src_uv,
2697
- uint8_t* dst_u,
2698
- uint8_t* dst_v,
2699
- int width) {
2700
- int x;
2701
- int len = width / 32;
2702
- __m128i src0, src1, src2, src3;
2703
- __m128i dst0, dst1, dst2, dst3;
2704
-
2705
- for (x = 0; x < len; x++) {
2706
- DUP4_ARG2(__lsx_vld, src_uv, 0, src_uv, 16, src_uv, 32, src_uv, 48, src0,
2707
- src1, src2, src3);
2708
- DUP2_ARG2(__lsx_vpickev_b, src1, src0, src3, src2, dst0, dst1);
2709
- DUP2_ARG2(__lsx_vpickod_b, src1, src0, src3, src2, dst2, dst3);
2710
- __lsx_vst(dst0, dst_u, 0);
2711
- __lsx_vst(dst1, dst_u, 16);
2712
- __lsx_vst(dst2, dst_v, 0);
2713
- __lsx_vst(dst3, dst_v, 16);
2714
- src_uv += 64;
2715
- dst_u += 32;
2716
- dst_v += 32;
2717
- }
2718
- }
2719
-
2720
- void SetRow_LSX(uint8_t* dst, uint8_t v8, int width) {
2721
- int x;
2722
- int len = width / 16;
2723
- __m128i dst0 = __lsx_vreplgr2vr_b(v8);
2724
-
2725
- for (x = 0; x < len; x++) {
2726
- __lsx_vst(dst0, dst, 0);
2727
- dst += 16;
2728
- }
2729
- }
2730
-
2731
- void MirrorSplitUVRow_LSX(const uint8_t* src_uv,
2732
- uint8_t* dst_u,
2733
- uint8_t* dst_v,
2734
- int width) {
2735
- int x;
2736
- int len = width / 32;
2737
- __m128i src0, src1, src2, src3;
2738
- __m128i dst0, dst1, dst2, dst3;
2739
- __m128i shuff0 = {0x10121416181A1C1E, 0x00020406080A0C0E};
2740
- __m128i shuff1 = {0x11131517191B1D1F, 0x01030507090B0D0F};
2741
-
2742
- src_uv += (width << 1);
2743
- for (x = 0; x < len; x++) {
2744
- src_uv -= 64;
2745
- DUP4_ARG2(__lsx_vld, src_uv, 0, src_uv, 16, src_uv, 32, src_uv, 48, src2,
2746
- src3, src0, src1);
2747
- DUP4_ARG3(__lsx_vshuf_b, src1, src0, shuff1, src3, src2, shuff1, src1, src0,
2748
- shuff0, src3, src2, shuff0, dst0, dst1, dst2, dst3);
2749
- __lsx_vst(dst0, dst_v, 0);
2750
- __lsx_vst(dst1, dst_v, 16);
2751
- __lsx_vst(dst2, dst_u, 0);
2752
- __lsx_vst(dst3, dst_u, 16);
2753
- dst_u += 32;
2754
- dst_v += 32;
2755
- }
2756
- }
2757
-
2758
- void HalfFloatRow_LSX(const uint16_t* src,
2759
- uint16_t* dst,
2760
- float scale,
2761
- int width) {
2762
- int x;
2763
- int len = width / 32;
2764
- float mult = 1.9259299444e-34f * scale;
2765
- __m128i src0, src1, src2, src3, dst0, dst1, dst2, dst3;
2766
- __m128i tmp0, tmp1, tmp2, tmp3, tmp4, tmp5, tmp6, tmp7;
2767
- __m128 reg0, reg1, reg2, reg3, reg4, reg5, reg6, reg7;
2768
- __m128 vec_mult = (__m128)__lsx_vldrepl_w(&mult, 0);
2769
- __m128i zero = __lsx_vldi(0);
2770
-
2771
- for (x = 0; x < len; x++) {
2772
- DUP4_ARG2(__lsx_vld, src, 0, src, 16, src, 32, src, 48, src0, src1, src2,
2773
- src3);
2774
- DUP4_ARG2(__lsx_vilvl_h, zero, src0, zero, src1, zero, src2, zero, src3,
2775
- tmp0, tmp2, tmp4, tmp6);
2776
- DUP4_ARG2(__lsx_vilvh_h, zero, src0, zero, src1, zero, src2, zero, src3,
2777
- tmp1, tmp3, tmp5, tmp7);
2778
- DUP4_ARG1(__lsx_vffint_s_wu, tmp0, tmp2, tmp4, tmp6, reg0, reg2, reg4,
2779
- reg6);
2780
- DUP4_ARG1(__lsx_vffint_s_wu, tmp1, tmp3, tmp5, tmp7, reg1, reg3, reg5,
2781
- reg7);
2782
- DUP4_ARG2(__lsx_vfmul_s, reg0, vec_mult, reg1, vec_mult, reg2, vec_mult,
2783
- reg3, vec_mult, reg0, reg1, reg2, reg3);
2784
- DUP4_ARG2(__lsx_vfmul_s, reg4, vec_mult, reg5, vec_mult, reg6, vec_mult,
2785
- reg7, vec_mult, reg4, reg5, reg6, reg7);
2786
- DUP4_ARG2(__lsx_vsrli_w, (v4u32)reg0, 13, (v4u32)reg1, 13, (v4u32)reg2, 13,
2787
- (v4u32)reg3, 13, tmp0, tmp1, tmp2, tmp3);
2788
- DUP4_ARG2(__lsx_vsrli_w, (v4u32)reg4, 13, (v4u32)reg5, 13, (v4u32)reg6, 13,
2789
- (v4u32)reg7, 13, tmp4, tmp5, tmp6, tmp7);
2790
- DUP4_ARG2(__lsx_vpickev_h, tmp1, tmp0, tmp3, tmp2, tmp5, tmp4, tmp7, tmp6,
2791
- dst0, dst1, dst2, dst3);
2792
- __lsx_vst(dst0, dst, 0);
2793
- __lsx_vst(dst1, dst, 16);
2794
- __lsx_vst(dst2, dst, 32);
2795
- __lsx_vst(dst3, dst, 48);
2796
- src += 32;
2797
- dst += 32;
2798
- }
2799
- }
2800
-
2801
- #ifndef RgbConstants
2802
- struct RgbConstants {
2803
- uint8_t kRGBToY[4];
2804
- uint16_t kAddY;
2805
- uint16_t pad;
2806
- };
2807
- #define RgbConstants RgbConstants
2808
-
2809
- // RGB to JPeg coefficients
2810
- // B * 0.1140 coefficient = 29
2811
- // G * 0.5870 coefficient = 150
2812
- // R * 0.2990 coefficient = 77
2813
- // Add 0.5 = 0x80
2814
- static const struct RgbConstants kRgb24JPEGConstants = {{29, 150, 77, 0},
2815
- 128,
2816
- 0};
2817
-
2818
- static const struct RgbConstants kRawJPEGConstants = {{77, 150, 29, 0}, 128, 0};
2819
-
2820
- // RGB to BT.601 coefficients
2821
- // B * 0.1016 coefficient = 25
2822
- // G * 0.5078 coefficient = 129
2823
- // R * 0.2578 coefficient = 66
2824
- // Add 16.5 = 0x1080
2825
-
2826
- static const struct RgbConstants kRgb24I601Constants = {{25, 129, 66, 0},
2827
- 0x1080,
2828
- 0};
2829
-
2830
- static const struct RgbConstants kRawI601Constants = {{66, 129, 25, 0},
2831
- 0x1080,
2832
- 0};
2833
- #endif // RgbConstants
2834
-
2835
- // ARGB expects first 3 values to contain RGB and 4th value is ignored.
2836
- static void ARGBToYMatrixRow_LSX(const uint8_t* src_argb,
2837
- uint8_t* dst_y,
2838
- int width,
2839
- const struct RgbConstants* rgbconstants) {
2840
- asm volatile(
2841
- "vldrepl.b $vr0, %3, 0 \n\t" // load rgbconstants
2842
- "vldrepl.b $vr1, %3, 1 \n\t" // load rgbconstants
2843
- "vldrepl.b $vr2, %3, 2 \n\t" // load rgbconstants
2844
- "vldrepl.h $vr3, %3, 4 \n\t" // load rgbconstants
2845
- "1: \n\t"
2846
- "vld $vr4, %0, 0 \n\t"
2847
- "vld $vr5, %0, 16 \n\t"
2848
- "vld $vr6, %0, 32 \n\t"
2849
- "vld $vr7, %0, 48 \n\t" // load 16 pixels of
2850
- // ARGB
2851
- "vor.v $vr12, $vr3, $vr3 \n\t"
2852
- "vor.v $vr13, $vr3, $vr3 \n\t"
2853
- "addi.d %2, %2, -16 \n\t" // 16 processed per
2854
- // loop.
2855
- "vpickev.b $vr8, $vr5, $vr4 \n\t" // BR
2856
- "vpickev.b $vr10, $vr7, $vr6 \n\t"
2857
- "vpickod.b $vr9, $vr5, $vr4 \n\t" // GA
2858
- "vpickod.b $vr11, $vr7, $vr6 \n\t"
2859
- "vmaddwev.h.bu $vr12, $vr8, $vr0 \n\t" // B
2860
- "vmaddwev.h.bu $vr13, $vr10, $vr0 \n\t"
2861
- "vmaddwev.h.bu $vr12, $vr9, $vr1 \n\t" // G
2862
- "vmaddwev.h.bu $vr13, $vr11, $vr1 \n\t"
2863
- "vmaddwod.h.bu $vr12, $vr8, $vr2 \n\t" // R
2864
- "vmaddwod.h.bu $vr13, $vr10, $vr2 \n\t"
2865
- "addi.d %0, %0, 64 \n\t"
2866
- "vpickod.b $vr10, $vr13, $vr12 \n\t"
2867
- "vst $vr10, %1, 0 \n\t"
2868
- "addi.d %1, %1, 16 \n\t"
2869
- "bnez %2, 1b \n\t"
2870
- : "+&r"(src_argb), // %0
2871
- "+&r"(dst_y), // %1
2872
- "+&r"(width) // %2
2873
- : "r"(rgbconstants)
2874
- : "memory");
2875
- }
2876
-
2877
- void ARGBToYRow_LSX(const uint8_t* src_argb, uint8_t* dst_y, int width) {
2878
- ARGBToYMatrixRow_LSX(src_argb, dst_y, width, &kRgb24I601Constants);
2879
- }
2880
-
2881
- void ARGBToYJRow_LSX(const uint8_t* src_argb, uint8_t* dst_yj, int width) {
2882
- ARGBToYMatrixRow_LSX(src_argb, dst_yj, width, &kRgb24JPEGConstants);
2883
- }
2884
-
2885
- void ABGRToYRow_LSX(const uint8_t* src_abgr, uint8_t* dst_y, int width) {
2886
- ARGBToYMatrixRow_LSX(src_abgr, dst_y, width, &kRawI601Constants);
2887
- }
2888
-
2889
- void ABGRToYJRow_LSX(const uint8_t* src_abgr, uint8_t* dst_yj, int width) {
2890
- ARGBToYMatrixRow_LSX(src_abgr, dst_yj, width, &kRawJPEGConstants);
2891
- }
2892
-
2893
- // RGBA expects first value to be A and ignored, then 3 values to contain RGB.
2894
- // Same code as ARGB, except the LD4
2895
- static void RGBAToYMatrixRow_LSX(const uint8_t* src_rgba,
2896
- uint8_t* dst_y,
2897
- int width,
2898
- const struct RgbConstants* rgbconstants) {
2899
- asm volatile(
2900
- "vldrepl.b $vr0, %3, 0 \n\t" // load rgbconstants
2901
- "vldrepl.b $vr1, %3, 1 \n\t" // load rgbconstants
2902
- "vldrepl.b $vr2, %3, 2 \n\t" // load rgbconstants
2903
- "vldrepl.h $vr3, %3, 4 \n\t" // load rgbconstants
2904
- "1: \n\t"
2905
- "vld $vr4, %0, 0 \n\t"
2906
- "vld $vr5, %0, 16 \n\t"
2907
- "vld $vr6, %0, 32 \n\t"
2908
- "vld $vr7, %0, 48 \n\t" // load 16 pixels of
2909
- // RGBA
2910
- "vor.v $vr12, $vr3, $vr3 \n\t"
2911
- "vor.v $vr13, $vr3, $vr3 \n\t"
2912
- "addi.d %2, %2, -16 \n\t" // 16 processed per
2913
- // loop.
2914
- "vpickev.b $vr8, $vr5, $vr4 \n\t" // AG
2915
- "vpickev.b $vr10, $vr7, $vr6 \n\t"
2916
- "vpickod.b $vr9, $vr5, $vr4 \n\t" // BR
2917
- "vpickod.b $vr11, $vr7, $vr6 \n\t"
2918
- "vmaddwev.h.bu $vr12, $vr9, $vr0 \n\t" // B
2919
- "vmaddwev.h.bu $vr13, $vr11, $vr0 \n\t"
2920
- "vmaddwod.h.bu $vr12, $vr8, $vr1 \n\t" // G
2921
- "vmaddwod.h.bu $vr13, $vr10, $vr1 \n\t"
2922
- "vmaddwod.h.bu $vr12, $vr9, $vr2 \n\t" // R
2923
- "vmaddwod.h.bu $vr13, $vr11, $vr2 \n\t"
2924
- "addi.d %0, %0, 64 \n\t"
2925
- "vpickod.b $vr10, $vr13, $vr12 \n\t"
2926
- "vst $vr10, %1, 0 \n\t"
2927
- "addi.d %1, %1, 16 \n\t"
2928
- "bnez %2, 1b \n\t"
2929
- : "+&r"(src_rgba), // %0
2930
- "+&r"(dst_y), // %1
2931
- "+&r"(width) // %2
2932
- : "r"(rgbconstants)
2933
- : "memory");
2934
- }
2935
-
2936
- void RGBAToYRow_LSX(const uint8_t* src_rgba, uint8_t* dst_y, int width) {
2937
- RGBAToYMatrixRow_LSX(src_rgba, dst_y, width, &kRgb24I601Constants);
2938
- }
2939
-
2940
- void RGBAToYJRow_LSX(const uint8_t* src_rgba, uint8_t* dst_yj, int width) {
2941
- RGBAToYMatrixRow_LSX(src_rgba, dst_yj, width, &kRgb24JPEGConstants);
2942
- }
2943
-
2944
- void BGRAToYRow_LSX(const uint8_t* src_bgra, uint8_t* dst_y, int width) {
2945
- RGBAToYMatrixRow_LSX(src_bgra, dst_y, width, &kRawI601Constants);
2946
- }
2947
-
2948
- static void RGBToYMatrixRow_LSX(const uint8_t* src_rgba,
2949
- uint8_t* dst_y,
2950
- int width,
2951
- const struct RgbConstants* rgbconstants) {
2952
- int8_t shuff[64] = {0, 2, 3, 5, 6, 8, 9, 11, 12, 14, 15, 17, 18,
2953
- 20, 21, 23, 24, 26, 27, 29, 30, 0, 1, 3, 4, 6,
2954
- 7, 9, 10, 12, 13, 15, 1, 0, 4, 0, 7, 0, 10,
2955
- 0, 13, 0, 16, 0, 19, 0, 22, 0, 25, 0, 28, 0,
2956
- 31, 0, 2, 0, 5, 0, 8, 0, 11, 0, 14, 0};
2957
- asm volatile(
2958
- "vldrepl.b $vr0, %3, 0 \n\t" // load rgbconstants
2959
- "vldrepl.b $vr1, %3, 1 \n\t" // load rgbconstants
2960
- "vldrepl.b $vr2, %3, 2 \n\t" // load rgbconstants
2961
- "vldrepl.h $vr3, %3, 4 \n\t" // load rgbconstants
2962
- "vld $vr4, %4, 0 \n\t" // load shuff
2963
- "vld $vr5, %4, 16 \n\t"
2964
- "vld $vr6, %4, 32 \n\t"
2965
- "vld $vr7, %4, 48 \n\t"
2966
- "1: \n\t"
2967
- "vld $vr8, %0, 0 \n\t"
2968
- "vld $vr9, %0, 16 \n\t"
2969
- "vld $vr10, %0, 32 \n\t" // load 16 pixels of
2970
- // RGB
2971
- "vor.v $vr12, $vr3, $vr3 \n\t"
2972
- "vor.v $vr13, $vr3, $vr3 \n\t"
2973
- "addi.d %2, %2, -16 \n\t" // 16 processed per
2974
- // loop.
2975
- "vshuf.b $vr14, $vr9, $vr8, $vr4 \n\t"
2976
- "vshuf.b $vr15, $vr9, $vr10, $vr5 \n\t"
2977
- "vshuf.b $vr16, $vr9, $vr8, $vr6 \n\t"
2978
- "vshuf.b $vr17, $vr9, $vr10, $vr7 \n\t"
2979
- "vmaddwev.h.bu $vr12, $vr16, $vr1 \n\t" // G
2980
- "vmaddwev.h.bu $vr13, $vr17, $vr1 \n\t"
2981
- "vmaddwev.h.bu $vr12, $vr14, $vr0 \n\t" // B
2982
- "vmaddwev.h.bu $vr13, $vr15, $vr0 \n\t"
2983
- "vmaddwod.h.bu $vr12, $vr14, $vr2 \n\t" // R
2984
- "vmaddwod.h.bu $vr13, $vr15, $vr2 \n\t"
2985
- "addi.d %0, %0, 48 \n\t"
2986
- "vpickod.b $vr10, $vr13, $vr12 \n\t"
2987
- "vst $vr10, %1, 0 \n\t"
2988
- "addi.d %1, %1, 16 \n\t"
2989
- "bnez %2, 1b \n\t"
2990
- : "+&r"(src_rgba), // %0
2991
- "+&r"(dst_y), // %1
2992
- "+&r"(width) // %2
2993
- : "r"(rgbconstants), // %3
2994
- "r"(shuff) // %4
2995
- : "memory");
2996
- }
2997
-
2998
- void RGB24ToYJRow_LSX(const uint8_t* src_rgb24, uint8_t* dst_yj, int width) {
2999
- RGBToYMatrixRow_LSX(src_rgb24, dst_yj, width, &kRgb24JPEGConstants);
3000
- }
3001
-
3002
- void RAWToYJRow_LSX(const uint8_t* src_raw, uint8_t* dst_yj, int width) {
3003
- RGBToYMatrixRow_LSX(src_raw, dst_yj, width, &kRawJPEGConstants);
3004
- }
3005
-
3006
- void RGB24ToYRow_LSX(const uint8_t* src_rgb24, uint8_t* dst_y, int width) {
3007
- RGBToYMatrixRow_LSX(src_rgb24, dst_y, width, &kRgb24I601Constants);
3008
- }
3009
-
3010
- void RAWToYRow_LSX(const uint8_t* src_raw, uint8_t* dst_y, int width) {
3011
- RGBToYMatrixRow_LSX(src_raw, dst_y, width, &kRawI601Constants);
3012
- }
3013
-
3014
- // undef for unified sources build
3015
- #undef YUVTORGB_SETUP
3016
- #undef READYUV422_D
3017
- #undef READYUV422
3018
- #undef YUVTORGB_D
3019
- #undef YUVTORGB
3020
- #undef I444TORGB
3021
- #undef STOREARGB_D
3022
- #undef STOREARGB
3023
- #undef RGBTOUV
3024
-
3025
- #ifdef __cplusplus
3026
- } // extern "C"
3027
- } // namespace libyuv
3028
- #endif
3029
-
3030
- #endif // !defined(LIBYUV_DISABLE_LSX) && defined(__loongarch_sx)