react-native-vision-camera-spoof-detector 1.0.22 → 1.0.24

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (206) hide show
  1. package/README.md +442 -442
  2. package/android/.gradle/9.2.0/checksums/checksums.lock +0 -0
  3. package/android/.gradle/9.2.0/fileHashes/fileHashes.bin +0 -0
  4. package/android/.gradle/9.2.0/fileHashes/fileHashes.lock +0 -0
  5. package/android/.gradle/buildOutputCleanup/buildOutputCleanup.lock +0 -0
  6. package/android/.gradle/buildOutputCleanup/cache.properties +2 -2
  7. package/android/build/reports/problems/problems-report.html +659 -0
  8. package/android/build.gradle +12 -4
  9. package/android/src/main/cpp/CMakeLists.txt +101 -94
  10. package/android/src/main/cpp/libyuv/.clang-format +6 -6
  11. package/android/src/main/cpp/libyuv/.gn +40 -40
  12. package/android/src/main/cpp/libyuv/.vpython3 +410 -410
  13. package/android/src/main/cpp/libyuv/AUTHORS +7 -7
  14. package/android/src/main/cpp/libyuv/Android.bp +202 -202
  15. package/android/src/main/cpp/libyuv/Android.mk +106 -106
  16. package/android/src/main/cpp/libyuv/BUILD.gn +490 -490
  17. package/android/src/main/cpp/libyuv/CM_linux_packages.cmake +70 -70
  18. package/android/src/main/cpp/libyuv/CMakeLists.txt +259 -252
  19. package/android/src/main/cpp/libyuv/DEPS +935 -935
  20. package/android/src/main/cpp/libyuv/DIR_METADATA +3 -3
  21. package/android/src/main/cpp/libyuv/LICENSE +29 -29
  22. package/android/src/main/cpp/libyuv/OWNERS +11 -11
  23. package/android/src/main/cpp/libyuv/PATENTS +23 -23
  24. package/android/src/main/cpp/libyuv/PRESUBMIT.py +65 -65
  25. package/android/src/main/cpp/libyuv/README.chromium +11 -11
  26. package/android/src/main/cpp/libyuv/README.md +19 -19
  27. package/android/src/main/cpp/libyuv/build_overrides/build.gni +60 -60
  28. package/android/src/main/cpp/libyuv/build_overrides/gtest.gni +19 -19
  29. package/android/src/main/cpp/libyuv/build_overrides/partition_alloc.gni +17 -17
  30. package/android/src/main/cpp/libyuv/codereview.settings +5 -5
  31. package/android/src/main/cpp/libyuv/docs/deprecated_builds.md +409 -409
  32. package/android/src/main/cpp/libyuv/docs/environment_variables.md +64 -64
  33. package/android/src/main/cpp/libyuv/docs/feature_detection.md +108 -108
  34. package/android/src/main/cpp/libyuv/docs/filtering.md +196 -196
  35. package/android/src/main/cpp/libyuv/docs/formats.md +208 -208
  36. package/android/src/main/cpp/libyuv/docs/getting_started.md +296 -296
  37. package/android/src/main/cpp/libyuv/docs/rotation.md +107 -107
  38. package/android/src/main/cpp/libyuv/download_vs_toolchain.py +29 -29
  39. package/android/src/main/cpp/libyuv/include/libyuv/basic_types.h +68 -68
  40. package/android/src/main/cpp/libyuv/include/libyuv/compare.h +111 -111
  41. package/android/src/main/cpp/libyuv/include/libyuv/compare_row.h +112 -112
  42. package/android/src/main/cpp/libyuv/include/libyuv/convert.h +1117 -1117
  43. package/android/src/main/cpp/libyuv/include/libyuv/convert_argb.h +2335 -2335
  44. package/android/src/main/cpp/libyuv/include/libyuv/convert_from.h +203 -203
  45. package/android/src/main/cpp/libyuv/include/libyuv/convert_from_argb.h +394 -394
  46. package/android/src/main/cpp/libyuv/include/libyuv/cpu_id.h +147 -147
  47. package/android/src/main/cpp/libyuv/include/libyuv/cpu_support.h +99 -99
  48. package/android/src/main/cpp/libyuv/include/libyuv/loongson_intrinsics.h +1949 -1949
  49. package/android/src/main/cpp/libyuv/include/libyuv/mjpeg_decoder.h +195 -195
  50. package/android/src/main/cpp/libyuv/include/libyuv/planar_functions.h +1131 -1131
  51. package/android/src/main/cpp/libyuv/include/libyuv/rotate.h +296 -296
  52. package/android/src/main/cpp/libyuv/include/libyuv/rotate_argb.h +37 -37
  53. package/android/src/main/cpp/libyuv/include/libyuv/rotate_row.h +265 -265
  54. package/android/src/main/cpp/libyuv/include/libyuv/row.h +6738 -6738
  55. package/android/src/main/cpp/libyuv/include/libyuv/row_sve.h +2154 -2154
  56. package/android/src/main/cpp/libyuv/include/libyuv/scale.h +336 -336
  57. package/android/src/main/cpp/libyuv/include/libyuv/scale_argb.h +76 -76
  58. package/android/src/main/cpp/libyuv/include/libyuv/scale_rgb.h +42 -42
  59. package/android/src/main/cpp/libyuv/include/libyuv/scale_row.h +1726 -1726
  60. package/android/src/main/cpp/libyuv/include/libyuv/scale_uv.h +51 -51
  61. package/android/src/main/cpp/libyuv/include/libyuv/version.h +16 -16
  62. package/android/src/main/cpp/libyuv/include/libyuv/video_common.h +222 -222
  63. package/android/src/main/cpp/libyuv/include/libyuv.h +33 -33
  64. package/android/src/main/cpp/libyuv/infra/config/OWNERS +3 -3
  65. package/android/src/main/cpp/libyuv/infra/config/PRESUBMIT.py +17 -17
  66. package/android/src/main/cpp/libyuv/infra/config/README.md +2 -2
  67. package/android/src/main/cpp/libyuv/infra/config/codereview.settings +6 -6
  68. package/android/src/main/cpp/libyuv/infra/config/commit-queue.cfg +144 -144
  69. package/android/src/main/cpp/libyuv/infra/config/cr-buildbucket.cfg +1185 -1185
  70. package/android/src/main/cpp/libyuv/infra/config/luci-logdog.cfg +9 -9
  71. package/android/src/main/cpp/libyuv/infra/config/luci-milo.cfg +246 -246
  72. package/android/src/main/cpp/libyuv/infra/config/luci-scheduler.cfg +385 -385
  73. package/android/src/main/cpp/libyuv/infra/config/main.star +402 -402
  74. package/android/src/main/cpp/libyuv/infra/config/project.cfg +16 -16
  75. package/android/src/main/cpp/libyuv/infra/config/realms.cfg +111 -111
  76. package/android/src/main/cpp/libyuv/libyuv.gni +34 -34
  77. package/android/src/main/cpp/libyuv/libyuv.gyp +149 -149
  78. package/android/src/main/cpp/libyuv/libyuv.gypi +87 -87
  79. package/android/src/main/cpp/libyuv/linux.mk +96 -96
  80. package/android/src/main/cpp/libyuv/public.mk +13 -13
  81. package/android/src/main/cpp/libyuv/pylintrc +49 -49
  82. package/android/src/main/cpp/libyuv/riscv_script/prepare_toolchain_qemu.sh +74 -74
  83. package/android/src/main/cpp/libyuv/riscv_script/riscv-clang.cmake +56 -56
  84. package/android/src/main/cpp/libyuv/riscv_script/run_qemu.sh +15 -15
  85. package/android/src/main/cpp/libyuv/source/compare.cc +435 -435
  86. package/android/src/main/cpp/libyuv/source/compare_common.cc +74 -74
  87. package/android/src/main/cpp/libyuv/source/compare_gcc.cc +362 -362
  88. package/android/src/main/cpp/libyuv/source/compare_neon.cc +96 -96
  89. package/android/src/main/cpp/libyuv/source/compare_neon64.cc +223 -223
  90. package/android/src/main/cpp/libyuv/source/compare_win.cc +241 -241
  91. package/android/src/main/cpp/libyuv/source/convert.cc +4746 -4746
  92. package/android/src/main/cpp/libyuv/source/convert_argb.cc +9179 -9179
  93. package/android/src/main/cpp/libyuv/source/convert_from.cc +866 -866
  94. package/android/src/main/cpp/libyuv/source/convert_from_argb.cc +3671 -3671
  95. package/android/src/main/cpp/libyuv/source/convert_jpeg.cc +602 -602
  96. package/android/src/main/cpp/libyuv/source/convert_to_argb.cc +391 -391
  97. package/android/src/main/cpp/libyuv/source/convert_to_i420.cc +288 -288
  98. package/android/src/main/cpp/libyuv/source/cpu_id.cc +496 -496
  99. package/android/src/main/cpp/libyuv/source/mjpeg_decoder.cc +580 -580
  100. package/android/src/main/cpp/libyuv/source/mjpeg_validate.cc +71 -71
  101. package/android/src/main/cpp/libyuv/source/planar_functions.cc +5663 -5663
  102. package/android/src/main/cpp/libyuv/source/rotate.cc +1241 -1241
  103. package/android/src/main/cpp/libyuv/source/rotate_any.cc +76 -76
  104. package/android/src/main/cpp/libyuv/source/rotate_argb.cc +259 -259
  105. package/android/src/main/cpp/libyuv/source/rotate_common.cc +208 -208
  106. package/android/src/main/cpp/libyuv/source/rotate_gcc.cc +505 -505
  107. package/android/src/main/cpp/libyuv/source/rotate_lsx.cc +233 -233
  108. package/android/src/main/cpp/libyuv/source/rotate_neon.cc +219 -219
  109. package/android/src/main/cpp/libyuv/source/rotate_neon64.cc +273 -273
  110. package/android/src/main/cpp/libyuv/source/rotate_sme.cc +174 -174
  111. package/android/src/main/cpp/libyuv/source/rotate_win.cc +253 -253
  112. package/android/src/main/cpp/libyuv/source/row_any.cc +2519 -2519
  113. package/android/src/main/cpp/libyuv/source/row_common.cc +4461 -4461
  114. package/android/src/main/cpp/libyuv/source/row_gcc.cc +9570 -9570
  115. package/android/src/main/cpp/libyuv/source/row_lasx.cc +2343 -2343
  116. package/android/src/main/cpp/libyuv/source/row_lsx.cc +3030 -3030
  117. package/android/src/main/cpp/libyuv/source/row_neon.cc +4026 -4026
  118. package/android/src/main/cpp/libyuv/source/row_neon64.cc +5617 -5617
  119. package/android/src/main/cpp/libyuv/source/row_rvv.cc +2599 -2599
  120. package/android/src/main/cpp/libyuv/source/row_sme.cc +1183 -1183
  121. package/android/src/main/cpp/libyuv/source/row_sve.cc +1088 -1088
  122. package/android/src/main/cpp/libyuv/source/row_win.cc +6453 -6453
  123. package/android/src/main/cpp/libyuv/source/scale.cc +2710 -2710
  124. package/android/src/main/cpp/libyuv/source/scale_any.cc +991 -991
  125. package/android/src/main/cpp/libyuv/source/scale_argb.cc +1158 -1158
  126. package/android/src/main/cpp/libyuv/source/scale_common.cc +1977 -1977
  127. package/android/src/main/cpp/libyuv/source/scale_gcc.cc +2947 -2947
  128. package/android/src/main/cpp/libyuv/source/scale_lsx.cc +739 -739
  129. package/android/src/main/cpp/libyuv/source/scale_neon.cc +1449 -1449
  130. package/android/src/main/cpp/libyuv/source/scale_neon64.cc +1552 -1552
  131. package/android/src/main/cpp/libyuv/source/scale_rgb.cc +82 -82
  132. package/android/src/main/cpp/libyuv/source/scale_rvv.cc +1971 -1971
  133. package/android/src/main/cpp/libyuv/source/scale_sme.cc +555 -555
  134. package/android/src/main/cpp/libyuv/source/scale_uv.cc +1159 -1159
  135. package/android/src/main/cpp/libyuv/source/scale_win.cc +1392 -1392
  136. package/android/src/main/cpp/libyuv/source/test.sh +35 -35
  137. package/android/src/main/cpp/libyuv/source/video_common.cc +62 -62
  138. package/android/src/main/cpp/libyuv/tools_libyuv/OWNERS +4 -4
  139. package/android/src/main/cpp/libyuv/tools_libyuv/autoroller/roll_deps.py +931 -931
  140. package/android/src/main/cpp/libyuv/tools_libyuv/autoroller/unittests/roll_deps_test.py +164 -164
  141. package/android/src/main/cpp/libyuv/tools_libyuv/autoroller/unittests/testdata/DEPS +21 -21
  142. package/android/src/main/cpp/libyuv/tools_libyuv/autoroller/unittests/testdata/DEPS.chromium.new +13 -13
  143. package/android/src/main/cpp/libyuv/tools_libyuv/autoroller/unittests/testdata/DEPS.chromium.old +13 -13
  144. package/android/src/main/cpp/libyuv/tools_libyuv/get_landmines.py +38 -38
  145. package/android/src/main/cpp/libyuv/tools_libyuv/msan/OWNERS +3 -3
  146. package/android/src/main/cpp/libyuv/tools_libyuv/msan/blacklist.txt +9 -9
  147. package/android/src/main/cpp/libyuv/tools_libyuv/ubsan/OWNERS +3 -3
  148. package/android/src/main/cpp/libyuv/tools_libyuv/ubsan/blacklist.txt +15 -15
  149. package/android/src/main/cpp/libyuv/tools_libyuv/ubsan/vptr_blacklist.txt +25 -25
  150. package/android/src/main/cpp/libyuv/unit_test/basictypes_test.cc +43 -43
  151. package/android/src/main/cpp/libyuv/unit_test/color_test.cc +848 -848
  152. package/android/src/main/cpp/libyuv/unit_test/compare_test.cc +739 -739
  153. package/android/src/main/cpp/libyuv/unit_test/convert_argb_test.cc +2867 -2867
  154. package/android/src/main/cpp/libyuv/unit_test/convert_test.cc +2133 -2133
  155. package/android/src/main/cpp/libyuv/unit_test/cpu_test.cc +427 -427
  156. package/android/src/main/cpp/libyuv/unit_test/cpu_thread_test.cc +63 -63
  157. package/android/src/main/cpp/libyuv/unit_test/math_test.cc +160 -160
  158. package/android/src/main/cpp/libyuv/unit_test/planar_test.cc +4731 -4731
  159. package/android/src/main/cpp/libyuv/unit_test/rotate_argb_test.cc +334 -334
  160. package/android/src/main/cpp/libyuv/unit_test/rotate_test.cc +962 -962
  161. package/android/src/main/cpp/libyuv/unit_test/scale_argb_test.cc +590 -590
  162. package/android/src/main/cpp/libyuv/unit_test/scale_plane_test.cc +465 -465
  163. package/android/src/main/cpp/libyuv/unit_test/scale_rgb_test.cc +280 -280
  164. package/android/src/main/cpp/libyuv/unit_test/scale_test.cc +1135 -1135
  165. package/android/src/main/cpp/libyuv/unit_test/scale_uv_test.cc +249 -249
  166. package/android/src/main/cpp/libyuv/unit_test/testdata/arm_v7.txt +12 -12
  167. package/android/src/main/cpp/libyuv/unit_test/testdata/mips.txt +7 -7
  168. package/android/src/main/cpp/libyuv/unit_test/testdata/mips_loongson2k.txt +5 -5
  169. package/android/src/main/cpp/libyuv/unit_test/testdata/mips_loongson3.txt +10 -10
  170. package/android/src/main/cpp/libyuv/unit_test/testdata/mips_loongson_mmi.txt +7 -7
  171. package/android/src/main/cpp/libyuv/unit_test/testdata/riscv64.txt +3 -3
  172. package/android/src/main/cpp/libyuv/unit_test/testdata/riscv64_rvv.txt +3 -3
  173. package/android/src/main/cpp/libyuv/unit_test/testdata/riscv64_rvv_zvfh.txt +3 -3
  174. package/android/src/main/cpp/libyuv/unit_test/testdata/tegra3.txt +23 -23
  175. package/android/src/main/cpp/libyuv/unit_test/unit_test.cc +581 -581
  176. package/android/src/main/cpp/libyuv/unit_test/unit_test.h +232 -232
  177. package/android/src/main/cpp/libyuv/unit_test/video_common_test.cc +112 -112
  178. package/android/src/main/cpp/libyuv/util/Makefile +9 -9
  179. package/android/src/main/cpp/libyuv/util/color.cc +120 -120
  180. package/android/src/main/cpp/libyuv/util/compare.cc +67 -67
  181. package/android/src/main/cpp/libyuv/util/cpuid.c +211 -211
  182. package/android/src/main/cpp/libyuv/util/i444tonv12_eg.cc +27 -27
  183. package/android/src/main/cpp/libyuv/util/psnr.cc +291 -291
  184. package/android/src/main/cpp/libyuv/util/psnr.h +47 -47
  185. package/android/src/main/cpp/libyuv/util/psnr_main.cc +620 -620
  186. package/android/src/main/cpp/libyuv/util/ssim.cc +364 -364
  187. package/android/src/main/cpp/libyuv/util/ssim.h +38 -38
  188. package/android/src/main/cpp/libyuv/util/yuvconstants.c +114 -114
  189. package/android/src/main/cpp/libyuv/util/yuvconvert.cc +367 -367
  190. package/android/src/main/cpp/libyuv/winarm.mk +47 -47
  191. package/index.js +17 -1
  192. package/ios/FaceAntiSpoofFrameProcessor.swift +283 -0
  193. package/ios/FaceAntiSpoofJSI.h +12 -0
  194. package/ios/FaceAntiSpoofJSI.mm +92 -0
  195. package/ios/FaceAntiSpoofManager.swift +63 -0
  196. package/ios/FaceAntiSpoofModule.m +191 -0
  197. package/ios/FaceAntiSpoofPluginRegister.m +42 -0
  198. package/ios/models/FaceAntiSpoofing.tflite +0 -0
  199. package/ios/models/model_spec.json +16 -0
  200. package/package.json +87 -86
  201. package/.gitignore +0 -27
  202. package/android/.gradle/8.9/checksums/checksums.lock +0 -0
  203. package/android/.gradle/8.9/fileHashes/fileHashes.lock +0 -0
  204. package/android/.gradle/8.9/gc.properties +0 -0
  205. /package/android/.gradle/{8.9 → 9.2.0}/fileChanges/last-build.bin +0 -0
  206. /package/android/.gradle/{8.9/dependencies-accessors → 9.2.0}/gc.properties +0 -0
@@ -1,505 +1,505 @@
1
- /*
2
- * Copyright 2015 The LibYuv Project Authors. All rights reserved.
3
- *
4
- * Use of this source code is governed by a BSD-style license
5
- * that can be found in the LICENSE file in the root of the source
6
- * tree. An additional intellectual property rights grant can be found
7
- * in the file PATENTS. All contributing project authors may
8
- * be found in the AUTHORS file in the root of the source tree.
9
- */
10
-
11
- #include "libyuv/rotate_row.h"
12
- #include "libyuv/row.h"
13
-
14
- #ifdef __cplusplus
15
- namespace libyuv {
16
- extern "C" {
17
- #endif
18
-
19
- // This module is for GCC x86 and x64.
20
- #if !defined(LIBYUV_DISABLE_X86) && \
21
- (defined(__x86_64__) || defined(__i386__)) && \
22
- !defined(LIBYUV_ENABLE_ROWWIN)
23
-
24
- // Transpose 8x8. 32 or 64 bit, but not NaCL for 64 bit.
25
- #if defined(HAS_TRANSPOSEWX8_SSSE3)
26
- void TransposeWx8_SSSE3(const uint8_t* src,
27
- int src_stride,
28
- uint8_t* dst,
29
- int dst_stride,
30
- int width) {
31
- asm volatile(
32
- // Read in the data from the source pointer.
33
- // First round of bit swap.
34
- LABELALIGN
35
- "1: \n"
36
- "movq (%0),%%xmm0 \n"
37
- "movq (%0,%3),%%xmm1 \n"
38
- "lea (%0,%3,2),%0 \n"
39
- "punpcklbw %%xmm1,%%xmm0 \n"
40
- "movq (%0),%%xmm2 \n"
41
- "movdqa %%xmm0,%%xmm1 \n"
42
- "palignr $0x8,%%xmm1,%%xmm1 \n"
43
- "movq (%0,%3),%%xmm3 \n"
44
- "lea (%0,%3,2),%0 \n"
45
- "punpcklbw %%xmm3,%%xmm2 \n"
46
- "movdqa %%xmm2,%%xmm3 \n"
47
- "movq (%0),%%xmm4 \n"
48
- "palignr $0x8,%%xmm3,%%xmm3 \n"
49
- "movq (%0,%3),%%xmm5 \n"
50
- "lea (%0,%3,2),%0 \n"
51
- "punpcklbw %%xmm5,%%xmm4 \n"
52
- "movdqa %%xmm4,%%xmm5 \n"
53
- "movq (%0),%%xmm6 \n"
54
- "palignr $0x8,%%xmm5,%%xmm5 \n"
55
- "movq (%0,%3),%%xmm7 \n"
56
- "lea (%0,%3,2),%0 \n"
57
- "punpcklbw %%xmm7,%%xmm6 \n"
58
- "neg %3 \n"
59
- "movdqa %%xmm6,%%xmm7 \n"
60
- "lea 0x8(%0,%3,8),%0 \n"
61
- "palignr $0x8,%%xmm7,%%xmm7 \n"
62
- "neg %3 \n"
63
- // Second round of bit swap.
64
- "punpcklwd %%xmm2,%%xmm0 \n"
65
- "punpcklwd %%xmm3,%%xmm1 \n"
66
- "movdqa %%xmm0,%%xmm2 \n"
67
- "movdqa %%xmm1,%%xmm3 \n"
68
- "palignr $0x8,%%xmm2,%%xmm2 \n"
69
- "palignr $0x8,%%xmm3,%%xmm3 \n"
70
- "punpcklwd %%xmm6,%%xmm4 \n"
71
- "punpcklwd %%xmm7,%%xmm5 \n"
72
- "movdqa %%xmm4,%%xmm6 \n"
73
- "movdqa %%xmm5,%%xmm7 \n"
74
- "palignr $0x8,%%xmm6,%%xmm6 \n"
75
- "palignr $0x8,%%xmm7,%%xmm7 \n"
76
- // Third round of bit swap.
77
- // Write to the destination pointer.
78
- "punpckldq %%xmm4,%%xmm0 \n"
79
- "movq %%xmm0,(%1) \n"
80
- "movdqa %%xmm0,%%xmm4 \n"
81
- "palignr $0x8,%%xmm4,%%xmm4 \n"
82
- "movq %%xmm4,(%1,%4) \n"
83
- "lea (%1,%4,2),%1 \n"
84
- "punpckldq %%xmm6,%%xmm2 \n"
85
- "movdqa %%xmm2,%%xmm6 \n"
86
- "movq %%xmm2,(%1) \n"
87
- "palignr $0x8,%%xmm6,%%xmm6 \n"
88
- "punpckldq %%xmm5,%%xmm1 \n"
89
- "movq %%xmm6,(%1,%4) \n"
90
- "lea (%1,%4,2),%1 \n"
91
- "movdqa %%xmm1,%%xmm5 \n"
92
- "movq %%xmm1,(%1) \n"
93
- "palignr $0x8,%%xmm5,%%xmm5 \n"
94
- "movq %%xmm5,(%1,%4) \n"
95
- "lea (%1,%4,2),%1 \n"
96
- "punpckldq %%xmm7,%%xmm3 \n"
97
- "movq %%xmm3,(%1) \n"
98
- "movdqa %%xmm3,%%xmm7 \n"
99
- "palignr $0x8,%%xmm7,%%xmm7 \n"
100
- "sub $0x8,%2 \n"
101
- "movq %%xmm7,(%1,%4) \n"
102
- "lea (%1,%4,2),%1 \n"
103
- "jg 1b \n"
104
- : "+r"(src), // %0
105
- "+r"(dst), // %1
106
- "+r"(width) // %2
107
- : "r"((intptr_t)(src_stride)), // %3
108
- "r"((intptr_t)(dst_stride)) // %4
109
- : "memory", "cc", "xmm0", "xmm1", "xmm2", "xmm3", "xmm4", "xmm5", "xmm6",
110
- "xmm7");
111
- }
112
- #endif // defined(HAS_TRANSPOSEWX8_SSSE3)
113
-
114
- // Transpose 16x8. 64 bit
115
- #if defined(HAS_TRANSPOSEWX8_FAST_SSSE3)
116
- void TransposeWx8_Fast_SSSE3(const uint8_t* src,
117
- int src_stride,
118
- uint8_t* dst,
119
- int dst_stride,
120
- int width) {
121
- asm volatile(
122
- // Read in the data from the source pointer.
123
- // First round of bit swap.
124
- LABELALIGN
125
- "1: \n"
126
- "movdqu (%0),%%xmm0 \n"
127
- "movdqu (%0,%3),%%xmm1 \n"
128
- "lea (%0,%3,2),%0 \n"
129
- "movdqa %%xmm0,%%xmm8 \n"
130
- "punpcklbw %%xmm1,%%xmm0 \n"
131
- "punpckhbw %%xmm1,%%xmm8 \n"
132
- "movdqu (%0),%%xmm2 \n"
133
- "movdqa %%xmm0,%%xmm1 \n"
134
- "movdqa %%xmm8,%%xmm9 \n"
135
- "palignr $0x8,%%xmm1,%%xmm1 \n"
136
- "palignr $0x8,%%xmm9,%%xmm9 \n"
137
- "movdqu (%0,%3),%%xmm3 \n"
138
- "lea (%0,%3,2),%0 \n"
139
- "movdqa %%xmm2,%%xmm10 \n"
140
- "punpcklbw %%xmm3,%%xmm2 \n"
141
- "punpckhbw %%xmm3,%%xmm10 \n"
142
- "movdqa %%xmm2,%%xmm3 \n"
143
- "movdqa %%xmm10,%%xmm11 \n"
144
- "movdqu (%0),%%xmm4 \n"
145
- "palignr $0x8,%%xmm3,%%xmm3 \n"
146
- "palignr $0x8,%%xmm11,%%xmm11 \n"
147
- "movdqu (%0,%3),%%xmm5 \n"
148
- "lea (%0,%3,2),%0 \n"
149
- "movdqa %%xmm4,%%xmm12 \n"
150
- "punpcklbw %%xmm5,%%xmm4 \n"
151
- "punpckhbw %%xmm5,%%xmm12 \n"
152
- "movdqa %%xmm4,%%xmm5 \n"
153
- "movdqa %%xmm12,%%xmm13 \n"
154
- "movdqu (%0),%%xmm6 \n"
155
- "palignr $0x8,%%xmm5,%%xmm5 \n"
156
- "palignr $0x8,%%xmm13,%%xmm13 \n"
157
- "movdqu (%0,%3),%%xmm7 \n"
158
- "lea (%0,%3,2),%0 \n"
159
- "movdqa %%xmm6,%%xmm14 \n"
160
- "punpcklbw %%xmm7,%%xmm6 \n"
161
- "punpckhbw %%xmm7,%%xmm14 \n"
162
- "neg %3 \n"
163
- "movdqa %%xmm6,%%xmm7 \n"
164
- "movdqa %%xmm14,%%xmm15 \n"
165
- "lea 0x10(%0,%3,8),%0 \n"
166
- "palignr $0x8,%%xmm7,%%xmm7 \n"
167
- "palignr $0x8,%%xmm15,%%xmm15 \n"
168
- "neg %3 \n"
169
- // Second round of bit swap.
170
- "punpcklwd %%xmm2,%%xmm0 \n"
171
- "punpcklwd %%xmm3,%%xmm1 \n"
172
- "movdqa %%xmm0,%%xmm2 \n"
173
- "movdqa %%xmm1,%%xmm3 \n"
174
- "palignr $0x8,%%xmm2,%%xmm2 \n"
175
- "palignr $0x8,%%xmm3,%%xmm3 \n"
176
- "punpcklwd %%xmm6,%%xmm4 \n"
177
- "punpcklwd %%xmm7,%%xmm5 \n"
178
- "movdqa %%xmm4,%%xmm6 \n"
179
- "movdqa %%xmm5,%%xmm7 \n"
180
- "palignr $0x8,%%xmm6,%%xmm6 \n"
181
- "palignr $0x8,%%xmm7,%%xmm7 \n"
182
- "punpcklwd %%xmm10,%%xmm8 \n"
183
- "punpcklwd %%xmm11,%%xmm9 \n"
184
- "movdqa %%xmm8,%%xmm10 \n"
185
- "movdqa %%xmm9,%%xmm11 \n"
186
- "palignr $0x8,%%xmm10,%%xmm10 \n"
187
- "palignr $0x8,%%xmm11,%%xmm11 \n"
188
- "punpcklwd %%xmm14,%%xmm12 \n"
189
- "punpcklwd %%xmm15,%%xmm13 \n"
190
- "movdqa %%xmm12,%%xmm14 \n"
191
- "movdqa %%xmm13,%%xmm15 \n"
192
- "palignr $0x8,%%xmm14,%%xmm14 \n"
193
- "palignr $0x8,%%xmm15,%%xmm15 \n"
194
- // Third round of bit swap.
195
- // Write to the destination pointer.
196
- "punpckldq %%xmm4,%%xmm0 \n"
197
- "movq %%xmm0,(%1) \n"
198
- "movdqa %%xmm0,%%xmm4 \n"
199
- "palignr $0x8,%%xmm4,%%xmm4 \n"
200
- "movq %%xmm4,(%1,%4) \n"
201
- "lea (%1,%4,2),%1 \n"
202
- "punpckldq %%xmm6,%%xmm2 \n"
203
- "movdqa %%xmm2,%%xmm6 \n"
204
- "movq %%xmm2,(%1) \n"
205
- "palignr $0x8,%%xmm6,%%xmm6 \n"
206
- "punpckldq %%xmm5,%%xmm1 \n"
207
- "movq %%xmm6,(%1,%4) \n"
208
- "lea (%1,%4,2),%1 \n"
209
- "movdqa %%xmm1,%%xmm5 \n"
210
- "movq %%xmm1,(%1) \n"
211
- "palignr $0x8,%%xmm5,%%xmm5 \n"
212
- "movq %%xmm5,(%1,%4) \n"
213
- "lea (%1,%4,2),%1 \n"
214
- "punpckldq %%xmm7,%%xmm3 \n"
215
- "movq %%xmm3,(%1) \n"
216
- "movdqa %%xmm3,%%xmm7 \n"
217
- "palignr $0x8,%%xmm7,%%xmm7 \n"
218
- "movq %%xmm7,(%1,%4) \n"
219
- "lea (%1,%4,2),%1 \n"
220
- "punpckldq %%xmm12,%%xmm8 \n"
221
- "movq %%xmm8,(%1) \n"
222
- "movdqa %%xmm8,%%xmm12 \n"
223
- "palignr $0x8,%%xmm12,%%xmm12 \n"
224
- "movq %%xmm12,(%1,%4) \n"
225
- "lea (%1,%4,2),%1 \n"
226
- "punpckldq %%xmm14,%%xmm10 \n"
227
- "movdqa %%xmm10,%%xmm14 \n"
228
- "movq %%xmm10,(%1) \n"
229
- "palignr $0x8,%%xmm14,%%xmm14 \n"
230
- "punpckldq %%xmm13,%%xmm9 \n"
231
- "movq %%xmm14,(%1,%4) \n"
232
- "lea (%1,%4,2),%1 \n"
233
- "movdqa %%xmm9,%%xmm13 \n"
234
- "movq %%xmm9,(%1) \n"
235
- "palignr $0x8,%%xmm13,%%xmm13 \n"
236
- "movq %%xmm13,(%1,%4) \n"
237
- "lea (%1,%4,2),%1 \n"
238
- "punpckldq %%xmm15,%%xmm11 \n"
239
- "movq %%xmm11,(%1) \n"
240
- "movdqa %%xmm11,%%xmm15 \n"
241
- "palignr $0x8,%%xmm15,%%xmm15 \n"
242
- "sub $0x10,%2 \n"
243
- "movq %%xmm15,(%1,%4) \n"
244
- "lea (%1,%4,2),%1 \n"
245
- "jg 1b \n"
246
- : "+r"(src), // %0
247
- "+r"(dst), // %1
248
- "+r"(width) // %2
249
- : "r"((intptr_t)(src_stride)), // %3
250
- "r"((intptr_t)(dst_stride)) // %4
251
- : "memory", "cc", "xmm0", "xmm1", "xmm2", "xmm3", "xmm4", "xmm5", "xmm6",
252
- "xmm7", "xmm8", "xmm9", "xmm10", "xmm11", "xmm12", "xmm13", "xmm14",
253
- "xmm15");
254
- }
255
- #endif // defined(HAS_TRANSPOSEWX8_FAST_SSSE3)
256
-
257
- // Transpose UV 8x8. 64 bit.
258
- #if defined(HAS_TRANSPOSEUVWX8_SSE2)
259
- void TransposeUVWx8_SSE2(const uint8_t* src,
260
- int src_stride,
261
- uint8_t* dst_a,
262
- int dst_stride_a,
263
- uint8_t* dst_b,
264
- int dst_stride_b,
265
- int width) {
266
- asm volatile(
267
- // Read in the data from the source pointer.
268
- // First round of bit swap.
269
- LABELALIGN
270
- "1: \n"
271
- "movdqu (%0),%%xmm0 \n"
272
- "movdqu (%0,%4),%%xmm1 \n"
273
- "lea (%0,%4,2),%0 \n"
274
- "movdqa %%xmm0,%%xmm8 \n"
275
- "punpcklbw %%xmm1,%%xmm0 \n"
276
- "punpckhbw %%xmm1,%%xmm8 \n"
277
- "movdqa %%xmm8,%%xmm1 \n"
278
- "movdqu (%0),%%xmm2 \n"
279
- "movdqu (%0,%4),%%xmm3 \n"
280
- "lea (%0,%4,2),%0 \n"
281
- "movdqa %%xmm2,%%xmm8 \n"
282
- "punpcklbw %%xmm3,%%xmm2 \n"
283
- "punpckhbw %%xmm3,%%xmm8 \n"
284
- "movdqa %%xmm8,%%xmm3 \n"
285
- "movdqu (%0),%%xmm4 \n"
286
- "movdqu (%0,%4),%%xmm5 \n"
287
- "lea (%0,%4,2),%0 \n"
288
- "movdqa %%xmm4,%%xmm8 \n"
289
- "punpcklbw %%xmm5,%%xmm4 \n"
290
- "punpckhbw %%xmm5,%%xmm8 \n"
291
- "movdqa %%xmm8,%%xmm5 \n"
292
- "movdqu (%0),%%xmm6 \n"
293
- "movdqu (%0,%4),%%xmm7 \n"
294
- "lea (%0,%4,2),%0 \n"
295
- "movdqa %%xmm6,%%xmm8 \n"
296
- "punpcklbw %%xmm7,%%xmm6 \n"
297
- "neg %4 \n"
298
- "lea 0x10(%0,%4,8),%0 \n"
299
- "punpckhbw %%xmm7,%%xmm8 \n"
300
- "movdqa %%xmm8,%%xmm7 \n"
301
- "neg %4 \n"
302
- // Second round of bit swap.
303
- "movdqa %%xmm0,%%xmm8 \n"
304
- "movdqa %%xmm1,%%xmm9 \n"
305
- "punpckhwd %%xmm2,%%xmm8 \n"
306
- "punpckhwd %%xmm3,%%xmm9 \n"
307
- "punpcklwd %%xmm2,%%xmm0 \n"
308
- "punpcklwd %%xmm3,%%xmm1 \n"
309
- "movdqa %%xmm8,%%xmm2 \n"
310
- "movdqa %%xmm9,%%xmm3 \n"
311
- "movdqa %%xmm4,%%xmm8 \n"
312
- "movdqa %%xmm5,%%xmm9 \n"
313
- "punpckhwd %%xmm6,%%xmm8 \n"
314
- "punpckhwd %%xmm7,%%xmm9 \n"
315
- "punpcklwd %%xmm6,%%xmm4 \n"
316
- "punpcklwd %%xmm7,%%xmm5 \n"
317
- "movdqa %%xmm8,%%xmm6 \n"
318
- "movdqa %%xmm9,%%xmm7 \n"
319
- // Third round of bit swap.
320
- // Write to the destination pointer.
321
- "movdqa %%xmm0,%%xmm8 \n"
322
- "punpckldq %%xmm4,%%xmm0 \n"
323
- "movlpd %%xmm0,(%1) \n" // Write back U channel
324
- "movhpd %%xmm0,(%2) \n" // Write back V channel
325
- "punpckhdq %%xmm4,%%xmm8 \n"
326
- "movlpd %%xmm8,(%1,%5) \n"
327
- "lea (%1,%5,2),%1 \n"
328
- "movhpd %%xmm8,(%2,%6) \n"
329
- "lea (%2,%6,2),%2 \n"
330
- "movdqa %%xmm2,%%xmm8 \n"
331
- "punpckldq %%xmm6,%%xmm2 \n"
332
- "movlpd %%xmm2,(%1) \n"
333
- "movhpd %%xmm2,(%2) \n"
334
- "punpckhdq %%xmm6,%%xmm8 \n"
335
- "movlpd %%xmm8,(%1,%5) \n"
336
- "lea (%1,%5,2),%1 \n"
337
- "movhpd %%xmm8,(%2,%6) \n"
338
- "lea (%2,%6,2),%2 \n"
339
- "movdqa %%xmm1,%%xmm8 \n"
340
- "punpckldq %%xmm5,%%xmm1 \n"
341
- "movlpd %%xmm1,(%1) \n"
342
- "movhpd %%xmm1,(%2) \n"
343
- "punpckhdq %%xmm5,%%xmm8 \n"
344
- "movlpd %%xmm8,(%1,%5) \n"
345
- "lea (%1,%5,2),%1 \n"
346
- "movhpd %%xmm8,(%2,%6) \n"
347
- "lea (%2,%6,2),%2 \n"
348
- "movdqa %%xmm3,%%xmm8 \n"
349
- "punpckldq %%xmm7,%%xmm3 \n"
350
- "movlpd %%xmm3,(%1) \n"
351
- "movhpd %%xmm3,(%2) \n"
352
- "punpckhdq %%xmm7,%%xmm8 \n"
353
- "sub $0x8,%3 \n"
354
- "movlpd %%xmm8,(%1,%5) \n"
355
- "lea (%1,%5,2),%1 \n"
356
- "movhpd %%xmm8,(%2,%6) \n"
357
- "lea (%2,%6,2),%2 \n"
358
- "jg 1b \n"
359
- : "+r"(src), // %0
360
- "+r"(dst_a), // %1
361
- "+r"(dst_b), // %2
362
- "+r"(width) // %3
363
- : "r"((intptr_t)(src_stride)), // %4
364
- "r"((intptr_t)(dst_stride_a)), // %5
365
- "r"((intptr_t)(dst_stride_b)) // %6
366
- : "memory", "cc", "xmm0", "xmm1", "xmm2", "xmm3", "xmm4", "xmm5", "xmm6",
367
- "xmm7", "xmm8", "xmm9");
368
- }
369
- #endif // defined(HAS_TRANSPOSEUVWX8_SSE2)
370
-
371
- #if defined(HAS_TRANSPOSE4X4_32_SSE2)
372
- // 4 values, little endian view
373
- // a b c d
374
- // e f g h
375
- // i j k l
376
- // m n o p
377
-
378
- // transpose 2x2
379
- // a e b f from row 0, 1
380
- // i m j n from row 2, 3
381
- // c g d h from row 0, 1
382
- // k o l p from row 2, 3
383
-
384
- // transpose 4x4
385
- // a e i m from row 0, 1
386
- // b f j n from row 0, 1
387
- // c g k o from row 2, 3
388
- // d h l p from row 2, 3
389
-
390
- // Transpose 32 bit values (ARGB)
391
- void Transpose4x4_32_SSE2(const uint8_t* src,
392
- int src_stride,
393
- uint8_t* dst,
394
- int dst_stride,
395
- int width) {
396
- asm volatile(
397
- // Main loop transpose 4x4. Read a column, write a row.
398
- "1: \n"
399
- "movdqu (%0),%%xmm0 \n" // a b c d
400
- "movdqu (%0,%3),%%xmm1 \n" // e f g h
401
- "lea (%0,%3,2),%0 \n" // src += stride * 2
402
- "movdqu (%0),%%xmm2 \n" // i j k l
403
- "movdqu (%0,%3),%%xmm3 \n" // m n o p
404
- "lea (%0,%3,2),%0 \n" // src += stride * 2
405
-
406
- // Transpose 2x2
407
- "movdqa %%xmm0,%%xmm4 \n"
408
- "movdqa %%xmm2,%%xmm5 \n"
409
- "movdqa %%xmm0,%%xmm6 \n"
410
- "movdqa %%xmm2,%%xmm7 \n"
411
- "punpckldq %%xmm1,%%xmm4 \n" // a e b f from row 0, 1
412
- "punpckldq %%xmm3,%%xmm5 \n" // i m j n from row 2, 3
413
- "punpckhdq %%xmm1,%%xmm6 \n" // c g d h from row 0, 1
414
- "punpckhdq %%xmm3,%%xmm7 \n" // k o l p from row 2, 3
415
-
416
- // Transpose 4x4
417
- "movdqa %%xmm4,%%xmm0 \n"
418
- "movdqa %%xmm4,%%xmm1 \n"
419
- "movdqa %%xmm6,%%xmm2 \n"
420
- "movdqa %%xmm6,%%xmm3 \n"
421
- "punpcklqdq %%xmm5,%%xmm0 \n" // a e i m from row 0, 1
422
- "punpckhqdq %%xmm5,%%xmm1 \n" // b f j n from row 0, 1
423
- "punpcklqdq %%xmm7,%%xmm2 \n" // c g k o from row 2, 3
424
- "punpckhqdq %%xmm7,%%xmm3 \n" // d h l p from row 2, 3
425
-
426
- "movdqu %%xmm0,(%1) \n"
427
- "lea 16(%1,%4),%1 \n" // dst += stride + 16
428
- "movdqu %%xmm1,-16(%1) \n"
429
- "movdqu %%xmm2,-16(%1,%4) \n"
430
- "movdqu %%xmm3,-16(%1,%4,2) \n"
431
- "sub %4,%1 \n"
432
- "sub $0x4,%2 \n"
433
- "jg 1b \n"
434
- : "+r"(src), // %0
435
- "+r"(dst), // %1
436
- "+rm"(width) // %2
437
- : "r"((ptrdiff_t)(src_stride)), // %3
438
- "r"((ptrdiff_t)(dst_stride)) // %4
439
- : "memory", "cc", "xmm0", "xmm1", "xmm2", "xmm3", "xmm4", "xmm5", "xmm6",
440
- "xmm7");
441
- }
442
- #endif // defined(HAS_TRANSPOSE4X4_32_SSE2)
443
-
444
- #if defined(HAS_TRANSPOSE4X4_32_AVX2)
445
-
446
- // Transpose 32 bit values (ARGB)
447
- void Transpose4x4_32_AVX2(const uint8_t* src,
448
- int src_stride,
449
- uint8_t* dst,
450
- int dst_stride,
451
- int width) {
452
- asm volatile(
453
- // Main loop transpose 2 blocks of 4x4. Read a column, write a row.
454
- "1: \n"
455
- "vmovdqu (%0),%%xmm0 \n" // a b c d
456
- "vmovdqu (%0,%3),%%xmm1 \n" // e f g h
457
- "lea (%0,%3,2),%0 \n" // src += stride * 2
458
- "vmovdqu (%0),%%xmm2 \n" // i j k l
459
- "vmovdqu (%0,%3),%%xmm3 \n" // m n o p
460
- "lea (%0,%3,2),%0 \n" // src += stride * 2
461
-
462
- "vinserti128 $1,(%0),%%ymm0,%%ymm0 \n" // a b c d
463
- "vinserti128 $1,(%0,%3),%%ymm1,%%ymm1 \n" // e f g h
464
- "lea (%0,%3,2),%0 \n" // src += stride * 2
465
- "vinserti128 $1,(%0),%%ymm2,%%ymm2 \n" // i j k l
466
- "vinserti128 $1,(%0,%3),%%ymm3,%%ymm3 \n" // m n o p
467
- "lea (%0,%3,2),%0 \n" // src += stride * 2
468
-
469
- // Transpose 2x2
470
- "vpunpckldq %%ymm1,%%ymm0,%%ymm4 \n" // a e b f from row 0, 1
471
- "vpunpckldq %%ymm3,%%ymm2,%%ymm5 \n" // i m j n from row 2, 3
472
- "vpunpckhdq %%ymm1,%%ymm0,%%ymm6 \n" // c g d h from row 0, 1
473
- "vpunpckhdq %%ymm3,%%ymm2,%%ymm7 \n" // k o l p from row 2, 3
474
-
475
- // Transpose 4x4
476
- "vpunpcklqdq %%ymm5,%%ymm4,%%ymm0 \n" // a e i m from row 0, 1
477
- "vpunpckhqdq %%ymm5,%%ymm4,%%ymm1 \n" // b f j n from row 0, 1
478
- "vpunpcklqdq %%ymm7,%%ymm6,%%ymm2 \n" // c g k o from row 2, 3
479
- "vpunpckhqdq %%ymm7,%%ymm6,%%ymm3 \n" // d h l p from row 2, 3
480
-
481
- "vmovdqu %%ymm0,(%1) \n"
482
- "lea 32(%1,%4),%1 \n" // dst += stride + 32
483
- "vmovdqu %%ymm1,-32(%1) \n"
484
- "vmovdqu %%ymm2,-32(%1,%4) \n"
485
- "vmovdqu %%ymm3,-32(%1,%4,2) \n"
486
- "sub %4,%1 \n"
487
- "sub $0x8,%2 \n"
488
- "jg 1b \n"
489
- "vzeroupper \n"
490
- : "+r"(src), // %0
491
- "+r"(dst), // %1
492
- "+rm"(width) // %2
493
- : "r"((ptrdiff_t)(src_stride)), // %3
494
- "r"((ptrdiff_t)(dst_stride)) // %4
495
- : "memory", "cc", "xmm0", "xmm1", "xmm2", "xmm3", "xmm4", "xmm5", "xmm6",
496
- "xmm7");
497
- }
498
- #endif // defined(HAS_TRANSPOSE4X4_32_AVX2)
499
-
500
- #endif // defined(__x86_64__) || defined(__i386__)
501
-
502
- #ifdef __cplusplus
503
- } // extern "C"
504
- } // namespace libyuv
505
- #endif
1
+ /*
2
+ * Copyright 2015 The LibYuv Project Authors. All rights reserved.
3
+ *
4
+ * Use of this source code is governed by a BSD-style license
5
+ * that can be found in the LICENSE file in the root of the source
6
+ * tree. An additional intellectual property rights grant can be found
7
+ * in the file PATENTS. All contributing project authors may
8
+ * be found in the AUTHORS file in the root of the source tree.
9
+ */
10
+
11
+ #include "libyuv/rotate_row.h"
12
+ #include "libyuv/row.h"
13
+
14
+ #ifdef __cplusplus
15
+ namespace libyuv {
16
+ extern "C" {
17
+ #endif
18
+
19
+ // This module is for GCC x86 and x64.
20
+ #if !defined(LIBYUV_DISABLE_X86) && \
21
+ (defined(__x86_64__) || defined(__i386__)) && \
22
+ !defined(LIBYUV_ENABLE_ROWWIN)
23
+
24
+ // Transpose 8x8. 32 or 64 bit, but not NaCL for 64 bit.
25
+ #if defined(HAS_TRANSPOSEWX8_SSSE3)
26
+ void TransposeWx8_SSSE3(const uint8_t* src,
27
+ int src_stride,
28
+ uint8_t* dst,
29
+ int dst_stride,
30
+ int width) {
31
+ asm volatile(
32
+ // Read in the data from the source pointer.
33
+ // First round of bit swap.
34
+ LABELALIGN
35
+ "1: \n"
36
+ "movq (%0),%%xmm0 \n"
37
+ "movq (%0,%3),%%xmm1 \n"
38
+ "lea (%0,%3,2),%0 \n"
39
+ "punpcklbw %%xmm1,%%xmm0 \n"
40
+ "movq (%0),%%xmm2 \n"
41
+ "movdqa %%xmm0,%%xmm1 \n"
42
+ "palignr $0x8,%%xmm1,%%xmm1 \n"
43
+ "movq (%0,%3),%%xmm3 \n"
44
+ "lea (%0,%3,2),%0 \n"
45
+ "punpcklbw %%xmm3,%%xmm2 \n"
46
+ "movdqa %%xmm2,%%xmm3 \n"
47
+ "movq (%0),%%xmm4 \n"
48
+ "palignr $0x8,%%xmm3,%%xmm3 \n"
49
+ "movq (%0,%3),%%xmm5 \n"
50
+ "lea (%0,%3,2),%0 \n"
51
+ "punpcklbw %%xmm5,%%xmm4 \n"
52
+ "movdqa %%xmm4,%%xmm5 \n"
53
+ "movq (%0),%%xmm6 \n"
54
+ "palignr $0x8,%%xmm5,%%xmm5 \n"
55
+ "movq (%0,%3),%%xmm7 \n"
56
+ "lea (%0,%3,2),%0 \n"
57
+ "punpcklbw %%xmm7,%%xmm6 \n"
58
+ "neg %3 \n"
59
+ "movdqa %%xmm6,%%xmm7 \n"
60
+ "lea 0x8(%0,%3,8),%0 \n"
61
+ "palignr $0x8,%%xmm7,%%xmm7 \n"
62
+ "neg %3 \n"
63
+ // Second round of bit swap.
64
+ "punpcklwd %%xmm2,%%xmm0 \n"
65
+ "punpcklwd %%xmm3,%%xmm1 \n"
66
+ "movdqa %%xmm0,%%xmm2 \n"
67
+ "movdqa %%xmm1,%%xmm3 \n"
68
+ "palignr $0x8,%%xmm2,%%xmm2 \n"
69
+ "palignr $0x8,%%xmm3,%%xmm3 \n"
70
+ "punpcklwd %%xmm6,%%xmm4 \n"
71
+ "punpcklwd %%xmm7,%%xmm5 \n"
72
+ "movdqa %%xmm4,%%xmm6 \n"
73
+ "movdqa %%xmm5,%%xmm7 \n"
74
+ "palignr $0x8,%%xmm6,%%xmm6 \n"
75
+ "palignr $0x8,%%xmm7,%%xmm7 \n"
76
+ // Third round of bit swap.
77
+ // Write to the destination pointer.
78
+ "punpckldq %%xmm4,%%xmm0 \n"
79
+ "movq %%xmm0,(%1) \n"
80
+ "movdqa %%xmm0,%%xmm4 \n"
81
+ "palignr $0x8,%%xmm4,%%xmm4 \n"
82
+ "movq %%xmm4,(%1,%4) \n"
83
+ "lea (%1,%4,2),%1 \n"
84
+ "punpckldq %%xmm6,%%xmm2 \n"
85
+ "movdqa %%xmm2,%%xmm6 \n"
86
+ "movq %%xmm2,(%1) \n"
87
+ "palignr $0x8,%%xmm6,%%xmm6 \n"
88
+ "punpckldq %%xmm5,%%xmm1 \n"
89
+ "movq %%xmm6,(%1,%4) \n"
90
+ "lea (%1,%4,2),%1 \n"
91
+ "movdqa %%xmm1,%%xmm5 \n"
92
+ "movq %%xmm1,(%1) \n"
93
+ "palignr $0x8,%%xmm5,%%xmm5 \n"
94
+ "movq %%xmm5,(%1,%4) \n"
95
+ "lea (%1,%4,2),%1 \n"
96
+ "punpckldq %%xmm7,%%xmm3 \n"
97
+ "movq %%xmm3,(%1) \n"
98
+ "movdqa %%xmm3,%%xmm7 \n"
99
+ "palignr $0x8,%%xmm7,%%xmm7 \n"
100
+ "sub $0x8,%2 \n"
101
+ "movq %%xmm7,(%1,%4) \n"
102
+ "lea (%1,%4,2),%1 \n"
103
+ "jg 1b \n"
104
+ : "+r"(src), // %0
105
+ "+r"(dst), // %1
106
+ "+r"(width) // %2
107
+ : "r"((intptr_t)(src_stride)), // %3
108
+ "r"((intptr_t)(dst_stride)) // %4
109
+ : "memory", "cc", "xmm0", "xmm1", "xmm2", "xmm3", "xmm4", "xmm5", "xmm6",
110
+ "xmm7");
111
+ }
112
+ #endif // defined(HAS_TRANSPOSEWX8_SSSE3)
113
+
114
+ // Transpose 16x8. 64 bit
115
+ #if defined(HAS_TRANSPOSEWX8_FAST_SSSE3)
116
+ void TransposeWx8_Fast_SSSE3(const uint8_t* src,
117
+ int src_stride,
118
+ uint8_t* dst,
119
+ int dst_stride,
120
+ int width) {
121
+ asm volatile(
122
+ // Read in the data from the source pointer.
123
+ // First round of bit swap.
124
+ LABELALIGN
125
+ "1: \n"
126
+ "movdqu (%0),%%xmm0 \n"
127
+ "movdqu (%0,%3),%%xmm1 \n"
128
+ "lea (%0,%3,2),%0 \n"
129
+ "movdqa %%xmm0,%%xmm8 \n"
130
+ "punpcklbw %%xmm1,%%xmm0 \n"
131
+ "punpckhbw %%xmm1,%%xmm8 \n"
132
+ "movdqu (%0),%%xmm2 \n"
133
+ "movdqa %%xmm0,%%xmm1 \n"
134
+ "movdqa %%xmm8,%%xmm9 \n"
135
+ "palignr $0x8,%%xmm1,%%xmm1 \n"
136
+ "palignr $0x8,%%xmm9,%%xmm9 \n"
137
+ "movdqu (%0,%3),%%xmm3 \n"
138
+ "lea (%0,%3,2),%0 \n"
139
+ "movdqa %%xmm2,%%xmm10 \n"
140
+ "punpcklbw %%xmm3,%%xmm2 \n"
141
+ "punpckhbw %%xmm3,%%xmm10 \n"
142
+ "movdqa %%xmm2,%%xmm3 \n"
143
+ "movdqa %%xmm10,%%xmm11 \n"
144
+ "movdqu (%0),%%xmm4 \n"
145
+ "palignr $0x8,%%xmm3,%%xmm3 \n"
146
+ "palignr $0x8,%%xmm11,%%xmm11 \n"
147
+ "movdqu (%0,%3),%%xmm5 \n"
148
+ "lea (%0,%3,2),%0 \n"
149
+ "movdqa %%xmm4,%%xmm12 \n"
150
+ "punpcklbw %%xmm5,%%xmm4 \n"
151
+ "punpckhbw %%xmm5,%%xmm12 \n"
152
+ "movdqa %%xmm4,%%xmm5 \n"
153
+ "movdqa %%xmm12,%%xmm13 \n"
154
+ "movdqu (%0),%%xmm6 \n"
155
+ "palignr $0x8,%%xmm5,%%xmm5 \n"
156
+ "palignr $0x8,%%xmm13,%%xmm13 \n"
157
+ "movdqu (%0,%3),%%xmm7 \n"
158
+ "lea (%0,%3,2),%0 \n"
159
+ "movdqa %%xmm6,%%xmm14 \n"
160
+ "punpcklbw %%xmm7,%%xmm6 \n"
161
+ "punpckhbw %%xmm7,%%xmm14 \n"
162
+ "neg %3 \n"
163
+ "movdqa %%xmm6,%%xmm7 \n"
164
+ "movdqa %%xmm14,%%xmm15 \n"
165
+ "lea 0x10(%0,%3,8),%0 \n"
166
+ "palignr $0x8,%%xmm7,%%xmm7 \n"
167
+ "palignr $0x8,%%xmm15,%%xmm15 \n"
168
+ "neg %3 \n"
169
+ // Second round of bit swap.
170
+ "punpcklwd %%xmm2,%%xmm0 \n"
171
+ "punpcklwd %%xmm3,%%xmm1 \n"
172
+ "movdqa %%xmm0,%%xmm2 \n"
173
+ "movdqa %%xmm1,%%xmm3 \n"
174
+ "palignr $0x8,%%xmm2,%%xmm2 \n"
175
+ "palignr $0x8,%%xmm3,%%xmm3 \n"
176
+ "punpcklwd %%xmm6,%%xmm4 \n"
177
+ "punpcklwd %%xmm7,%%xmm5 \n"
178
+ "movdqa %%xmm4,%%xmm6 \n"
179
+ "movdqa %%xmm5,%%xmm7 \n"
180
+ "palignr $0x8,%%xmm6,%%xmm6 \n"
181
+ "palignr $0x8,%%xmm7,%%xmm7 \n"
182
+ "punpcklwd %%xmm10,%%xmm8 \n"
183
+ "punpcklwd %%xmm11,%%xmm9 \n"
184
+ "movdqa %%xmm8,%%xmm10 \n"
185
+ "movdqa %%xmm9,%%xmm11 \n"
186
+ "palignr $0x8,%%xmm10,%%xmm10 \n"
187
+ "palignr $0x8,%%xmm11,%%xmm11 \n"
188
+ "punpcklwd %%xmm14,%%xmm12 \n"
189
+ "punpcklwd %%xmm15,%%xmm13 \n"
190
+ "movdqa %%xmm12,%%xmm14 \n"
191
+ "movdqa %%xmm13,%%xmm15 \n"
192
+ "palignr $0x8,%%xmm14,%%xmm14 \n"
193
+ "palignr $0x8,%%xmm15,%%xmm15 \n"
194
+ // Third round of bit swap.
195
+ // Write to the destination pointer.
196
+ "punpckldq %%xmm4,%%xmm0 \n"
197
+ "movq %%xmm0,(%1) \n"
198
+ "movdqa %%xmm0,%%xmm4 \n"
199
+ "palignr $0x8,%%xmm4,%%xmm4 \n"
200
+ "movq %%xmm4,(%1,%4) \n"
201
+ "lea (%1,%4,2),%1 \n"
202
+ "punpckldq %%xmm6,%%xmm2 \n"
203
+ "movdqa %%xmm2,%%xmm6 \n"
204
+ "movq %%xmm2,(%1) \n"
205
+ "palignr $0x8,%%xmm6,%%xmm6 \n"
206
+ "punpckldq %%xmm5,%%xmm1 \n"
207
+ "movq %%xmm6,(%1,%4) \n"
208
+ "lea (%1,%4,2),%1 \n"
209
+ "movdqa %%xmm1,%%xmm5 \n"
210
+ "movq %%xmm1,(%1) \n"
211
+ "palignr $0x8,%%xmm5,%%xmm5 \n"
212
+ "movq %%xmm5,(%1,%4) \n"
213
+ "lea (%1,%4,2),%1 \n"
214
+ "punpckldq %%xmm7,%%xmm3 \n"
215
+ "movq %%xmm3,(%1) \n"
216
+ "movdqa %%xmm3,%%xmm7 \n"
217
+ "palignr $0x8,%%xmm7,%%xmm7 \n"
218
+ "movq %%xmm7,(%1,%4) \n"
219
+ "lea (%1,%4,2),%1 \n"
220
+ "punpckldq %%xmm12,%%xmm8 \n"
221
+ "movq %%xmm8,(%1) \n"
222
+ "movdqa %%xmm8,%%xmm12 \n"
223
+ "palignr $0x8,%%xmm12,%%xmm12 \n"
224
+ "movq %%xmm12,(%1,%4) \n"
225
+ "lea (%1,%4,2),%1 \n"
226
+ "punpckldq %%xmm14,%%xmm10 \n"
227
+ "movdqa %%xmm10,%%xmm14 \n"
228
+ "movq %%xmm10,(%1) \n"
229
+ "palignr $0x8,%%xmm14,%%xmm14 \n"
230
+ "punpckldq %%xmm13,%%xmm9 \n"
231
+ "movq %%xmm14,(%1,%4) \n"
232
+ "lea (%1,%4,2),%1 \n"
233
+ "movdqa %%xmm9,%%xmm13 \n"
234
+ "movq %%xmm9,(%1) \n"
235
+ "palignr $0x8,%%xmm13,%%xmm13 \n"
236
+ "movq %%xmm13,(%1,%4) \n"
237
+ "lea (%1,%4,2),%1 \n"
238
+ "punpckldq %%xmm15,%%xmm11 \n"
239
+ "movq %%xmm11,(%1) \n"
240
+ "movdqa %%xmm11,%%xmm15 \n"
241
+ "palignr $0x8,%%xmm15,%%xmm15 \n"
242
+ "sub $0x10,%2 \n"
243
+ "movq %%xmm15,(%1,%4) \n"
244
+ "lea (%1,%4,2),%1 \n"
245
+ "jg 1b \n"
246
+ : "+r"(src), // %0
247
+ "+r"(dst), // %1
248
+ "+r"(width) // %2
249
+ : "r"((intptr_t)(src_stride)), // %3
250
+ "r"((intptr_t)(dst_stride)) // %4
251
+ : "memory", "cc", "xmm0", "xmm1", "xmm2", "xmm3", "xmm4", "xmm5", "xmm6",
252
+ "xmm7", "xmm8", "xmm9", "xmm10", "xmm11", "xmm12", "xmm13", "xmm14",
253
+ "xmm15");
254
+ }
255
+ #endif // defined(HAS_TRANSPOSEWX8_FAST_SSSE3)
256
+
257
+ // Transpose UV 8x8. 64 bit.
258
+ #if defined(HAS_TRANSPOSEUVWX8_SSE2)
259
+ void TransposeUVWx8_SSE2(const uint8_t* src,
260
+ int src_stride,
261
+ uint8_t* dst_a,
262
+ int dst_stride_a,
263
+ uint8_t* dst_b,
264
+ int dst_stride_b,
265
+ int width) {
266
+ asm volatile(
267
+ // Read in the data from the source pointer.
268
+ // First round of bit swap.
269
+ LABELALIGN
270
+ "1: \n"
271
+ "movdqu (%0),%%xmm0 \n"
272
+ "movdqu (%0,%4),%%xmm1 \n"
273
+ "lea (%0,%4,2),%0 \n"
274
+ "movdqa %%xmm0,%%xmm8 \n"
275
+ "punpcklbw %%xmm1,%%xmm0 \n"
276
+ "punpckhbw %%xmm1,%%xmm8 \n"
277
+ "movdqa %%xmm8,%%xmm1 \n"
278
+ "movdqu (%0),%%xmm2 \n"
279
+ "movdqu (%0,%4),%%xmm3 \n"
280
+ "lea (%0,%4,2),%0 \n"
281
+ "movdqa %%xmm2,%%xmm8 \n"
282
+ "punpcklbw %%xmm3,%%xmm2 \n"
283
+ "punpckhbw %%xmm3,%%xmm8 \n"
284
+ "movdqa %%xmm8,%%xmm3 \n"
285
+ "movdqu (%0),%%xmm4 \n"
286
+ "movdqu (%0,%4),%%xmm5 \n"
287
+ "lea (%0,%4,2),%0 \n"
288
+ "movdqa %%xmm4,%%xmm8 \n"
289
+ "punpcklbw %%xmm5,%%xmm4 \n"
290
+ "punpckhbw %%xmm5,%%xmm8 \n"
291
+ "movdqa %%xmm8,%%xmm5 \n"
292
+ "movdqu (%0),%%xmm6 \n"
293
+ "movdqu (%0,%4),%%xmm7 \n"
294
+ "lea (%0,%4,2),%0 \n"
295
+ "movdqa %%xmm6,%%xmm8 \n"
296
+ "punpcklbw %%xmm7,%%xmm6 \n"
297
+ "neg %4 \n"
298
+ "lea 0x10(%0,%4,8),%0 \n"
299
+ "punpckhbw %%xmm7,%%xmm8 \n"
300
+ "movdqa %%xmm8,%%xmm7 \n"
301
+ "neg %4 \n"
302
+ // Second round of bit swap.
303
+ "movdqa %%xmm0,%%xmm8 \n"
304
+ "movdqa %%xmm1,%%xmm9 \n"
305
+ "punpckhwd %%xmm2,%%xmm8 \n"
306
+ "punpckhwd %%xmm3,%%xmm9 \n"
307
+ "punpcklwd %%xmm2,%%xmm0 \n"
308
+ "punpcklwd %%xmm3,%%xmm1 \n"
309
+ "movdqa %%xmm8,%%xmm2 \n"
310
+ "movdqa %%xmm9,%%xmm3 \n"
311
+ "movdqa %%xmm4,%%xmm8 \n"
312
+ "movdqa %%xmm5,%%xmm9 \n"
313
+ "punpckhwd %%xmm6,%%xmm8 \n"
314
+ "punpckhwd %%xmm7,%%xmm9 \n"
315
+ "punpcklwd %%xmm6,%%xmm4 \n"
316
+ "punpcklwd %%xmm7,%%xmm5 \n"
317
+ "movdqa %%xmm8,%%xmm6 \n"
318
+ "movdqa %%xmm9,%%xmm7 \n"
319
+ // Third round of bit swap.
320
+ // Write to the destination pointer.
321
+ "movdqa %%xmm0,%%xmm8 \n"
322
+ "punpckldq %%xmm4,%%xmm0 \n"
323
+ "movlpd %%xmm0,(%1) \n" // Write back U channel
324
+ "movhpd %%xmm0,(%2) \n" // Write back V channel
325
+ "punpckhdq %%xmm4,%%xmm8 \n"
326
+ "movlpd %%xmm8,(%1,%5) \n"
327
+ "lea (%1,%5,2),%1 \n"
328
+ "movhpd %%xmm8,(%2,%6) \n"
329
+ "lea (%2,%6,2),%2 \n"
330
+ "movdqa %%xmm2,%%xmm8 \n"
331
+ "punpckldq %%xmm6,%%xmm2 \n"
332
+ "movlpd %%xmm2,(%1) \n"
333
+ "movhpd %%xmm2,(%2) \n"
334
+ "punpckhdq %%xmm6,%%xmm8 \n"
335
+ "movlpd %%xmm8,(%1,%5) \n"
336
+ "lea (%1,%5,2),%1 \n"
337
+ "movhpd %%xmm8,(%2,%6) \n"
338
+ "lea (%2,%6,2),%2 \n"
339
+ "movdqa %%xmm1,%%xmm8 \n"
340
+ "punpckldq %%xmm5,%%xmm1 \n"
341
+ "movlpd %%xmm1,(%1) \n"
342
+ "movhpd %%xmm1,(%2) \n"
343
+ "punpckhdq %%xmm5,%%xmm8 \n"
344
+ "movlpd %%xmm8,(%1,%5) \n"
345
+ "lea (%1,%5,2),%1 \n"
346
+ "movhpd %%xmm8,(%2,%6) \n"
347
+ "lea (%2,%6,2),%2 \n"
348
+ "movdqa %%xmm3,%%xmm8 \n"
349
+ "punpckldq %%xmm7,%%xmm3 \n"
350
+ "movlpd %%xmm3,(%1) \n"
351
+ "movhpd %%xmm3,(%2) \n"
352
+ "punpckhdq %%xmm7,%%xmm8 \n"
353
+ "sub $0x8,%3 \n"
354
+ "movlpd %%xmm8,(%1,%5) \n"
355
+ "lea (%1,%5,2),%1 \n"
356
+ "movhpd %%xmm8,(%2,%6) \n"
357
+ "lea (%2,%6,2),%2 \n"
358
+ "jg 1b \n"
359
+ : "+r"(src), // %0
360
+ "+r"(dst_a), // %1
361
+ "+r"(dst_b), // %2
362
+ "+r"(width) // %3
363
+ : "r"((intptr_t)(src_stride)), // %4
364
+ "r"((intptr_t)(dst_stride_a)), // %5
365
+ "r"((intptr_t)(dst_stride_b)) // %6
366
+ : "memory", "cc", "xmm0", "xmm1", "xmm2", "xmm3", "xmm4", "xmm5", "xmm6",
367
+ "xmm7", "xmm8", "xmm9");
368
+ }
369
+ #endif // defined(HAS_TRANSPOSEUVWX8_SSE2)
370
+
371
+ #if defined(HAS_TRANSPOSE4X4_32_SSE2)
372
+ // 4 values, little endian view
373
+ // a b c d
374
+ // e f g h
375
+ // i j k l
376
+ // m n o p
377
+
378
+ // transpose 2x2
379
+ // a e b f from row 0, 1
380
+ // i m j n from row 2, 3
381
+ // c g d h from row 0, 1
382
+ // k o l p from row 2, 3
383
+
384
+ // transpose 4x4
385
+ // a e i m from row 0, 1
386
+ // b f j n from row 0, 1
387
+ // c g k o from row 2, 3
388
+ // d h l p from row 2, 3
389
+
390
+ // Transpose 32 bit values (ARGB)
391
+ void Transpose4x4_32_SSE2(const uint8_t* src,
392
+ int src_stride,
393
+ uint8_t* dst,
394
+ int dst_stride,
395
+ int width) {
396
+ asm volatile(
397
+ // Main loop transpose 4x4. Read a column, write a row.
398
+ "1: \n"
399
+ "movdqu (%0),%%xmm0 \n" // a b c d
400
+ "movdqu (%0,%3),%%xmm1 \n" // e f g h
401
+ "lea (%0,%3,2),%0 \n" // src += stride * 2
402
+ "movdqu (%0),%%xmm2 \n" // i j k l
403
+ "movdqu (%0,%3),%%xmm3 \n" // m n o p
404
+ "lea (%0,%3,2),%0 \n" // src += stride * 2
405
+
406
+ // Transpose 2x2
407
+ "movdqa %%xmm0,%%xmm4 \n"
408
+ "movdqa %%xmm2,%%xmm5 \n"
409
+ "movdqa %%xmm0,%%xmm6 \n"
410
+ "movdqa %%xmm2,%%xmm7 \n"
411
+ "punpckldq %%xmm1,%%xmm4 \n" // a e b f from row 0, 1
412
+ "punpckldq %%xmm3,%%xmm5 \n" // i m j n from row 2, 3
413
+ "punpckhdq %%xmm1,%%xmm6 \n" // c g d h from row 0, 1
414
+ "punpckhdq %%xmm3,%%xmm7 \n" // k o l p from row 2, 3
415
+
416
+ // Transpose 4x4
417
+ "movdqa %%xmm4,%%xmm0 \n"
418
+ "movdqa %%xmm4,%%xmm1 \n"
419
+ "movdqa %%xmm6,%%xmm2 \n"
420
+ "movdqa %%xmm6,%%xmm3 \n"
421
+ "punpcklqdq %%xmm5,%%xmm0 \n" // a e i m from row 0, 1
422
+ "punpckhqdq %%xmm5,%%xmm1 \n" // b f j n from row 0, 1
423
+ "punpcklqdq %%xmm7,%%xmm2 \n" // c g k o from row 2, 3
424
+ "punpckhqdq %%xmm7,%%xmm3 \n" // d h l p from row 2, 3
425
+
426
+ "movdqu %%xmm0,(%1) \n"
427
+ "lea 16(%1,%4),%1 \n" // dst += stride + 16
428
+ "movdqu %%xmm1,-16(%1) \n"
429
+ "movdqu %%xmm2,-16(%1,%4) \n"
430
+ "movdqu %%xmm3,-16(%1,%4,2) \n"
431
+ "sub %4,%1 \n"
432
+ "sub $0x4,%2 \n"
433
+ "jg 1b \n"
434
+ : "+r"(src), // %0
435
+ "+r"(dst), // %1
436
+ "+rm"(width) // %2
437
+ : "r"((ptrdiff_t)(src_stride)), // %3
438
+ "r"((ptrdiff_t)(dst_stride)) // %4
439
+ : "memory", "cc", "xmm0", "xmm1", "xmm2", "xmm3", "xmm4", "xmm5", "xmm6",
440
+ "xmm7");
441
+ }
442
+ #endif // defined(HAS_TRANSPOSE4X4_32_SSE2)
443
+
444
+ #if defined(HAS_TRANSPOSE4X4_32_AVX2)
445
+
446
+ // Transpose 32 bit values (ARGB)
447
+ void Transpose4x4_32_AVX2(const uint8_t* src,
448
+ int src_stride,
449
+ uint8_t* dst,
450
+ int dst_stride,
451
+ int width) {
452
+ asm volatile(
453
+ // Main loop transpose 2 blocks of 4x4. Read a column, write a row.
454
+ "1: \n"
455
+ "vmovdqu (%0),%%xmm0 \n" // a b c d
456
+ "vmovdqu (%0,%3),%%xmm1 \n" // e f g h
457
+ "lea (%0,%3,2),%0 \n" // src += stride * 2
458
+ "vmovdqu (%0),%%xmm2 \n" // i j k l
459
+ "vmovdqu (%0,%3),%%xmm3 \n" // m n o p
460
+ "lea (%0,%3,2),%0 \n" // src += stride * 2
461
+
462
+ "vinserti128 $1,(%0),%%ymm0,%%ymm0 \n" // a b c d
463
+ "vinserti128 $1,(%0,%3),%%ymm1,%%ymm1 \n" // e f g h
464
+ "lea (%0,%3,2),%0 \n" // src += stride * 2
465
+ "vinserti128 $1,(%0),%%ymm2,%%ymm2 \n" // i j k l
466
+ "vinserti128 $1,(%0,%3),%%ymm3,%%ymm3 \n" // m n o p
467
+ "lea (%0,%3,2),%0 \n" // src += stride * 2
468
+
469
+ // Transpose 2x2
470
+ "vpunpckldq %%ymm1,%%ymm0,%%ymm4 \n" // a e b f from row 0, 1
471
+ "vpunpckldq %%ymm3,%%ymm2,%%ymm5 \n" // i m j n from row 2, 3
472
+ "vpunpckhdq %%ymm1,%%ymm0,%%ymm6 \n" // c g d h from row 0, 1
473
+ "vpunpckhdq %%ymm3,%%ymm2,%%ymm7 \n" // k o l p from row 2, 3
474
+
475
+ // Transpose 4x4
476
+ "vpunpcklqdq %%ymm5,%%ymm4,%%ymm0 \n" // a e i m from row 0, 1
477
+ "vpunpckhqdq %%ymm5,%%ymm4,%%ymm1 \n" // b f j n from row 0, 1
478
+ "vpunpcklqdq %%ymm7,%%ymm6,%%ymm2 \n" // c g k o from row 2, 3
479
+ "vpunpckhqdq %%ymm7,%%ymm6,%%ymm3 \n" // d h l p from row 2, 3
480
+
481
+ "vmovdqu %%ymm0,(%1) \n"
482
+ "lea 32(%1,%4),%1 \n" // dst += stride + 32
483
+ "vmovdqu %%ymm1,-32(%1) \n"
484
+ "vmovdqu %%ymm2,-32(%1,%4) \n"
485
+ "vmovdqu %%ymm3,-32(%1,%4,2) \n"
486
+ "sub %4,%1 \n"
487
+ "sub $0x8,%2 \n"
488
+ "jg 1b \n"
489
+ "vzeroupper \n"
490
+ : "+r"(src), // %0
491
+ "+r"(dst), // %1
492
+ "+rm"(width) // %2
493
+ : "r"((ptrdiff_t)(src_stride)), // %3
494
+ "r"((ptrdiff_t)(dst_stride)) // %4
495
+ : "memory", "cc", "xmm0", "xmm1", "xmm2", "xmm3", "xmm4", "xmm5", "xmm6",
496
+ "xmm7");
497
+ }
498
+ #endif // defined(HAS_TRANSPOSE4X4_32_AVX2)
499
+
500
+ #endif // defined(__x86_64__) || defined(__i386__)
501
+
502
+ #ifdef __cplusplus
503
+ } // extern "C"
504
+ } // namespace libyuv
505
+ #endif