minibwa 0.0.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (52) hide show
  1. checksums.yaml +7 -0
  2. data/LICENSE.txt +21 -0
  3. data/README.md +119 -0
  4. data/ext/minibwa/extconf.rb +105 -0
  5. data/ext/minibwa/mb_buffer.c +113 -0
  6. data/ext/minibwa/mb_hit.c +192 -0
  7. data/ext/minibwa/mb_index.c +462 -0
  8. data/ext/minibwa/mb_index_build.c +174 -0
  9. data/ext/minibwa/mb_options.c +301 -0
  10. data/ext/minibwa/minibwa/LICENSE.txt +37 -0
  11. data/ext/minibwa/minibwa/align.c +930 -0
  12. data/ext/minibwa/minibwa/bseq.h +45 -0
  13. data/ext/minibwa/minibwa/bwt.c +715 -0
  14. data/ext/minibwa/minibwa/bwt.h +86 -0
  15. data/ext/minibwa/minibwa/cs.c +161 -0
  16. data/ext/minibwa/minibwa/format.c +356 -0
  17. data/ext/minibwa/minibwa/index.c +342 -0
  18. data/ext/minibwa/minibwa/kalloc.c +224 -0
  19. data/ext/minibwa/minibwa/kalloc.h +54 -0
  20. data/ext/minibwa/minibwa/ketopt.h +123 -0
  21. data/ext/minibwa/minibwa/kommon.c +374 -0
  22. data/ext/minibwa/minibwa/kommon.h +85 -0
  23. data/ext/minibwa/minibwa/kseq.h +256 -0
  24. data/ext/minibwa/minibwa/ksort.h +163 -0
  25. data/ext/minibwa/minibwa/ksw2.h +220 -0
  26. data/ext/minibwa/minibwa/ksw2_extd2_sse.c +403 -0
  27. data/ext/minibwa/minibwa/ksw2_extz2_sse.c +296 -0
  28. data/ext/minibwa/minibwa/ksw2_ll_sse.c +341 -0
  29. data/ext/minibwa/minibwa/kthread.h +15 -0
  30. data/ext/minibwa/minibwa/l2bit.c +479 -0
  31. data/ext/minibwa/minibwa/l2bit.h +72 -0
  32. data/ext/minibwa/minibwa/lchain.c +231 -0
  33. data/ext/minibwa/minibwa/libsais.c +6985 -0
  34. data/ext/minibwa/minibwa/libsais.h +106 -0
  35. data/ext/minibwa/minibwa/libsais64.c +7064 -0
  36. data/ext/minibwa/minibwa/libsais64.h +81 -0
  37. data/ext/minibwa/minibwa/map-algo.c +769 -0
  38. data/ext/minibwa/minibwa/mbpriv.h +148 -0
  39. data/ext/minibwa/minibwa/minibwa.h +176 -0
  40. data/ext/minibwa/minibwa/options.c +116 -0
  41. data/ext/minibwa/minibwa/pe.c +559 -0
  42. data/ext/minibwa/minibwa/s2n-lite.h +59 -0
  43. data/ext/minibwa/minibwa/seed.c +354 -0
  44. data/ext/minibwa/minibwa.c +67 -0
  45. data/ext/minibwa/minibwa.h +51 -0
  46. data/lib/minibwa/hit.rb +110 -0
  47. data/lib/minibwa/index.rb +77 -0
  48. data/lib/minibwa/options.rb +235 -0
  49. data/lib/minibwa/sam.rb +85 -0
  50. data/lib/minibwa/version.rb +6 -0
  51. data/lib/minibwa.rb +11 -0
  52. metadata +88 -0
@@ -0,0 +1,231 @@
1
+ #include <stdint.h>
2
+ #include <string.h>
3
+ #include <stdio.h>
4
+ #include <assert.h>
5
+ #include "mbpriv.h"
6
+ #include "kalloc.h"
7
+ #include "ksort.h"
8
+
9
+ /*
10
+ * Anchor format in minibwa (mb_anchor_t):
11
+ * tid2: target (reference) sequence ID
12
+ * len: length of the seed (q_span)
13
+ * qpos: query coordinate of the last base
14
+ * tpos: target coordinate of the last base
15
+ * qocc: query occurrence
16
+ * tocc: target occurrence
17
+ * flt: filtered flag
18
+ *
19
+ * For chaining, we need:
20
+ * - Target position (tid2, tpos) for gap calculation on reference
21
+ * - Query position (qpos) for gap calculation on query
22
+ * - Seed length (len) as q_span for scoring
23
+ */
24
+
25
+ static int64_t mb_chain_bk_end(int32_t max_drop, const mb128_t *z, const int32_t *f, const int64_t *p, int32_t *t, int64_t k)
26
+ {
27
+ int64_t i = z[k].y, end_i = -1, max_i = i;
28
+ int32_t max_s = 0;
29
+ if (i < 0 || t[i] != 0) return i;
30
+ do {
31
+ int32_t s;
32
+ t[i] = 2;
33
+ end_i = i = p[i];
34
+ s = i < 0? z[k].x : (int32_t)z[k].x - f[i];
35
+ if (s > max_s) max_s = s, max_i = i;
36
+ else if (max_s - s > max_drop) break;
37
+ } while (i >= 0 && t[i] == 0);
38
+ for (i = z[k].y; i >= 0 && i != end_i; i = p[i]) // reset modified t[]
39
+ t[i] = 0;
40
+ return max_i;
41
+ }
42
+
43
+ static uint64_t *mb_chain_backtrack(void *km, int64_t n, const int32_t *f, const int64_t *p, int32_t *v, int32_t *t, int32_t min_sc, int32_t max_drop, int32_t *n_u_, int32_t *n_v_)
44
+ {
45
+ mb128_t *z;
46
+ uint64_t *u;
47
+ int64_t i, k, n_z, n_v;
48
+ int32_t n_u;
49
+
50
+ *n_u_ = *n_v_ = 0;
51
+ for (i = 0, n_z = 0; i < n; ++i) // precompute n_z
52
+ if (f[i] >= min_sc) ++n_z;
53
+ if (n_z == 0) return 0;
54
+ z = Kmalloc(km, mb128_t, n_z);
55
+ for (i = 0, k = 0; i < n; ++i) // populate z[]
56
+ if (f[i] >= min_sc) z[k].x = f[i], z[k++].y = i;
57
+ radix_sort_mb128x(z, z + n_z);
58
+
59
+ memset(t, 0, n * 4);
60
+ for (k = n_z - 1, n_v = n_u = 0; k >= 0; --k) { // precompute n_u
61
+ if (t[z[k].y] == 0) {
62
+ int64_t n_v0 = n_v, end_i;
63
+ int32_t sc;
64
+ end_i = mb_chain_bk_end(max_drop, z, f, p, t, k);
65
+ for (i = z[k].y; i != end_i; i = p[i])
66
+ ++n_v, t[i] = 1;
67
+ sc = i < 0? z[k].x : (int32_t)z[k].x - f[i];
68
+ if (sc >= min_sc && n_v > n_v0)
69
+ ++n_u;
70
+ else n_v = n_v0;
71
+ }
72
+ }
73
+ u = Kmalloc(km, uint64_t, n_u);
74
+ memset(t, 0, n * 4);
75
+ for (k = n_z - 1, n_v = n_u = 0; k >= 0; --k) { // populate u[]
76
+ if (t[z[k].y] == 0) {
77
+ int64_t n_v0 = n_v, end_i;
78
+ int32_t sc;
79
+ end_i = mb_chain_bk_end(max_drop, z, f, p, t, k);
80
+ for (i = z[k].y; i != end_i; i = p[i])
81
+ v[n_v++] = i, t[i] = 1;
82
+ sc = i < 0? z[k].x : (int32_t)z[k].x - f[i];
83
+ if (sc >= min_sc && n_v > n_v0)
84
+ u[n_u++] = (uint64_t)sc << 32 | (n_v - n_v0);
85
+ else n_v = n_v0;
86
+ }
87
+ }
88
+ kfree(km, z);
89
+ assert(n_v < INT32_MAX);
90
+ *n_u_ = n_u, *n_v_ = n_v;
91
+ return u;
92
+ }
93
+
94
+ static mb_anchor_t *compact_a(void *km, const l2b_t *l2b, int32_t n_u, uint64_t *u, int32_t n_v, int32_t *v, mb_anchor_t *a)
95
+ {
96
+ mb_anchor_t *b;
97
+ mb128_t *w;
98
+ uint64_t *u2;
99
+ int64_t i, j, k;
100
+
101
+ // write the result to b[]
102
+ b = Kmalloc(km, mb_anchor_t, n_v);
103
+ for (i = 0, k = 0; i < n_u; ++i) {
104
+ int32_t k0 = k, ni = (int32_t)u[i];
105
+ for (j = 0; j < ni; ++j)
106
+ b[k++] = a[v[k0 + (ni - j - 1)]];
107
+ }
108
+ kfree(km, v);
109
+
110
+ // sort u[] and a[] by the target position, such that adjacent chains may be joined
111
+ w = Kmalloc(km, mb128_t, n_u);
112
+ for (i = k = 0; i < n_u; ++i) {
113
+ const l2b_ctg_t *ctg = &l2b->ctg[b[k].sid>>1];
114
+ w[i].x = b[k].tpos + ctg->off * 2 + ctg->len * (b[k].sid&1);
115
+ w[i].y = (uint64_t)k<<32 | i;
116
+ k += (int32_t)u[i];
117
+ }
118
+ radix_sort_mb128x(w, w + n_u);
119
+ u2 = Kmalloc(km, uint64_t, n_u);
120
+ for (i = k = 0; i < n_u; ++i) {
121
+ int32_t j = (int32_t)w[i].y, n = (int32_t)u[j];
122
+ u2[i] = u[j];
123
+ memcpy(&a[k], &b[w[i].y>>32], n * sizeof(mb_anchor_t));
124
+ k += n;
125
+ }
126
+ memcpy(u, u2, n_u * 8);
127
+ memcpy(b, a, k * sizeof(mb_anchor_t)); // write _a_ to _b_ and deallocate _a_ because _a_ is oversized, sometimes a lot
128
+ kfree(km, u2); kfree(km, w); kfree(km, a);
129
+ return b;
130
+ }
131
+
132
+ // Compute chaining score between two anchors
133
+ static inline int32_t comput_sc(const mb_anchor_t *ai, const mb_anchor_t *aj, int32_t max_dist_x, int32_t max_dist_y, int32_t bw, float chn_pen_gap)
134
+ {
135
+ int64_t dq = ai->qpos - aj->qpos, dr, dd, dg, sc;
136
+ if (dq <= 0 || dq > max_dist_y + ai->len) return INT32_MIN;
137
+ // Check if on same target; use tid for comparison
138
+ if (ai->sid != aj->sid) return INT32_MIN;
139
+ dr = ai->tpos - aj->tpos;
140
+ if (dr <= 0 || dq > max_dist_x + ai->len) return INT32_MIN;
141
+ dd = dr > dq? dr - dq : dq - dr;
142
+ if (dd > bw) return INT32_MIN;
143
+ dg = dr < dq? dr : dq;
144
+ // Use successor span for variable-length anchors (SMEMs)
145
+ sc = ai->len < dg? ai->len : dg;
146
+ if (dd) { // with a gap
147
+ float lin_pen, log_pen;
148
+ lin_pen = chn_pen_gap * (float)dd;
149
+ log_pen = dd >= 1? mb_log2(dd + 1) : 0.0f;
150
+ sc -= (int)(lin_pen + .5f * log_pen);
151
+ }
152
+ return sc;
153
+ }
154
+
155
+ /* Input:
156
+ * a[].sid: target sequence ID (tid<<1|rev)
157
+ * a[].tpos: target coordinate of the last base
158
+ * a[].qpos: query coordinate of the last base
159
+ * a[].len: seed length (q_span)
160
+ * Output:
161
+ * n_u: #chains
162
+ * u[]: score<<32 | #anchors (sum of lower 32 bits of u[] is the returned length of a[])
163
+ * input a[] is deallocated on return
164
+ */
165
+ mb_anchor_t *mb_lchain_dp(void *km, const l2b_t *l2b, int max_dist_x, int max_dist_y, int bw, int max_skip, int max_iter, int min_sc, float chn_pen_gap,
166
+ int64_t n, mb_anchor_t *a, int *n_u_, uint64_t **_u)
167
+ { // TODO: make sure this works when n has more than 32 bits
168
+ int32_t *f, *t, *v, n_u, n_v, mmax_f = 0, max_drop = bw;
169
+ int64_t *p, i, j, max_ii;
170
+ uint64_t *u;
171
+
172
+ if (_u) *_u = 0, *n_u_ = 0;
173
+ if (n == 0 || a == 0) {
174
+ kfree(km, a);
175
+ return 0;
176
+ }
177
+ if (max_dist_x < bw) max_dist_x = bw;
178
+ if (max_dist_y < bw) max_dist_y = bw;
179
+ v = Kmalloc(km, int32_t, n);
180
+ p = Kmalloc(km, int64_t, n);
181
+ f = Kmalloc(km, int32_t, n);
182
+ t = Kcalloc(km, int32_t, n);
183
+
184
+ // fill the score and backtrack arrays
185
+ for (i = 0, max_ii = -1; i < n; ++i) {
186
+ int64_t max_j = -1, end_j;
187
+ int32_t max_f = a[i].len, n_skip = 0;
188
+ for (j = i - 1; j >= 0 && j >= i - max_iter; --j) {
189
+ int32_t sc;
190
+ if (a[i].tpos - a[j].tpos >= max_dist_x + a[i].len) break;
191
+ sc = comput_sc(&a[i], &a[j], max_dist_x, max_dist_y, bw, chn_pen_gap);
192
+ if (sc == INT32_MIN) continue;
193
+ sc += f[j];
194
+ if (sc > max_f) {
195
+ max_f = sc, max_j = j;
196
+ if (n_skip > 0) --n_skip;
197
+ } else if (t[j] == (int32_t)i) {
198
+ if (++n_skip > max_skip)
199
+ break;
200
+ }
201
+ if (p[j] >= 0) t[p[j]] = i;
202
+ }
203
+ end_j = j;
204
+ if (max_ii < 0 || a[i].tpos - a[max_ii].tpos > max_dist_x + a[i].len) {
205
+ int32_t max = INT32_MIN;
206
+ max_ii = -1; // the index of the best score. Rescue in case the best is missed due to the max_skip heuristic
207
+ for (j = i - 1; j >= end_j && j >= 0; --j)
208
+ if (max < f[j]) max = f[j], max_ii = j;
209
+ }
210
+ if (max_ii >= 0 && max_ii < end_j) {
211
+ int32_t tmp;
212
+ tmp = comput_sc(&a[i], &a[max_ii], max_dist_x, max_dist_y, bw, chn_pen_gap);
213
+ if (tmp != INT32_MIN && max_f < tmp + f[max_ii])
214
+ max_f = tmp + f[max_ii], max_j = max_ii;
215
+ }
216
+ f[i] = max_f, p[i] = max_j;
217
+ v[i] = max_j >= 0 && v[max_j] > max_f? v[max_j] : max_f; // v[] keeps the peak score up to i; f[] is the score ending at i, not always the peak
218
+ if (max_ii < 0 || (a[i].tpos - a[max_ii].tpos <= max_dist_x + a[i].len && f[max_ii] < f[i]))
219
+ max_ii = i;
220
+ if (mmax_f < max_f) mmax_f = max_f;
221
+ }
222
+
223
+ u = mb_chain_backtrack(km, n, f, p, v, t, min_sc, max_drop, &n_u, &n_v);
224
+ *n_u_ = n_u, *_u = u; // NB: note that u[] may not be sorted by score here
225
+ kfree(km, t); kfree(km, f); kfree(km, p);
226
+ if (n_u == 0) {
227
+ kfree(km, a); kfree(km, v);
228
+ return 0;
229
+ }
230
+ return compact_a(km, l2b, n_u, u, n_v, v, a);
231
+ }