minibwa 0.0.0
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- checksums.yaml +7 -0
- data/LICENSE.txt +21 -0
- data/README.md +119 -0
- data/ext/minibwa/extconf.rb +105 -0
- data/ext/minibwa/mb_buffer.c +113 -0
- data/ext/minibwa/mb_hit.c +192 -0
- data/ext/minibwa/mb_index.c +462 -0
- data/ext/minibwa/mb_index_build.c +174 -0
- data/ext/minibwa/mb_options.c +301 -0
- data/ext/minibwa/minibwa/LICENSE.txt +37 -0
- data/ext/minibwa/minibwa/align.c +930 -0
- data/ext/minibwa/minibwa/bseq.h +45 -0
- data/ext/minibwa/minibwa/bwt.c +715 -0
- data/ext/minibwa/minibwa/bwt.h +86 -0
- data/ext/minibwa/minibwa/cs.c +161 -0
- data/ext/minibwa/minibwa/format.c +356 -0
- data/ext/minibwa/minibwa/index.c +342 -0
- data/ext/minibwa/minibwa/kalloc.c +224 -0
- data/ext/minibwa/minibwa/kalloc.h +54 -0
- data/ext/minibwa/minibwa/ketopt.h +123 -0
- data/ext/minibwa/minibwa/kommon.c +374 -0
- data/ext/minibwa/minibwa/kommon.h +85 -0
- data/ext/minibwa/minibwa/kseq.h +256 -0
- data/ext/minibwa/minibwa/ksort.h +163 -0
- data/ext/minibwa/minibwa/ksw2.h +220 -0
- data/ext/minibwa/minibwa/ksw2_extd2_sse.c +403 -0
- data/ext/minibwa/minibwa/ksw2_extz2_sse.c +296 -0
- data/ext/minibwa/minibwa/ksw2_ll_sse.c +341 -0
- data/ext/minibwa/minibwa/kthread.h +15 -0
- data/ext/minibwa/minibwa/l2bit.c +479 -0
- data/ext/minibwa/minibwa/l2bit.h +72 -0
- data/ext/minibwa/minibwa/lchain.c +231 -0
- data/ext/minibwa/minibwa/libsais.c +6985 -0
- data/ext/minibwa/minibwa/libsais.h +106 -0
- data/ext/minibwa/minibwa/libsais64.c +7064 -0
- data/ext/minibwa/minibwa/libsais64.h +81 -0
- data/ext/minibwa/minibwa/map-algo.c +769 -0
- data/ext/minibwa/minibwa/mbpriv.h +148 -0
- data/ext/minibwa/minibwa/minibwa.h +176 -0
- data/ext/minibwa/minibwa/options.c +116 -0
- data/ext/minibwa/minibwa/pe.c +559 -0
- data/ext/minibwa/minibwa/s2n-lite.h +59 -0
- data/ext/minibwa/minibwa/seed.c +354 -0
- data/ext/minibwa/minibwa.c +67 -0
- data/ext/minibwa/minibwa.h +51 -0
- data/lib/minibwa/hit.rb +110 -0
- data/lib/minibwa/index.rb +77 -0
- data/lib/minibwa/options.rb +235 -0
- data/lib/minibwa/sam.rb +85 -0
- data/lib/minibwa/version.rb +6 -0
- data/lib/minibwa.rb +11 -0
- metadata +88 -0
|
@@ -0,0 +1,231 @@
|
|
|
1
|
+
#include <stdint.h>
|
|
2
|
+
#include <string.h>
|
|
3
|
+
#include <stdio.h>
|
|
4
|
+
#include <assert.h>
|
|
5
|
+
#include "mbpriv.h"
|
|
6
|
+
#include "kalloc.h"
|
|
7
|
+
#include "ksort.h"
|
|
8
|
+
|
|
9
|
+
/*
|
|
10
|
+
* Anchor format in minibwa (mb_anchor_t):
|
|
11
|
+
* tid2: target (reference) sequence ID
|
|
12
|
+
* len: length of the seed (q_span)
|
|
13
|
+
* qpos: query coordinate of the last base
|
|
14
|
+
* tpos: target coordinate of the last base
|
|
15
|
+
* qocc: query occurrence
|
|
16
|
+
* tocc: target occurrence
|
|
17
|
+
* flt: filtered flag
|
|
18
|
+
*
|
|
19
|
+
* For chaining, we need:
|
|
20
|
+
* - Target position (tid2, tpos) for gap calculation on reference
|
|
21
|
+
* - Query position (qpos) for gap calculation on query
|
|
22
|
+
* - Seed length (len) as q_span for scoring
|
|
23
|
+
*/
|
|
24
|
+
|
|
25
|
+
static int64_t mb_chain_bk_end(int32_t max_drop, const mb128_t *z, const int32_t *f, const int64_t *p, int32_t *t, int64_t k)
|
|
26
|
+
{
|
|
27
|
+
int64_t i = z[k].y, end_i = -1, max_i = i;
|
|
28
|
+
int32_t max_s = 0;
|
|
29
|
+
if (i < 0 || t[i] != 0) return i;
|
|
30
|
+
do {
|
|
31
|
+
int32_t s;
|
|
32
|
+
t[i] = 2;
|
|
33
|
+
end_i = i = p[i];
|
|
34
|
+
s = i < 0? z[k].x : (int32_t)z[k].x - f[i];
|
|
35
|
+
if (s > max_s) max_s = s, max_i = i;
|
|
36
|
+
else if (max_s - s > max_drop) break;
|
|
37
|
+
} while (i >= 0 && t[i] == 0);
|
|
38
|
+
for (i = z[k].y; i >= 0 && i != end_i; i = p[i]) // reset modified t[]
|
|
39
|
+
t[i] = 0;
|
|
40
|
+
return max_i;
|
|
41
|
+
}
|
|
42
|
+
|
|
43
|
+
static uint64_t *mb_chain_backtrack(void *km, int64_t n, const int32_t *f, const int64_t *p, int32_t *v, int32_t *t, int32_t min_sc, int32_t max_drop, int32_t *n_u_, int32_t *n_v_)
|
|
44
|
+
{
|
|
45
|
+
mb128_t *z;
|
|
46
|
+
uint64_t *u;
|
|
47
|
+
int64_t i, k, n_z, n_v;
|
|
48
|
+
int32_t n_u;
|
|
49
|
+
|
|
50
|
+
*n_u_ = *n_v_ = 0;
|
|
51
|
+
for (i = 0, n_z = 0; i < n; ++i) // precompute n_z
|
|
52
|
+
if (f[i] >= min_sc) ++n_z;
|
|
53
|
+
if (n_z == 0) return 0;
|
|
54
|
+
z = Kmalloc(km, mb128_t, n_z);
|
|
55
|
+
for (i = 0, k = 0; i < n; ++i) // populate z[]
|
|
56
|
+
if (f[i] >= min_sc) z[k].x = f[i], z[k++].y = i;
|
|
57
|
+
radix_sort_mb128x(z, z + n_z);
|
|
58
|
+
|
|
59
|
+
memset(t, 0, n * 4);
|
|
60
|
+
for (k = n_z - 1, n_v = n_u = 0; k >= 0; --k) { // precompute n_u
|
|
61
|
+
if (t[z[k].y] == 0) {
|
|
62
|
+
int64_t n_v0 = n_v, end_i;
|
|
63
|
+
int32_t sc;
|
|
64
|
+
end_i = mb_chain_bk_end(max_drop, z, f, p, t, k);
|
|
65
|
+
for (i = z[k].y; i != end_i; i = p[i])
|
|
66
|
+
++n_v, t[i] = 1;
|
|
67
|
+
sc = i < 0? z[k].x : (int32_t)z[k].x - f[i];
|
|
68
|
+
if (sc >= min_sc && n_v > n_v0)
|
|
69
|
+
++n_u;
|
|
70
|
+
else n_v = n_v0;
|
|
71
|
+
}
|
|
72
|
+
}
|
|
73
|
+
u = Kmalloc(km, uint64_t, n_u);
|
|
74
|
+
memset(t, 0, n * 4);
|
|
75
|
+
for (k = n_z - 1, n_v = n_u = 0; k >= 0; --k) { // populate u[]
|
|
76
|
+
if (t[z[k].y] == 0) {
|
|
77
|
+
int64_t n_v0 = n_v, end_i;
|
|
78
|
+
int32_t sc;
|
|
79
|
+
end_i = mb_chain_bk_end(max_drop, z, f, p, t, k);
|
|
80
|
+
for (i = z[k].y; i != end_i; i = p[i])
|
|
81
|
+
v[n_v++] = i, t[i] = 1;
|
|
82
|
+
sc = i < 0? z[k].x : (int32_t)z[k].x - f[i];
|
|
83
|
+
if (sc >= min_sc && n_v > n_v0)
|
|
84
|
+
u[n_u++] = (uint64_t)sc << 32 | (n_v - n_v0);
|
|
85
|
+
else n_v = n_v0;
|
|
86
|
+
}
|
|
87
|
+
}
|
|
88
|
+
kfree(km, z);
|
|
89
|
+
assert(n_v < INT32_MAX);
|
|
90
|
+
*n_u_ = n_u, *n_v_ = n_v;
|
|
91
|
+
return u;
|
|
92
|
+
}
|
|
93
|
+
|
|
94
|
+
static mb_anchor_t *compact_a(void *km, const l2b_t *l2b, int32_t n_u, uint64_t *u, int32_t n_v, int32_t *v, mb_anchor_t *a)
|
|
95
|
+
{
|
|
96
|
+
mb_anchor_t *b;
|
|
97
|
+
mb128_t *w;
|
|
98
|
+
uint64_t *u2;
|
|
99
|
+
int64_t i, j, k;
|
|
100
|
+
|
|
101
|
+
// write the result to b[]
|
|
102
|
+
b = Kmalloc(km, mb_anchor_t, n_v);
|
|
103
|
+
for (i = 0, k = 0; i < n_u; ++i) {
|
|
104
|
+
int32_t k0 = k, ni = (int32_t)u[i];
|
|
105
|
+
for (j = 0; j < ni; ++j)
|
|
106
|
+
b[k++] = a[v[k0 + (ni - j - 1)]];
|
|
107
|
+
}
|
|
108
|
+
kfree(km, v);
|
|
109
|
+
|
|
110
|
+
// sort u[] and a[] by the target position, such that adjacent chains may be joined
|
|
111
|
+
w = Kmalloc(km, mb128_t, n_u);
|
|
112
|
+
for (i = k = 0; i < n_u; ++i) {
|
|
113
|
+
const l2b_ctg_t *ctg = &l2b->ctg[b[k].sid>>1];
|
|
114
|
+
w[i].x = b[k].tpos + ctg->off * 2 + ctg->len * (b[k].sid&1);
|
|
115
|
+
w[i].y = (uint64_t)k<<32 | i;
|
|
116
|
+
k += (int32_t)u[i];
|
|
117
|
+
}
|
|
118
|
+
radix_sort_mb128x(w, w + n_u);
|
|
119
|
+
u2 = Kmalloc(km, uint64_t, n_u);
|
|
120
|
+
for (i = k = 0; i < n_u; ++i) {
|
|
121
|
+
int32_t j = (int32_t)w[i].y, n = (int32_t)u[j];
|
|
122
|
+
u2[i] = u[j];
|
|
123
|
+
memcpy(&a[k], &b[w[i].y>>32], n * sizeof(mb_anchor_t));
|
|
124
|
+
k += n;
|
|
125
|
+
}
|
|
126
|
+
memcpy(u, u2, n_u * 8);
|
|
127
|
+
memcpy(b, a, k * sizeof(mb_anchor_t)); // write _a_ to _b_ and deallocate _a_ because _a_ is oversized, sometimes a lot
|
|
128
|
+
kfree(km, u2); kfree(km, w); kfree(km, a);
|
|
129
|
+
return b;
|
|
130
|
+
}
|
|
131
|
+
|
|
132
|
+
// Compute chaining score between two anchors
|
|
133
|
+
static inline int32_t comput_sc(const mb_anchor_t *ai, const mb_anchor_t *aj, int32_t max_dist_x, int32_t max_dist_y, int32_t bw, float chn_pen_gap)
|
|
134
|
+
{
|
|
135
|
+
int64_t dq = ai->qpos - aj->qpos, dr, dd, dg, sc;
|
|
136
|
+
if (dq <= 0 || dq > max_dist_y + ai->len) return INT32_MIN;
|
|
137
|
+
// Check if on same target; use tid for comparison
|
|
138
|
+
if (ai->sid != aj->sid) return INT32_MIN;
|
|
139
|
+
dr = ai->tpos - aj->tpos;
|
|
140
|
+
if (dr <= 0 || dq > max_dist_x + ai->len) return INT32_MIN;
|
|
141
|
+
dd = dr > dq? dr - dq : dq - dr;
|
|
142
|
+
if (dd > bw) return INT32_MIN;
|
|
143
|
+
dg = dr < dq? dr : dq;
|
|
144
|
+
// Use successor span for variable-length anchors (SMEMs)
|
|
145
|
+
sc = ai->len < dg? ai->len : dg;
|
|
146
|
+
if (dd) { // with a gap
|
|
147
|
+
float lin_pen, log_pen;
|
|
148
|
+
lin_pen = chn_pen_gap * (float)dd;
|
|
149
|
+
log_pen = dd >= 1? mb_log2(dd + 1) : 0.0f;
|
|
150
|
+
sc -= (int)(lin_pen + .5f * log_pen);
|
|
151
|
+
}
|
|
152
|
+
return sc;
|
|
153
|
+
}
|
|
154
|
+
|
|
155
|
+
/* Input:
|
|
156
|
+
* a[].sid: target sequence ID (tid<<1|rev)
|
|
157
|
+
* a[].tpos: target coordinate of the last base
|
|
158
|
+
* a[].qpos: query coordinate of the last base
|
|
159
|
+
* a[].len: seed length (q_span)
|
|
160
|
+
* Output:
|
|
161
|
+
* n_u: #chains
|
|
162
|
+
* u[]: score<<32 | #anchors (sum of lower 32 bits of u[] is the returned length of a[])
|
|
163
|
+
* input a[] is deallocated on return
|
|
164
|
+
*/
|
|
165
|
+
mb_anchor_t *mb_lchain_dp(void *km, const l2b_t *l2b, int max_dist_x, int max_dist_y, int bw, int max_skip, int max_iter, int min_sc, float chn_pen_gap,
|
|
166
|
+
int64_t n, mb_anchor_t *a, int *n_u_, uint64_t **_u)
|
|
167
|
+
{ // TODO: make sure this works when n has more than 32 bits
|
|
168
|
+
int32_t *f, *t, *v, n_u, n_v, mmax_f = 0, max_drop = bw;
|
|
169
|
+
int64_t *p, i, j, max_ii;
|
|
170
|
+
uint64_t *u;
|
|
171
|
+
|
|
172
|
+
if (_u) *_u = 0, *n_u_ = 0;
|
|
173
|
+
if (n == 0 || a == 0) {
|
|
174
|
+
kfree(km, a);
|
|
175
|
+
return 0;
|
|
176
|
+
}
|
|
177
|
+
if (max_dist_x < bw) max_dist_x = bw;
|
|
178
|
+
if (max_dist_y < bw) max_dist_y = bw;
|
|
179
|
+
v = Kmalloc(km, int32_t, n);
|
|
180
|
+
p = Kmalloc(km, int64_t, n);
|
|
181
|
+
f = Kmalloc(km, int32_t, n);
|
|
182
|
+
t = Kcalloc(km, int32_t, n);
|
|
183
|
+
|
|
184
|
+
// fill the score and backtrack arrays
|
|
185
|
+
for (i = 0, max_ii = -1; i < n; ++i) {
|
|
186
|
+
int64_t max_j = -1, end_j;
|
|
187
|
+
int32_t max_f = a[i].len, n_skip = 0;
|
|
188
|
+
for (j = i - 1; j >= 0 && j >= i - max_iter; --j) {
|
|
189
|
+
int32_t sc;
|
|
190
|
+
if (a[i].tpos - a[j].tpos >= max_dist_x + a[i].len) break;
|
|
191
|
+
sc = comput_sc(&a[i], &a[j], max_dist_x, max_dist_y, bw, chn_pen_gap);
|
|
192
|
+
if (sc == INT32_MIN) continue;
|
|
193
|
+
sc += f[j];
|
|
194
|
+
if (sc > max_f) {
|
|
195
|
+
max_f = sc, max_j = j;
|
|
196
|
+
if (n_skip > 0) --n_skip;
|
|
197
|
+
} else if (t[j] == (int32_t)i) {
|
|
198
|
+
if (++n_skip > max_skip)
|
|
199
|
+
break;
|
|
200
|
+
}
|
|
201
|
+
if (p[j] >= 0) t[p[j]] = i;
|
|
202
|
+
}
|
|
203
|
+
end_j = j;
|
|
204
|
+
if (max_ii < 0 || a[i].tpos - a[max_ii].tpos > max_dist_x + a[i].len) {
|
|
205
|
+
int32_t max = INT32_MIN;
|
|
206
|
+
max_ii = -1; // the index of the best score. Rescue in case the best is missed due to the max_skip heuristic
|
|
207
|
+
for (j = i - 1; j >= end_j && j >= 0; --j)
|
|
208
|
+
if (max < f[j]) max = f[j], max_ii = j;
|
|
209
|
+
}
|
|
210
|
+
if (max_ii >= 0 && max_ii < end_j) {
|
|
211
|
+
int32_t tmp;
|
|
212
|
+
tmp = comput_sc(&a[i], &a[max_ii], max_dist_x, max_dist_y, bw, chn_pen_gap);
|
|
213
|
+
if (tmp != INT32_MIN && max_f < tmp + f[max_ii])
|
|
214
|
+
max_f = tmp + f[max_ii], max_j = max_ii;
|
|
215
|
+
}
|
|
216
|
+
f[i] = max_f, p[i] = max_j;
|
|
217
|
+
v[i] = max_j >= 0 && v[max_j] > max_f? v[max_j] : max_f; // v[] keeps the peak score up to i; f[] is the score ending at i, not always the peak
|
|
218
|
+
if (max_ii < 0 || (a[i].tpos - a[max_ii].tpos <= max_dist_x + a[i].len && f[max_ii] < f[i]))
|
|
219
|
+
max_ii = i;
|
|
220
|
+
if (mmax_f < max_f) mmax_f = max_f;
|
|
221
|
+
}
|
|
222
|
+
|
|
223
|
+
u = mb_chain_backtrack(km, n, f, p, v, t, min_sc, max_drop, &n_u, &n_v);
|
|
224
|
+
*n_u_ = n_u, *_u = u; // NB: note that u[] may not be sorted by score here
|
|
225
|
+
kfree(km, t); kfree(km, f); kfree(km, p);
|
|
226
|
+
if (n_u == 0) {
|
|
227
|
+
kfree(km, a); kfree(km, v);
|
|
228
|
+
return 0;
|
|
229
|
+
}
|
|
230
|
+
return compact_a(km, l2b, n_u, u, n_v, v, a);
|
|
231
|
+
}
|