| ... | ... | @@ -87,6 +87,19 @@ |
| 87 | 87 | case DIGIT: \ |
| 88 | 88 | case '_' |
| 89 | 89 | |
| 90 | enum TokenizeState { |
| 91 | TokenizeStateStart, |
| 92 | TokenizeStateSymbol, |
| 93 | TokenizeStateNumber, |
| 94 | TokenizeStateString, |
| 95 | TokenizeStateSawDash, |
| 96 | TokenizeStateSawSlash, |
| 97 | TokenizeStateLineComment, |
| 98 | TokenizeStateMultiLineComment, |
| 99 | TokenizeStateMultiLineCommentSlash, |
| 100 | TokenizeStateMultiLineCommentStar, |
| 101 | }; |
| 102 | |
| 90 | 103 | |
| 91 | 104 | struct Tokenize { |
| 92 | 105 | Buf *buf; |
| ... | ... | @@ -96,6 +109,7 @@ struct Tokenize { |
| 96 | 109 | int line; |
| 97 | 110 | int column; |
| 98 | 111 | Token *cur_tok; |
| 112 | int multi_line_comment_count; |
| 99 | 113 | }; |
| 100 | 114 | |
| 101 | 115 | __attribute__ ((format (printf, 2, 3))) |
| ... | ... | @@ -222,8 +236,78 @@ ZigList<Token> *tokenize(Buf *buf) { |
| 222 | 236 | begin_token(&t, TokenIdNumberSign); |
| 223 | 237 | end_token(&t); |
| 224 | 238 | break; |
| 239 | case '/': |
| 240 | t.state = TokenizeStateSawSlash; |
| 241 | break; |
| 242 | default: |
| 243 | tokenize_error(&t, "invalid character: '%c'", c); |
| 244 | } |
| 245 | break; |
| 246 | case TokenizeStateSawSlash: |
| 247 | switch (c) { |
| 248 | case '/': |
| 249 | t.state = TokenizeStateLineComment; |
| 250 | break; |
| 251 | case '*': |
| 252 | t.state = TokenizeStateMultiLineComment; |
| 253 | t.multi_line_comment_count = 1; |
| 254 | break; |
| 225 | 255 | default: |
| 226 | 256 | tokenize_error(&t, "invalid character: '%c'", c); |
| 257 | break; |
| 258 | } |
| 259 | break; |
| 260 | case TokenizeStateLineComment: |
| 261 | switch (c) { |
| 262 | case '\n': |
| 263 | t.state = TokenizeStateStart; |
| 264 | break; |
| 265 | default: |
| 266 | // do nothing |
| 267 | break; |
| 268 | } |
| 269 | break; |
| 270 | case TokenizeStateMultiLineComment: |
| 271 | switch (c) { |
| 272 | case '*': |
| 273 | t.state = TokenizeStateMultiLineCommentStar; |
| 274 | break; |
| 275 | case '/': |
| 276 | t.state = TokenizeStateMultiLineCommentSlash; |
| 277 | break; |
| 278 | default: |
| 279 | // do nothing |
| 280 | break; |
| 281 | } |
| 282 | break; |
| 283 | case TokenizeStateMultiLineCommentSlash: |
| 284 | switch (c) { |
| 285 | case '*': |
| 286 | t.state = TokenizeStateMultiLineComment; |
| 287 | t.multi_line_comment_count += 1; |
| 288 | break; |
| 289 | case '/': |
| 290 | break; |
| 291 | default: |
| 292 | t.state = TokenizeStateMultiLineComment; |
| 293 | break; |
| 294 | } |
| 295 | break; |
| 296 | case TokenizeStateMultiLineCommentStar: |
| 297 | switch (c) { |
| 298 | case '/': |
| 299 | t.multi_line_comment_count -= 1; |
| 300 | if (t.multi_line_comment_count == 0) { |
| 301 | t.state = TokenizeStateStart; |
| 302 | } else { |
| 303 | t.state = TokenizeStateMultiLineComment; |
| 304 | } |
| 305 | break; |
| 306 | case '*': |
| 307 | break; |
| 308 | default: |
| 309 | t.state = TokenizeStateMultiLineComment; |
| 310 | break; |
| 227 | 311 | } |
| 228 | 312 | break; |
| 229 | 313 | case TokenizeStateSymbol: |
| ... | ... | @@ -295,7 +379,18 @@ ZigList<Token> *tokenize(Buf *buf) { |
| 295 | 379 | case TokenizeStateSawDash: |
| 296 | 380 | end_token(&t); |
| 297 | 381 | break; |
| 382 | case TokenizeStateSawSlash: |
| 383 | tokenize_error(&t, "unexpected EOF"); |
| 384 | break; |
| 385 | case TokenizeStateLineComment: |
| 386 | break; |
| 387 | case TokenizeStateMultiLineComment: |
| 388 | case TokenizeStateMultiLineCommentSlash: |
| 389 | case TokenizeStateMultiLineCommentStar: |
| 390 | tokenize_error(&t, "unterminated multi-line comment"); |
| 391 | break; |
| 298 | 392 | } |
| 393 | t.pos = -1; |
| 299 | 394 | begin_token(&t, TokenIdEof); |
| 300 | 395 | end_token(&t); |
| 301 | 396 | assert(!t.cur_tok); |
| ... | ... | @@ -333,9 +428,11 @@ static const char * token_name(Token *token) { |
| 333 | 428 | void print_tokens(Buf *buf, ZigList<Token> *tokens) { |
| 334 | 429 | for (int i = 0; i < tokens->length; i += 1) { |
| 335 | 430 | Token *token = &tokens->at(i); |
| 336 | | printf("%s ", token_name(token)); |
| 337 | | fwrite(buf_ptr(buf) + token->start_pos, 1, token->end_pos - token->start_pos, stdout); |
| 338 | | printf("\n"); |
| 431 | fprintf(stderr, "%s ", token_name(token)); |
| 432 | if (token->start_pos >= 0) { |
| 433 | fwrite(buf_ptr(buf) + token->start_pos, 1, token->end_pos - token->start_pos, stderr); |
| 434 | } |
| 435 | fprintf(stderr, "\n"); |
| 339 | 436 | } |
| 340 | 437 | } |
| 341 | 438 | |